2026年7月23日、Microsoftは生成AI向け新モデル「MAI-Image-2.5-Pro」と「MAI-Voice-2-Flash」の公開プレビューを開始した。これらは同社の既存プロダクションモデルに加え、品質・速度・コストのバランスを選べるオプションとして提供される。
Microsoftは、一昨年に自社で目的別モデルの開発を開始し、現在ではBingやPowerPointなど主要製品の基盤として既に稼働させていると発表した。
今回の新モデルは、クリエイター向けの高忠実度生成からコールセンターのような大量処理まで、用途に応じた選択肢を拡張するもの。MAI-Image-2.5-Proはテキストの高精度なレンダリングや自然言語による編集理解に対応し、MAI-Voice-2-Flashは低遅延かつ表現豊かな音声合成を実現している。
これらのモデルは既にMicrosoft製品群に統合され、実証された実績を上げている。Bing Image Creatorでは100%自社モデルへ移行し、PowerPointではGPUコストを最大84%削減。OneDriveの画像編集シナリオでは保存率が26%向上し、レイテンシーが約25%短縮された。
また、Dynamics 365 Contact CenterやAzure Voice Liveでも採用され、コールセンター環境におけるGPUコストは最大89%削減されている。医療分野ではDragon Copilotと連携し、多言語ワークフローに対応したMAI-Transcribe-1.5が導入され、エラー率を相対で50%低減している。
MicrosoftはこれらのモデルをFoundryやMAI Playgroundを通じて試すことができると案内している。
