Google Cloudは2026年8月26日に、オープンソースの推論エンジン「vLLM」をCloud TPUでネイティブにサポートしたと発表しました。これにより、大規模な埋め込みモデルの推論をTPU上で、高い精度を維持したまま実行できるようになります。
拡張性と精度の両立を実現
従来の埋め込みモデルの運用では、トラフィックの変動に応じた計算リソースの動的なスケーリングや、コスト効率の向上が課題となっていました。Google CloudはvLLMをTPUでサポートすることで、TPUノードを直接プロビジョニングして推論容量を動的に増減できる、真の弾力性を提供します。
長大なコンテキストへの対応
次世代の埋め込みモデルでは、テキストで4,000トークン以上、テキストと画像のマルチモーダル入力では15,000トークンを超える超長大なコンテキスト処理が求められます。これに対し、メモリ不足を防ぐための「Chunked Prefill」技術などを導入し、リクエストの割り込みが発生しても状態を維持できる仕組みを構築しました。
数値的な一貫性を保証
ハードウェアの違いによる計算誤差を防ぐため、厳格な数学的整合性の検証が行われています。テキストでは0.999以上、マルチモーダル入力では0.995以上のコサイン類似度を合格基準として設定し、TPU上でもリファレンス(基準)と同等の高い精度を維持できることを確認しています。
