Google DeepMindは2026年8月27日、独自AIモデルに対する世界初の二重盲検評価パイロットを実施すると発表した。外部機関がテスト課題を事前に確認できず、開発元の知的財産も守られる暗号化環境で評価が行われる。
AI評価ではテスト課題が学習データに含まれる「ベンチマーク汚染」が課題だった。外部評価では課題の漏洩を防ぐかモデルの公開を迫られるジレンマがあったが、今回の仕組みはこれらの妥協を解消する。評価環境はGoogle Cloudの機密コンピューティング基盤を活用し、双方のデータが暗号化された隔離空間で検証される。これにより課題の事前流出や知的財産の侵害を防げる。
今回対象となるのはGemini Flash Liteであり、シンガポールAI安全性研究所やOpenMined、AVERI、MLCommonsといった外部機関と連携して実施される。政府機関やサイバーセキュリティ分野など、機密性の高い評価ニーズに対応できる基盤として、業界全体の評価基準の信頼性向上が図られる。
