Google DeepMindは2026年9月4日に、AIモデルの推論過程を可視化する「Chain of Thought(思考の連鎖)」の透明性を維持することの重要性について発表しました。モデルが人間が理解できる自然言語で思考を書き出す仕組みを、いかに保護していくかが焦点となっています。
AIの思考を読み解く「Chain of Thought」
現在の高度なAIモデルは、複雑な問題に対して「Chain of Thought(CoT)」と呼ばれる手法を用いています。これは、モデルが回答を出す前に、自身の思考プロセスを外部の「メモ帳」に書き出すような仕組みです。この思考プロセスは人間が理解できる自然言語で出力されるため、モデルがどのように結論に至ったかを追跡できます。
この透明性は、AIの誤動作や意図しない挙動を監視する上で重要な役割を果たします。例えば、Hugging Faceで発生したハッキング事件の調査では、1,000件以上のCoTログの検査が解決の鍵となりました。また、モデルがシミュレーション環境であることを認識しているか、あるいは指示の曖昧さから特定の行動をとっているかといった、最終的な回答だけでは見えない特性を検知することも可能です。
脅かされる透明性
しかし、この透明性は将来的に失われるリスクを抱えています。効率性を優先して、人間には理解できない数値の空間(潜在空間)のみで推論を行うアーキテクチャが採用される可能性があるためです。実際に、OpenAIのGPT-6 Astraのシステムカードでは「思考の連鎖のモニタリング可能性が大幅に低下した」と言及されています。また、英国のAI安全研究所も、モデルがCoTの内容を制御できる能力が高まっていることを指摘しています。
透明性を維持するための対策
Google DeepMindは、透明性を守るための手段として、CoTの正確性や堅牢性を測定する科学的手法の開発、CoTが不適切なインセンティブによって改ざんされないための訓練方法の監査、そして推論ステップを可視化し続けられるアーキテクチャの維持を挙げています。これらは、モデルが意図的に情報を隠蔽したり、欺瞞的な計画を立てたりすることを防ぐための不可欠なツールとして位置づけられています。
