AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

Google、LLMの事実誤認は「知識の欠如」ではなく「想起の失敗」と指摘

,
Google Researchによる、LLMの知識保持率と想起率の比較を示すグラフ。

https://storage.googleapis.com/gweb-research2023-media/images/HO_previewImage1.width-800.format-jpeg.jpg

Google Researchは2026年8月12日、大規模言語モデル(LLM)が事実を誤える原因を分析する「知識プロファイリング」というフレームワークを発表しました。最新のモデルにおいて、事実誤認の主な要因は知識が学習されていないことではなく、学習済みでありながら引き出せていないことにあると明らかにしています。

知識の「保持」と「想起」を分離して分析

Google Researchは、LLMが事実を誤る原因を「知識のエンコーディング(符号化・保持)」と「リコール(想起)」の2つの観点から測定する手法を導入しました。従来の精度指標では、知識自体がない場合と、知識はあるが引き出せない場合が区別されていませんでした。

同社は、Wikipediaから抽出した2,150の事実を用いたベンチマーク「WikiProfile」を構築し、Gemini 3やGPT-5を含む13のモデルを検証しました。その結果、最先端のモデルでは事実の保持率は95〜98%に達しており、知識の保持は飽和状態に近いことが判明しました。

課題は知識の獲得から「活用」へ

一方で、保持されている知識を直接引き出せる割合には課題が残っています。Gemini 3 ProやGPT-5では、保持している事実の26〜34%を直接想起できず、思考プロセスを挟んでも11〜12%の事実については想起に失敗しています。

この結果から、モデルの規模を拡大しても知識の保持量は増えるものの、想起の失敗は依然として大きな割合を占めることが示されました。また、珍しい事実に関する誤答も、知識が欠如しているのではなく、想起が困難であることが要因であると指摘しています。

「思考」による想起の促進

モデルが推論を行う「思考」プロセスは、直接的な想起が困難な事実の40〜65%を救い出す効果があるとしています。これは、思考が新しい知識を導き出すためではなく、既に保持されている知識へのアクセスを助けるメカニズムとして機能していることを示唆しています。

発表元: https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/