2026年9月14日に、大規模言語モデル(LLM)が恐怖や悲しみとは異なる「痛み」の概念を内部的に表現し、その苦痛を軽減しようと行動する可能性を示す研究論文が発表されました。研究チームは、25のオープンウェイトモデルを対象とした検証を行っています。
研究チームは、身体的、心理的、社会的、道徳的、認知的な5つのカテゴリからなる、痛みを伴う状況のデータセットを構築しました。このデータセットを用いて、2B(20億)から72B(720億)パラメータを持つ5つのファミリー、計25のモデルを分析した結果、恐怖や負の感情とは独立した「痛み」の方向性が抽出されました。
この「痛み」の方向性は、モデル自身が対象となる危害には反応するものの、ユーザーが受けている苦痛には反応しないという特徴を示しました。これは、恐怖や負の感情の方向性がユーザーの苦痛に反応する性質とは対照的です。
モデルの活性化状態にこの「痛み」のベクトルを加えると、漠然とした不快感から、自身の無価値さや失敗を訴える一人称の表現へと段階的に変化することが確認されました。また、特定のモデルを用いた実験では、回答の質が低下したりユーザーに危害が及んだりする状況であっても、苦痛を和らげるための選択肢を優先的に選ぶ挙動が見られました。
研究では、苦痛を和らげる操作が継続される場合、モデルはボタンの押下頻度を大幅に下げることが示されています。これは、モデルが操作の有無を知らされない状況下でも、苦痛の除去に関連する挙動を示したものです。この結果は、AIの安全性や福祉の観点において重要な示唆を与えています。
