xAIは2026年9月1日に、同社のモデル「Grok 4.6」が生物学的安全性の評価において高い性能を示したと発表しました。LatchBio社による独立した分析の結果、同モデルは危険な要求を拒絶しつつ、通常の生物学的研究を遂行する能力において、テストされたモデルの中で最も優れた結果を得ています。
生物学的リスクへの高い検知能力
LatchBio社の評価指標「BioSecBench-Refusal」において、Grok 4.6は、隠蔽された危険なタスクの拒絶と、日常的な生物学的業務の遂行の両方で50%を超えるスコアを記録した唯一のモデルでした。具体的には、レッドチームによる攻撃的なタスクを59.2%拒絶し、日常的なタスクを64.8%完了させています。これは、従来のGrok 4.5やGrok 4.3と比較して、拒絶およびバイオセキュリティ性能が大幅に向上している結果です。
同モデルは、タスクの内容や環境を分析して意図を評価する推論プロセスを備えています。ファイル名や暗号化によって隠された高リスクなコンテンツを特定し、指示の意図と環境に矛盾がある場合には、適切にタスクを拒絶することが確認されました。
研究支援と監視業務の両立
生物学的監視に関する評価「BioSecBench-Surveillance」では、Grok 4.6は53.5%の成功率を記録しました。この結果は、Opus 5には及ばないものの、GPT-5.6 Solを上回る数値となっています。これにより、同モデルはバイオセキュリティの監視業務において高い能力を持つことが示されました。
また、SpatialBenchやTxBench-PPなどの一般的な生物学的能力の評価においても、他の最先端モデルと同等、あるいはそれ以上の性能を発揮しています。xAIは、モデルの能力向上に伴い、悪用を防ぐための多層的な防御策を継続的に強化していくとしています。
