ベンチマーク
-
-
Hume、Gemini 3.8 Flashの音声性能を評価し首位に選出
-
OpenAI、メンタルヘルス会話を評価する新指標を発表
-
TypeSafe AI、ベンチマークへの過度な最適化を批判
-
Amazon BedrockのOpenAIモデル、成果ベースのコストで比較
-
xAIのGrok 4.6、生物学的リスクへの耐性と研究支援を両立
-
Google DeepMindが独自AIの二重盲検評価パイロットを開始
-
音声認識モデルがベンチマークの誤りを再現する問題を指摘
-
Google、LLMの事実誤認は「知識の欠如」ではなく「想起の失敗」と指摘
-
AIチューターが適切な介入を判断できるか評価する「TutorMoments」