Brookerは2026年9月28日に、独自の小型モデル「Hobson」を開発したことを発表しました。このモデルは、既存のLLMをベースに特定の構造を採用することで、高い精度とキャリブレーション(予測の正確な信頼度付け)の両立を目指しています。
高い精度とキャリブレーションを実現する構造
Hobsonは、Qwen3.5-2Bをベースモデルとして採用しています。従来のLLMの出力層(LM head)を、選択肢のスコアを算出する「pointer head」に置き換える手法を用いています。このpointer headは、各選択肢の位置にある隠れ状態を、回答位置の隠れ状態と照らし合わせてスコア化する仕組みです。このアプローチにより、従来のLLMのロジットをそのまま読み取る方法よりも、優れたキャリブレーションを実現しています。
評価指標における性能
JevBenchの公開データセットにおいて、Hobsonは同サイズ帯でトップの性能を示しています。Qwen3.5-2Bと比較して、キャリブレーション(Brier score)と精度の両面で上回る結果を出しています。特にJevBenchの「easy」セットにおいては、精度100%を記録し、Brier scoreは0.009という非常に優れたキャリブレーション性能を示しています。
低コストかつ低遅延な推論
推論処理は、質問の数に関わらず1回または2回のフォワードパスで完了するため、O(1)の計算量を実現しています。検証環境であるGeForce RTX 3090を用いた測定では、p50レイテンシは100ミリ秒強、p95レイテンシは300ミリ秒未満でした。質問の数が増えた際のレイテンシは、フォワードパスのキャッシュを活用することで、非常に良好なスケーラビリティを維持しています。
