Mapikaは2026年9月27日、Qwen3.5をベースに調整された、判断業務に特化したモデル「decider-2b-v11」を発表しました。このモデルはテキスト生成を行わず、与えられた選択肢の中から確率分布を返すことに特化した設計となっています。
判断の精度と信頼性の向上
今回のv11は、前バージョンのv10と比較して、より難易度の高い判断タスクにおいて精度を向上させています。具体的には、生成された判断データセットにおいて精度が0.324から0.429へ、ドキュメントに関する質問では0.646から0.753へと上昇しました。また、JevBenchのハードティアにおける精度も0.459から0.577へと向上し、より複雑な決定における信頼性が高まっています。
特徴的な設計と学習手法
このモデルは、状態と選択肢のリストを入力として受け取り、一回のフォワードパスで各質問に対する確率分布を返します。デコードやパースの工程を必要とせず、ソフトウェアから呼び出されることを前提とした設計です。学習においては、回答のタイプごとに異なる温度パラメータを適用する手法が導入されています。
性能のトレードオフ
一方で、高度な判断能力の向上に伴い、一部の日常的なタスクやゲームのタスクでは精度が低下する傾向も見られます。例えば、bag-draw gamesの勝率は57.8%から46.9%へと低下しました。Mapikaは、日常的な回答の傾向を維持するために、v10の回答分布に近づけるリプレイ学習を取り入れています。
