PrismMLは2026年9月17日に、モデルサイズを大幅に削減しながら高い性能を維持する「Ternary Bonsai 2 27B」を発表しました。このモデルは、Qwen3.8 27Bをベースに、推論やコーディング、視覚能力などの重要な指標において、フル精度モデルの98.2%の性能を保持しています。
圧縮による展開範囲の拡大
Ternary Bonsai 2 27Bは、重みに{−1, 0, +1}の3値を用いることで、モデルの占有容量を5.9GBまで削減しました。これはフル精度のモデルと比較して9倍以上小さいサイズです。低ビット化による性能低下を抑えつつ、メモリ使用量を劇的に抑えることで、より多くのデバイスでの動作を可能にします。
高い性能保持率とマルチモーダル対応
本モデルは、推論、数学、コーディング、指示追従、視覚、エージェント機能のベンチマークにおいて、フル精度モデルの98.2%に相当するスコア83.9を記録しています。特に、エラーの蓄積が課題となるコーディングエージェントやツール利用、マルチモーダルなワークフローにおいて、高い性能を維持している点が特徴です。また、262Kトークンの長いコンテキストウィンドウと、テキストおよび画像の入力をサポートしています。
高いスループットとエネルギー効率
実行速度についても、NVIDIA GeForce RTX 5090において最大143トークン/秒、M5 Maxにおいて46.8トークン/秒に達します。エネルギー効率の面では、RTX 4090での消費電力が1トークンあたり0.714mWhであり、フル精度で動作する8Bモデルよりも40%高いエネルギー効率を実現しています。
