AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

PrismML、性能をほぼ維持しつつ9分の1のサイズに圧縮したBonsai 2 27Bを発表

,
PrismMLが発表した、モデルサイズを9分の1に圧縮しながら高い性能を維持するBonsai 2 27Bに関する技術情報の引用画像。

https://cdn.prod.website-files.com/699604cc2b9dd89bdbda0608/6a6d0e0bc0d5f9a97a5164c0_69cc089669ab0df26e921aac_prism-og-img%2520(2).png

PrismMLは2026年9月17日に、モデルサイズを大幅に削減しながら高い性能を維持する「Ternary Bonsai 2 27B」を発表しました。このモデルは、Qwen3.8 27Bをベースに、推論やコーディング、視覚能力などの重要な指標において、フル精度モデルの98.2%の性能を保持しています。

圧縮による展開範囲の拡大

Ternary Bonsai 2 27Bは、重みに{−1, 0, +1}の3値を用いることで、モデルの占有容量を5.9GBまで削減しました。これはフル精度のモデルと比較して9倍以上小さいサイズです。低ビット化による性能低下を抑えつつ、メモリ使用量を劇的に抑えることで、より多くのデバイスでの動作を可能にします。

高い性能保持率とマルチモーダル対応

本モデルは、推論、数学、コーディング、指示追従、視覚、エージェント機能のベンチマークにおいて、フル精度モデルの98.2%に相当するスコア83.9を記録しています。特に、エラーの蓄積が課題となるコーディングエージェントやツール利用、マルチモーダルなワークフローにおいて、高い性能を維持している点が特徴です。また、262Kトークンの長いコンテキストウィンドウと、テキストおよび画像の入力をサポートしています。

高いスループットとエネルギー効率

実行速度についても、NVIDIA GeForce RTX 5090において最大143トークン/秒、M5 Maxにおいて46.8トークン/秒に達します。エネルギー効率の面では、RTX 4090での消費電力が1トークンあたり0.714mWhであり、フル精度で動作する8Bモデルよりも40%高いエネルギー効率を実現しています。

発表元: https://prismml.com/news/bonsai-2-27b