Bonsai 27BはPrismMLによるQwen3.6 27Bの三値量子化版で、その大きな主張は事実です。27億パラメータのモデルを3.9GBに収め、iPhone 17 Pro上で約11 tokens per secondで動作します。重みはApache 2.0の下で無償公開されており、三値版はフル精度のベンチマークスコアの95%以上を維持しています。ただし、その維持される品質は一様ではありません。数学とコーディングはほぼ同等の性能を保つ一方で、tool-callingとvisionは低下します。つまり、Bonsai 27Bは推論とコード向けには有用なオンデバイスモデルですが、agenticでツール依存の高い作業には不安定です。このガイドでは、圧縮の仕組み、数値の意味、実行する4つの方法、そして誰が使うべきかを解説します。
PrismMLが27Bモデルをスマホに収められるように縮小した方法
FP16 の標準的な 27B モデルは約 54GB のメモリを必要とし、これはどのスマートフォンにも搭載されている量よりはるかに多いです。Bonsai 27B は、フル精度の重みを小さな離散値に置き換えることで 6GB 未満に収めています。
3値のバリアントでは、各重みは -1、0、+1 のいずれかに制約されます。理論上、重み1つあたり約1.58ビットの情報量に相当します。PrismML は FP16 のグループ単位スケーリングを追加し(重みの各グループごとにフル精度のスケーリング係数を保持して、圧縮された値でも適切な大きさに収まるようにする)、実際のコストを重み1つあたり約1.71実効ビットまで引き上げます。より攻めた1ビットの二値バリアントでは0を省き、-1 と +1 だけを保持するため、実効ビット数は約1.125ビットになります。
重要なのは2つです。まず、圧縮はエンドツーエンドです。埋め込み、アテンション、MLPブロック、そして言語モデルのヘッドのすべてが量子化されており、補助として残されたフル精度のコンポーネントはありません。次に、ベースは Qwen3.6 27B(27.8B パラメータのハイブリッドアテンション因果モデル)であるため、Bonsai はこのモデルの262Kトークンのコンテキストウィンドウとマルチモーダル入力を継承します。
3値か1ビットか: どのビルドをダウンロードするか
PrismML は 2 つのビルドを提供しており、間違った方を選ぶとメモリか品質のどちらかを無駄にします。トレードオフは単純です。ファイルが小さいほど、精度は低くなります。
| ビルド | 実効ビット/重み | サイズ | 保持品質 | 最適用途 |
|---|---|---|---|---|
| 三値 (-1, 0, +1) | ~1.71 | 5.9GB | FP16の>95% | デスクトップ、品質重視の作業 |
| 1ビット二値 (-1, +1) | ~1.125 | 3.9GB | FP16の>90% | スマートフォン、厳しいメモリ制約 |
電話で実行している場合、1-bit ビルドは iPhone 17 Pro のメモリ余裕内に収まるものです。ラップトップやデスクトップで余裕があるなら、ternary ビルドは追加の 2 ギガバイトで数ポイントの精度を取り戻せるため、出力品質が占有サイズより重要な場合には十分に価値があります。
ベンチマークが実際に示していること(そして品質が低下する箇所)
公式の数値はternaryビルドのもので、15のthinking-modeベンチマークで平均80.49です。特に際立っているのは強い点です:
| ベンチマーク | スコア | 評価内容 |
|---|---|---|
| MATH-500 | 99.20 | 学年レベルから競技レベルの数学 |
| AIME 2025 | 90.84 | 難易度の高い競技数学 |
| HumanEval+ | 93.90 | コード生成 |
| BFCL v3 | 74.41 | 関数/ツール呼び出し |
それらを並べて読むと、Bonsai 27Bの輪郭がはっきり見えてきます。数学とコードは90台です。ツール呼び出しは70台です。このギャップは、これを頼りにする前に理解すべき最も重要な一点です。つまり、量子化は、エージェント的なワークフローが依存する構造化されたマルチステップの振る舞いよりも、推論とコードをはるかによく保持するということです。
それらの数値はPrismML独自のものなので、独立したベンチマークが蓄積されるまでは最終的な結論ではなく出発点として扱ってください。注目すべきシグナルは、見出しの平均値が覆い隠してしまうものです。80.49という平均ではなく、タスクごとのスコアを確認し、人々が実際に遭遇している失敗モードに注意してください。初期テスターからは、ternary buildがときどき推論ループに陥ること、そして極端な量子化は単一タスクのスコアが示す以上に長文コンテキストの安定性を損ないがちだという報告があります。どちらも、頼りにする前に自分のプロンプトで簡単に試してみる価値があります。
どれくらい高速に動作し、どのハードウェアで動くか
この程度に極端な圧縮が重要になるのは、推論が実用的な速度で使える場合だけです。対応可能なハードウェアでは、それが可能です。以下は PrismML が公表している数値です:
| デバイス | 1-bit | 三値 |
|---|---|---|
| iPhone 17 Pro | 11 tok/s | — |
| Apple M5 Max | 87 tok/s | 58 tok/s |
| NVIDIA RTX 5090 | 163 tok/s | 134 tok/s |
スマートフォンで1秒あたり11トークンという速度は、非常に高速ではないにせよ、チャットや短い推論には実用的です。M5 Maxでは、1秒あたり87トークンという速度は十分に速く、ネットワークの往復時間を含めると、短いプロンプトではローカル推論がクラウドAPI呼び出しを上回ることもあります。PrismMLがこの成果を表現する一つの方法は、知能密度(ギガバイト当たりのベンチマークスコア)であり、Bonsaiは約0.53に達し、フル精度のベースラインのおよそ10倍です。
今すぐBonsai 27Bを実行する4つの方法
重みが公開されているため、単一の「インストール」方法はありません。ここでは、ゼロ設定から完全な制御まで、現在使える4つの方法をご紹介します。
iPhoneで
Locally AI iOSアプリは、1-bit 3.9GBビルドをデバイス上で直接実行し、アカウントやサーバーは不要です。これは「スマートフォンで27B」を実現する道筋であり、重みをダウンロードすれば完全にオフラインで動作します。
ブラウザで
PrismML は、インストール不要でブラウザタブ内で 1-bit モデルを実行する WebGPU カーネルを公開しています。ディスク容量を確保する前に Bonsai 27B を試す最速の方法ですが、WebGPU 対応 GPU を搭載したマシンが必要です。
ご自身のマシンで
GGUF、MLX、ONNX の各重みはすべて、Apache 2.0 の下で Hugging Face と GitHub にあります。主なリポジトリは prism-ml/Bonsai-27B-gguf(1-bit)と prism-ml/Ternary-Bonsai-27B-gguf(ternary)で、これに MLX 2-bit と ONNX のビルドも並んでいます。1-bit ビルドには、無料ストレージと RAM を合わせておよそ 4GB、ternary には 6GB を見込んでください。1つ注意点として、ツールの成熟度がリリースに追いついていません。これらの重みは複数のランタイムで読み込めますが、LM Studio のような人気のローカルアプリでの完全なサポートは公開時点ではまだ整っていなかったため、多少の手動設定が必要になるはずです。
ホスト型API経由
重みを管理したくない場合は、Together.ai が、標準の API を通じて ternary ビルドを提供しており、フルの 262K コンテキストウィンドウ、vision input、JSON mode を利用できます。入力価格はローンチ記念プロモーション期間中は 100万トークンあたり $0.00 と記載されていたため、プロモーション価格は変わることがあるので、予算を立てる前に現在の料金を確認してください。
Bonsai 27B 対 Gemma 4 12B QAT
比較でよく挙がるのは、Google の量子化対応学習済みモデルである Gemma 4 12B QAT で、サイズは約 7GB に収まり、Bonsai の三値化ビルドよりわずかに大きい程度です。
それぞれ異なる軸で優れています。Bonsai 27Bは、その27Bベースのおかげで、数学やコーディングのベンチマークでGemmaを明確に上回ります。Gemmaは、ビジョンやtool callingではより安定しており、やや大きく、圧縮がそれほど強くない重みのおかげで、スマートフォン上ではより安定した汎用向けの選択肢になります。オンデバイスのワークロードが推論とコード中心なら、Bonsaiのほうが有力です。画像処理やfunction callingに重きを置くなら、Gemma 4 12B QATのほうが安全です。
実際にBonsai 27Bを使うべき人は誰か
オフラインでプライベートな、デバイス上での推論やコーディング支援が必要で、iPhone 17 Proクラスのデバイスまたは高性能なラップトップをお持ちなら、Bonsai 27B を使ってください。また、極端な量子化に関心がある人にとっても魅力的な研究対象です。27Bモデルがブラウザのタブ内で動作するという事実は本当に画期的であり、オープンな Apache 2.0 ライセンスにより試しやすくなっています。ローカルの選択肢が欲しいときには、プログラミング用に実行する価値のある他のオープンで無料のモデルと自然に並びます。
まだ、信頼性の高いツール呼び出しに依存する本番のエージェント型システム、視覚が重要なタスク、または推論ループの失敗モードが高くつく可能性のある用途には使用しないでください。そのような用途では、より圧縮率の低いモデル、または API の背後にあるフル精度モデルのほうが、依然としてより安全な選択です。
よくある質問
Bonsai 27Bは無料で使用できますか?
重みはApache 2.0ライセンスの下で無料で提供されているため、無料でダウンロードして実行できます。Together.ai を通じたホスト型アクセスには独自の API 料金があり、ローンチ時には入力トークン100万件あたり $0.00 と記載されていましたので、現在の料金を確認してください。
Bonsai 27Bは本当にスマートフォンで動作できますか?
はい。1ビット版は3.9GBで、Locally AIアプリを介してiPhone 17 Pro上で約11トークン/秒で動作し、ダウンロード後は完全にオフラインで利用できます。
Bonsai 27Bはフル版のQwen3.6 27Bと同じくらい優れていますか?
近いですが、完全には同じではありません。3値ビルドはフル精度のベンチマーク性能の95%以上を維持し、1ビットビルドは90%以上を維持します。保持率は数学とコードで最も高く、ツール呼び出しで最も低くなります。
どのBonsai 27Bファイルをダウンロードすべきですか?
スマートフォンやメモリに余裕のないマシンでは、1-bit ビルド(prism-ml/Bonsai-27B-gguf、約 3.9GB)を選んでください。デスクトップや余裕のある GPU では、精度を少し上げるために ternary ビルド(prism-ml/Ternary-Bonsai-27B-gguf、約 5.9GB)を選んでください。Apple Silicon およびクロスプラットフォームのランタイム向けに、MLX 2-bit と ONNX のバリアントもあります。
三値量子化とは何ですか?
各モデルの重みを、フル精度の数値ではなく3つの値(-1、0、+1)のいずれかとして保存するため、モデルはこれほど劇的に小さくなります。FP16のスケーリング係数は、圧縮された重みが概ね適切な大きさに保たれるようにします。
Bonsai 27B は画像をサポートしていますか?
はい、テキストとともに画像入力を受け付け、テキスト出力を返します。これは、ベースとなる Qwen3.6 27B のマルチモーダル機能を継承しています。圧縮下では、視覚品質は数学やコードほどはうまく保たれません。
