Bonsai 27B 是 PrismML 對 Qwen3.6 27B 的三值量化版本,而其主打宣稱確實驚人:它將一個 270 億參數模型壓縮到 3.9GB,並可在 iPhone 17 Pro 上以約每秒 11 個 token 執行。權重依 Apache 2.0 免費提供,而三值版本保留了超過 95% 的全精度基準分數。問題在於它保留下來的品質並不平均:數學與程式碼表現幾乎維持相近,但工具呼叫與視覺能力則明顯下降。因此,Bonsai 27B 是一個適合在裝置端執行的推理與程式模型,但對於以代理式、重度工具依賴的工作來說就比較不穩定。本指南將涵蓋其壓縮原理、數據代表的意義、四種執行方式,以及哪些人值得使用它。
PrismML 如何將一個 27B 模型縮小到能放進手機
標準的 27B 模型在 FP16 下大約需要 54GB 記憶體,遠超過任何手機所具備的容量。Bonsai 27B 透過以微小的離散值取代全精度權重,將需求降至 6GB 以下。
三元變體將每個權重限制為三個值之一:-1、0 或 +1。理論上,這相當於每個權重約 1.58 位元的資訊。PrismML 加入了 FP16 的按組縮放(為每組權重儲存一個全精度縮放因子,使壓縮後的數值仍能落在正確的量級),這使實際成本提升到每個權重約 1.71 個有效位元。更激進的 1 位元二元變體則捨棄了 0,只保留 -1 和 +1,約為 1.125 個有效位元。
有兩個細節很重要。首先,壓縮是端到端的:embeddings、attention、MLP 區塊,以及語言模型 head 全都被量化,沒有留下任何全精度元件作為支撐。其次,基礎模型是 Qwen3.6 27B(27.8B 參數,一個 hybrid-attention 因果模型),因此 Bonsai 承襲了該模型 262K token 的上下文視窗與多模態輸入。
三元或 1 位元:要下載哪個版本
PrismML 提供兩種建置版本,選錯會浪費記憶體或品質。取捨很簡單:檔案越小,準確度越低。
| 建置 | 每權重有效位元數 | 大小 | 保留品質 | 最適合 |
|---|---|---|---|---|
| 三值(-1, 0, +1) | ~1.71 | 5.9GB | >95% 的 FP16 | 桌機、對品質敏感的工作 |
| 1-bit 二元(-1, +1) | ~1.125 | 3.9GB | >90% 的 FP16 | 手機、記憶體預算緊縮 |
如果您是在手機上執行,1-bit 版本就是能放進 iPhone 17 Pro 記憶體餘裕內的那個版本。如果您有筆電或桌機且還有空間可用,ternary 版本只多用兩個 gigabytes,卻能換回好幾個點的準確度;只要輸出品質比佔用空間更重要,它就很值得。
基準測試實際上說了什麼(以及品質在哪裡下滑)
官方數字是針對三元版本,該版本在 15 個思考模式基準測試上的平均分數為 80.49。其亮點表現相當出色:
| 基準測試 | 分數 | 衡量項目 |
|---|---|---|
| MATH-500 | 99.20 | 從年級到競賽數學 |
| AIME 2025 | 90.84 | 高難度競賽數學 |
| HumanEval+ | 93.90 | 程式碼生成 |
| BFCL v3 | 74.41 | 函式/工具呼叫 |
並排閱讀這些結果後,Bonsai 27B 的輪廓就清楚了。數學與程式碼表現都在 90 多分。工具調用則落在 70 多分。在你開始依賴它之前,最重要的就是理解這個差距:量化能更好地保留推理與程式碼能力,遠勝於它對 agentic 工作流程所依賴的結構化、多步驟行為的保留。
那些數據是 PrismML 自己提供的,因此在累積獨立基準測試之前,應將它們視為起點,而非最終定論。真正值得關注的訊號,是那些會被標題式平均值掩蓋的部分:請查看各任務分數,而不是 80.49 的平均值,並留意人們實際遇到的失敗模式。早期測試者回報,三元建置有時會卡在推理迴圈中,而極端量化往往比單一任務分數所暗示的更容易削弱長上下文穩定性。這兩者都值得在你自己的提示上先做快速測試,再決定是否依賴它。
執行速度,以及在什麼硬體上執行
只有在推理速度夠快、能實際使用時,這麼激進的壓縮才有意義。在性能足夠的硬體上,確實如此。以下是 PrismML 自行回報的數據:
| 裝置 | 1-bit | Ternary |
|---|---|---|
| iPhone 17 Pro | 11 tok/s | — |
| Apple M5 Max | 87 tok/s | 58 tok/s |
| NVIDIA RTX 5090 | 163 tok/s | 134 tok/s |
手機上每秒 11 個 tokens 對於聊天和簡短推理來說是可用的,雖然算不上飛快。在 M5 Max 上,每秒 87 個 tokens 已經夠快了,當你把網路往返延遲算進去後,對於短提示詞,本地推理甚至可以比雲端 API 呼叫更快。PrismML 看待這項成就的一種方式是智能密度(benchmark 分數 प्रति gigabyte),其中 Bonsai 大約落在 0.53,約為完整精度基準的十倍。
立即執行 Bonsai 27B 的四種方式
由於權重是開放的,因此沒有單一的「安裝」路徑。以下是目前可行的四種方式,從零設定到完全控制。
在 iPhone 上
Locally AI iOS 應用程式會直接在裝置上執行 1-bit 3.9GB build,無需帳號或伺服器。這條路徑實現了「手機上執行 27B」的承諾,而在權重下載完成後,它可完全離線運作。
在瀏覽器中
PrismML 發布可在瀏覽器分頁中執行 1-bit 模型的 WebGPU kernel,完全無需安裝。這是先試用 Bonsai 27B 再決定是否佔用磁碟空間的最快方式,不過你需要一台配備支援 WebGPU 的 GPU 的機器。
在您的電腦上
GGUF、MLX 和 ONNX 權重都可在 Hugging Face 和 GitHub 上取得,並採用 Apache 2.0 授權。主要儲存庫是 prism-ml/Bonsai-27B-gguf(1-bit)和 prism-ml/Ternary-Bonsai-27B-gguf(ternary),旁邊還有 MLX 2-bit 和 ONNX 的建置版本。請預留大約 4GB 的可用儲存空間與 RAM 給 1-bit 版本,ternary 版本則需要 6GB。需要注意一點:工具成熟度落後於發佈進度。這些權重可在多種 runtime 中載入,但像 LM Studio 這類熱門本機應用在推出時尚未提供完整支援,因此預期會需要一些手動設定。
透過代管 API
如果您不想自行管理權重,Together.ai 透過標準 API 提供此三元版本,具備完整 262K context window、vision input 與 JSON mode。於上市促銷期間,輸入定價標示為每百萬 tokens $0.00,因此在您據此編列預算之前,請先確認目前費率,因為促銷定價會變動。
Bonsai 27B vs Gemma 4 12B QAT
不斷被提起的比較對象是 Gemma 4 12B QAT,這是 Google 的量化感知訓練模型,大小約為 7GB,僅比 Bonsai 的三值版本稍大一些。
它們各自在不同面向勝出。Bonsai 27B 明顯在數學和程式碼基準測試上擊敗 Gemma,這要歸功於那個 27B base。Gemma 在 vision 和 tool calling 上通常表現更好,而且它稍大、壓縮較不激進的 weights,讓它在手機上作為通用選擇時更穩定。如果你的 on-device 工作負載是推理和程式碼,Bonsai 是更強的選擇;如果它更依賴圖片或 function calling,Gemma 4 12B QAT 則是更安全的選項。
誰實際上應該使用 Bonsai 27B
如果你想要離線、私密、在裝置上進行推理或編碼協助,且你有一台 iPhone 17 Pro 級裝置或一台性能足夠的筆電,就可以使用 Bonsai 27B。對任何對極端量化感興趣的人來說,它也很值得研究:一個 27B 模型能在瀏覽器分頁中執行,這確實是一個重要里程碑,而開放的 Apache 2.0 授權也讓實驗變得很容易。當你想要本機方案時,它能自然地與其他值得用於程式設計的開放且免費模型並列使用。
目前不要將其用於依賴可靠工具呼叫的生產型 agentic 系統、對視覺至關重要的任務,或任何推理迴圈失敗模式代價高昂的情況。對於這些用途,較不壓縮的模型,或透過 API 提供的完整精度模型,仍然是更安全的選擇。
常見問題
Bonsai 27B 可以免費使用嗎?
這些 weights 在 Apache 2.0 授權下是免費的,因此你可以免費下載並執行。透過 Together.ai 的託管存取則有其自己的 API 計價,且在上市時列為每百萬 input tokens $0.00,因此請確認目前費率。
Bonsai 27B 真的可以在手機上執行嗎?
是的。1-bit 版本為 3.9GB,透過 Locally AI app 可在 iPhone 17 Pro 上以約每秒 11 個 token 的速度運行,下載後即可完全離線使用。
Bonsai 27B 和完整的 Qwen3.6 27B 一樣好嗎?
接近,但不完全相同。三元建置保留了超過 95% 的全精度基準效能,而 1-bit 建置保留了超過 90%;其中在數學和程式碼上的保留最強,在工具呼叫上的保留最弱。
我應該下載哪個 Bonsai 27B 檔案?
在手機或記憶體較緊的機器上,請使用 1-bit 版本(prism-ml/Bonsai-27B-gguf,約 3.9GB)。在有足夠空間的桌機或 GPU 上,請使用 ternary 版本(prism-ml/Ternary-Bonsai-27B-gguf,約 5.9GB),可獲得額外幾個百分點的準確度。另有適用於 Apple Silicon 與跨平台 runtime 的 MLX 2-bit 和 ONNX 變體。
什麼是三元量化?
它將每個模型權重儲存為三個值之一(-1、0 或 +1),而不是完整精度數值,這就是模型大幅縮小的原因。FP16 縮放因子會讓折疊後的權重大致維持在正確的量級。
Bonsai 27B 支援圖片嗎?
是的,它支援圖片輸入與文字一同輸入,並回傳文字輸出,繼承了其 Qwen3.6 27B 基礎模型的多模態能力。在壓縮之下,視覺品質的表現不如數學和程式碼那麼穩定。
