Bonsai 27B è la build a quantizzazione ternaria di PrismML di Qwen3.6 27B, e la sua affermazione principale è reale: racchiude un modello da 27 miliardi di parametri in 3,9 GB e gira su un iPhone 17 Pro a circa 11 token al secondo. I pesi sono gratuiti sotto Apache 2.0, e la versione ternaria mantiene oltre il 95% del punteggio del benchmark a precisione piena. Il rovescio della medaglia è che la qualità preservata è disomogenea: matematica e coding restano quasi alla pari, mentre il tool-calling e la vision calano. Quindi Bonsai 27B è un modello utile on-device per reasoning e code, ma incerto per lavori agentici e ricchi di strumenti. Questa guida illustra come funziona la compressione, cosa significano i numeri, i quattro modi per eseguirlo e chi dovrebbe interessarsene.
Come PrismML ha ridotto un modello da 27B per adattarlo a un telefono
Un modello standard da 27B in FP16 richiede circa 54GB di memoria, molto più di quanto abbia qualsiasi telefono. Bonsai 27B scende sotto i 6GB sostituendo i pesi a piena precisione con piccoli valori discreti.
La variante ternaria vincola ogni peso a uno di tre valori: -1, 0 o +1. Ciò equivale teoricamente a circa 1,58 bit di informazione per peso. PrismML aggiunge una scalatura FP16 a livello di gruppo (memorizzando un fattore di scalatura a precisione completa per gruppo di pesi, così che i valori compressi mantengano ancora la giusta magnitudine), il che porta il costo reale a circa 1,71 bit effettivi per peso. La variante binaria più aggressiva da 1 bit elimina lo zero e conserva solo -1 e +1, arrivando a circa 1,125 bit effettivi.
Due dettagli sono importanti. Primo, la compressione è end-to-end: embedding, attenzione, i blocchi MLP e la testa del language model sono tutti quantizzati, senza componenti a precisione piena lasciate come stampella. Secondo, la base è Qwen3.6 27B (27,8 miliardi di parametri, un modello causale ibrido con attenzione), quindi Bonsai eredita la finestra di contesto da 262K token di quel modello e l'input multimodale.
Ternario o 1-bit: quale build scaricare
PrismML viene fornito con due build, e scegliere quella sbagliata spreca memoria o qualità. Il compromesso è semplice: file più piccolo, accuratezza inferiore.
| Build | Bit effettivi/peso | Dimensione | Qualità mantenuta | Ideale per |
|---|---|---|---|---|
| Trinario (-1, 0, +1) | ~1.71 | 5.9GB | >95% di FP16 | Desktop, lavoro sensibile alla qualità |
| Binario a 1 bit (-1, +1) | ~1.125 | 3.9GB | >90% di FP16 | Telefoni, budget di memoria ridotti |
Se stai eseguendo su un telefono, la build a 1 bit è quella che rientra nel margine di memoria di un iPhone 17 Pro. Se hai un laptop o un desktop con spazio libero, la build ternaria recupera diversi punti di accuratezza con due gigabyte in più, vale la pena ogni volta che la qualità dell'output conta più dell'ingombro.
Cosa dicono davvero i benchmark (e dove la qualità cala)
I numeri ufficiali sono per la build ternaria, che ha una media di 80.49 su 15 benchmark in modalità thinking. I risultati di punta sono notevoli:
| Benchmark | Punteggio | Cosa misura |
|---|---|---|
| MATH-500 | 99.20 | Matematica da livello scolastico a competizione |
| AIME 2025 | 90.84 | Matematica competitiva difficile |
| HumanEval+ | 93.90 | Generazione di codice |
| BFCL v3 | 74.41 | Chiamata di funzioni/strumenti |
Leggili fianco a fianco e la forma di Bonsai 27B diventa chiara. Matematica e codice si attestano nei 90. Il tool calling si colloca nei 70. Questo divario è la cosa più importante da capire prima di affidarti ad esso: la quantizzazione preserva il ragionamento e il codice molto meglio di quanto preservi il comportamento strutturato e multi-step da cui dipendono i workflow agentici.
Quei dati sono di PrismML, quindi considerali un punto di partenza e non l’ultima parola finché non si accumulano benchmark indipendenti. I segnali che vale la pena monitorare sono quelli che una media da titolo nasconde: controlla i punteggi per singolo task anziché la media di 80.49, e nota le modalità di errore che le persone incontrano davvero. I primi tester hanno segnalato che la build ternary a volte rimane bloccata in cicli di ragionamento, e la quantizzazione estrema tende a erodere la stabilità nei contesti lunghi più di quanto suggerisca il punteggio su un singolo task. Entrambi meritano un rapido test sui tuoi prompt prima che tu faccia affidamento su di essi.
Quanto velocemente funziona e su quale hardware
Una compressione così aggressiva conta solo se l'inferenza è מספיק veloce da poter essere usata. Lo è, su hardware adeguato. Questi sono i dati riportati da PrismML:
| Dispositivo | 1-bit | Ternario |
|---|---|---|
| iPhone 17 Pro | 11 tok/s | — |
| Apple M5 Max | 87 tok/s | 58 tok/s |
| NVIDIA RTX 5090 | 163 tok/s | 134 tok/s |
I 11 token al secondo su un telefono sono utilizzabili per chat e ragionamenti brevi, anche se non fulminei. Su un M5 Max, 87 token al secondo sono abbastanza veloci da fare in modo che, una volta considerati i round-trip di rete, l’inferenza locale possa superare una chiamata a un’API cloud per prompt brevi. Un modo in cui PrismML inquadra il risultato è la densità di intelligenza (punteggio del benchmark per gigabyte), dove Bonsai si colloca intorno a 0,53, circa dieci volte un baseline a precisione completa.
Quattro modi per eseguire Bonsai 27B subito
Poiché i pesi sono aperti, non esiste un unico percorso di "installazione". Ecco i quattro che funzionano oggi, da zero configurazione al pieno controllo.
Su iPhone
L’app iOS Locally AI esegue direttamente sul dispositivo la build da 1-bit e 3.9GB, senza bisogno di un account o di un server. Questo è il percorso che realizza la promessa di "27B su un telefono" e funziona completamente offline una volta scaricati i pesi.
Nel browser
PrismML pubblica kernel WebGPU che eseguono il modello a 1 bit all'interno di una scheda del browser, senza alcuna installazione. È il modo più veloce per provare Bonsai 27B prima di impegnare spazio su disco, anche se è necessario un computer con una GPU compatibile con WebGPU.
Sul tuo computer
I pesi GGUF, MLX e ONNX sono tutti su Hugging Face e GitHub sotto Apache 2.0. I repository principali sono prism-ml/Bonsai-27B-gguf (1-bit) e prism-ml/Ternary-Bonsai-27B-gguf (ternary), con build MLX a 2-bit e ONNX affiancate. Prevedi circa 4GB di spazio libero e RAM per la build a 1-bit e 6GB per quella ternary. Un avvertimento: la maturità degli strumenti è in ritardo rispetto al rilascio. I pesi si caricano in diversi runtime, ma il supporto completo in app locali popolari come LM Studio non era ancora disponibile al lancio, quindi aspettati una certa configurazione manuale.
Tramite un'API ospitata
Se preferisci non gestire i pesi, Together.ai offre la build ternaria tramite una API standard con la finestra di contesto completa da 262K, input vision e modalità JSON. Durante la promozione di lancio, il prezzo di input era indicato a $0.00 per milione di token, quindi verifica la tariffa attuale prima di basare il budget su questa cifra, poiché i prezzi promozionali cambiano.
Bonsai 27B vs Gemma 4 12B QAT
Il confronto che ricorre più spesso è Gemma 4 12B QAT, il modello di Google addestrato con quantization-aware training, che si colloca intorno ai 7GB, solo leggermente più grande della build ternaria di Bonsai.
Vincono su assi diversi. Bonsai 27B batte chiaramente Gemma nei benchmark di matematica e coding, grazie a quel base da 27B. Gemma tende a reggere meglio nella vision e nel tool calling, e i suoi pesi leggermente più grandi e meno compressi in modo aggressivo la rendono una scelta più stabile e general-purpose su un telefono. Se il tuo workload on-device riguarda il reasoning e il code, Bonsai è la scelta più forte; se si basa su immagini o function calling, Gemma 4 12B QAT è quella più sicura.
Chi dovrebbe davvero usare Bonsai 27B
Usa Bonsai 27B se desideri assistenza offline, privata e on-device per il ragionamento o la programmazione e hai un dispositivo di classe iPhone 17 Pro oppure un laptop in grado di supportarlo. È anche un oggetto di studio interessante per chiunque sia interessato alla quantizzazione estrema: il fatto che un modello da 27B funzioni in una scheda del browser è un vero traguardo, e la licenza aperta Apache 2.0 rende facile sperimentare. Si inserisce naturalmente accanto ad altri modelli aperti e gratuiti che vale la pena eseguire per la programmazione quando vuoi un'opzione locale.
Non utilizzarlo ancora per sistemi agentici di produzione che dipendono da chiamate agli strumenti affidabili, per attività critiche per la visione, o per qualsiasi cosa in cui il modo di guasto del ciclo di ragionamento sarebbe costoso. Per questi casi, un modello meno compresso, o uno a precisione מלאה dietro un'API, resta la scelta più sicura.
Domande frequenti
Bonsai 27B è gratuito da usare?
I pesi sono gratuiti sotto la licenza Apache 2.0, quindi puoi scaricarli ed eseguirli senza costi. L'accesso ospitato tramite Together.ai prevede una propria tariffazione API, che al lancio era indicata a $0.00 per milione di token di input, quindi verifica la tariffa attuale.
Può davvero Bonsai 27B funzionare su un telefono?
Sì. La build a 1 bit è di 3,9 GB e gira su un iPhone 17 Pro a circa 11 token al secondo tramite l'app Locally AI, completamente offline una volta scaricata.
Bonsai 27B è buono quanto il completo Qwen3.6 27B?
Vicino, ma non identico. La build ternaria mantiene oltre il 95% delle prestazioni del benchmark a precisione piena e la build a 1 bit oltre il 90%, con la conservazione più forte su matematica e codice e più debole nella chiamata agli strumenti.
Quale file Bonsai 27B dovrei scaricare?
Su un telefono o su una macchina con memoria limitata, scegli la build a 1 bit (prism-ml/Bonsai-27B-gguf, circa 3,9GB). Su un desktop o una GPU dove hai spazio a sufficienza, scegli la build ternaria (prism-ml/Ternary-Bonsai-27B-gguf, circa 5,9GB) per ottenere quei pochi punti di precisione in più. Esistono varianti MLX a 2 bit e ONNX per Apple Silicon e runtime multipiattaforma.
Che cos'è la quantizzazione ternaria?
Memorizza ogni peso del modello come uno dei tre valori (-1, 0 o +1) invece che come un numero a precisione completa, ed è per questo che il modello si riduce così drasticamente. I fattori di scala FP16 mantengono i pesi compressi approssimativamente alla giusta magnitudine.
Bonsai 27B supporta le immagini?
Sì, accetta input di immagini insieme al testo e restituisce output testuale, ereditando la capacità multimodale della sua base Qwen3.6 27B. La qualità della visione regge meno bene rispetto a matematica e codice sotto la compressione.
