Bonsai 27B est la version quantifiée en ternaire de Qwen3.6 27B par PrismML, et son affirmation phare est bien réelle : il intègre un modèle de 27 milliards de paramètres dans 3,9 Go et fonctionne sur un iPhone 17 Pro à environ 11 tokens par seconde. Les poids sont gratuits sous Apache 2.0, et la version ternaire conserve plus de 95 % du score de benchmark en précision complète. Le bémol est que la qualité conservée est inégale : les mathématiques et le codage restent proches de la parité, tandis que les appels d’outils et la vision régressent. Ainsi, Bonsai 27B est un modèle embarqué utile pour le raisonnement et le code, mais fragile pour le travail agentique et fortement axé sur les outils. Ce guide explique comment fonctionne la compression, ce que signifient les chiffres, les quatre façons de l’exécuter, et à qui cela vaut la peine.
Comment PrismML a réduit un modèle de 27B pour tenir sur un téléphone
Un modèle standard de 27B en FP16 nécessite environ 54 Go de mémoire, bien plus que n'importe quel téléphone n'en possède. Bonsai 27B descend sous les 6 Go en remplaçant les poids en pleine précision par de minuscules valeurs discrètes.
La variante ternaire contraint chaque poids à l’une de trois valeurs : -1, 0 ou +1. Cela représente environ 1,58 bit d’information par poids en théorie. PrismML ajoute une mise à l’échelle FP16 par groupe (en stockant un facteur d’échelle en pleine précision par groupe de poids afin que les valeurs compressées conservent la bonne magnitude), ce qui porte le coût réel à environ 1,71 bit effectif par poids. La variante binaire plus agressive à 1 bit supprime le zéro et ne conserve que -1 et +1, atteignant près de 1,125 bit effectif.
Deux détails comptent. Premièrement, la compression est de bout en bout : les embeddings, l’attention, les blocs MLP et la tête du modèle de langage sont tous quantifiés, sans composant en précision flottante laissé en béquille. Deuxièmement, la base est Qwen3.6 27B (27,8 milliards de paramètres, un modèle causal à attention hybride), donc Bonsai hérite de la fenêtre de contexte de 262K tokens de ce modèle et de son entrée multimodale.
Ternaire ou 1 bit : quelle version télécharger
PrismML est livré avec deux versions, et choisir la mauvaise gaspille soit de la mémoire, soit de la qualité. Le compromis est simple : fichier plus petit, précision plus faible.
| Construction | Bits effectifs/poids | Taille | Qualité conservée | Idéal pour |
|---|---|---|---|---|
| Ternaire (-1, 0, +1) | ~1.71 | 5.9GB | >95% de FP16 | Ordinateur de bureau, travail sensible à la qualité |
| Binaire 1 bit (-1, +1) | ~1.125 | 3.9GB | >90% de FP16 | Téléphones, budgets mémoire serrés |
Si vous utilisez un téléphone, la version 1-bit est celle qui tient dans la marge mémoire d’un iPhone 17 Pro. Si vous avez un ordinateur portable ou de bureau avec de la marge, la version ternaire permet de récupérer plusieurs points de précision pour deux gigaoctets supplémentaires, ce qui en vaut la peine chaque fois que la qualité de sortie compte davantage que l’encombrement.
Ce que disent réellement les benchmarks (et où la qualité baisse)
Les chiffres officiels concernent la version ternaire, qui affiche une moyenne de 80,49 sur 15 benchmarks en mode de réflexion. Les plus remarquables sont solides :
| Benchmark | Score | Ce qu’il mesure |
|---|---|---|
| MATH-500 | 99.20 | Mathématiques du niveau scolaire à la compétition |
| AIME 2025 | 90.84 | Mathématiques de compétition difficiles |
| HumanEval+ | 93.90 | Génération de code |
| BFCL v3 | 74.41 | Appel de fonctions/outils |
Lisez-les côte à côte et la forme de Bonsai 27B devient claire. Les maths et le code sont dans les 90. L’appel d’outils est dans les 70. Cet écart est la chose la plus importante à comprendre avant de vous y fier : la quantification préserve le raisonnement et le code bien mieux qu’elle ne préserve le comportement structuré en plusieurs étapes dont dépendent les workflows agentiques.
Ces chiffres sont propres à PrismML, donc considérez-les comme un point de départ plutôt que comme la vérité finale jusqu’à ce que des benchmarks indépendants s’accumulent. Les signaux qui méritent d’être surveillés sont ceux qu’une moyenne mise en avant masque : vérifiez les scores par tâche plutôt que la moyenne de 80.49, et notez les modes de défaillance réellement rencontrés par les utilisateurs. Les premiers testeurs ont signalé que la version ternaire se bloque parfois dans des boucles de raisonnement, et que la quantification extrême a tendance à éroder la stabilité sur les longs contextes davantage qu’un score sur une seule tâche ne le suggère. Les deux méritent un test rapide sur vos propres prompts avant de vous y fier.
À quelle vitesse il fonctionne, et sur quel matériel
Une compression aussi agressive n’a d’intérêt que si l’inférence est assez rapide pour être utilisée. C’est le cas sur un matériel capable. Voici les chiffres communiqués par PrismML :
| Appareil | 1-bit | Ternaire |
|---|---|---|
| iPhone 17 Pro | 11 tok/s | — |
| Apple M5 Max | 87 tok/s | 58 tok/s |
| NVIDIA RTX 5090 | 163 tok/s | 134 tok/s |
Les 11 tokens par seconde sur un téléphone sont utilisables pour le chat et le raisonnement court, même si ce n’est pas fulgurant. Sur un M5 Max, 87 tokens par seconde est assez rapide pour que, une fois pris en compte les allers-retours réseau, l’inférence locale puisse battre un appel à une API cloud pour des prompts courts. Une façon dont PrismML présente cette réussite est la densité d’intelligence (score de benchmark par gigaoctet), où Bonsai atteint environ 0,53, soit à peu près dix fois une base en pleine précision.
Quatre façons d'exécuter Bonsai 27B dès maintenant
Comme les poids sont ouverts, il n'existe pas de chemin unique pour « installer ». Voici les quatre qui fonctionnent aujourd'hui, de la configuration zéro au contrôle total.
Sur un iPhone
L’application iOS Locally AI exécute directement sur l’appareil la version 1 bit de 3,9 Go, sans compte ni serveur requis. C’est la voie qui concrétise la promesse du « 27B sur un téléphone », et elle fonctionne entièrement hors ligne une fois les poids téléchargés.
Dans un navigateur
PrismML publie des kernels WebGPU qui exécutent le modèle 1-bit dans un onglet de navigateur, sans aucune installation. C’est la manière la plus rapide d’essayer Bonsai 27B avant d’y consacrer de l’espace disque, bien qu’il faille une machine équipée d’un GPU compatible WebGPU.
Sur votre propre machine
Les poids GGUF, MLX et ONNX sont tous sur Hugging Face et GitHub sous Apache 2.0. Les principaux dépôts sont prism-ml/Bonsai-27B-gguf (1 bit) et prism-ml/Ternary-Bonsai-27B-gguf (ternaire), avec des versions MLX 2 bits et ONNX à côté. Prévoyez environ 4 Go de stockage libre et de RAM pour la version 1 bit et 6 Go pour la version ternaire. Un bémol : la maturité des outils est en retard sur la version. Les poids se chargent dans plusieurs environnements d’exécution, mais la prise en charge complète dans des applications locales populaires comme LM Studio n’était pas encore en place au lancement, donc attendez-vous à une certaine configuration manuelle.
Via une API hébergée
Si vous préférez ne pas gérer les poids, Together.ai propose la version ternaire via une API standard avec la fenêtre de contexte complète de 262K, l’entrée vision et le mode JSON. Le prix d’entrée était affiché à 0,00 $ par million de tokens pendant la promotion de lancement, alors vérifiez le tarif actuel avant d’établir votre budget, car les prix promotionnels changent.
Bonsai 27B vs Gemma 4 12B QAT
La comparaison qui revient sans cesse est Gemma 4 12B QAT, le modèle entraîné avec la prise en compte de la quantification de Google, qui atteint environ 7 Go, à peine plus grand que la version ternaire de Bonsai.
Ils excellent sur des axes différents. Bonsai 27B surpasse clairement Gemma sur les benchmarks de maths et de code, grâce à cette base 27B. Gemma a tendance à mieux tenir sur la vision et l’appel d’outils, et ses poids légèrement plus grands, moins fortement compressés, en font un choix généraliste plus stable sur un téléphone. Si votre charge de travail sur l’appareil repose sur le raisonnement et le code, Bonsai est le meilleur choix ; si elle s’appuie sur des images ou des appels de fonctions, Gemma 4 12B QAT est l’option la plus sûre.
Qui devrait réellement utiliser Bonsai 27B
Utilisez Bonsai 27B si vous souhaitez un raisonnement ou une assistance au codage hors ligne, privée et sur l'appareil, et que vous disposez d'un appareil de type iPhone 17 Pro ou d'un ordinateur portable suffisamment puissant. C'est aussi un objet d'étude convaincant pour toute personne intéressée par la quantification extrême : le fait qu'un modèle de 27B fonctionne dans un onglet de navigateur est une véritable étape importante, et la licence ouverte Apache 2.0 facilite les expérimentations. Il s'intègre naturellement aux autres modèles ouverts et gratuits qui valent la peine d'être exécutés pour la programmation lorsque vous souhaitez une option locale.
N’utilisez pas encore cela pour des systèmes agentiques de production qui dépendent d’un appel d’outils fiable, pour des tâches critiques en vision, ni pour tout cas où le mode d’échec de la boucle de raisonnement serait coûteux. Pour ceux-là, un modèle moins compressé, ou un modèle en pleine précision derrière une API, reste le choix le plus sûr.
Questions fréquemment posées
Bonsai 27B est-il gratuit à utiliser ?
Les poids sont libres sous la licence Apache 2.0, vous pouvez donc les télécharger et les exécuter gratuitement. L’accès hébergé via Together.ai comporte sa propre tarification API, qui était indiquée à 0,00 $ par million de jetons d’entrée lors du lancement, alors vérifiez le tarif actuel.
Bonsai 27B peut-il vraiment fonctionner sur un téléphone ?
Oui. La version 1-bit fait 3,9 Go et fonctionne sur un iPhone 17 Pro à environ 11 tokens par seconde via l’application Locally AI, entièrement hors ligne une fois téléchargée.
Bonsai 27B est-il aussi bon que le Qwen3.6 27B complet ?
Proche, mais pas identique. La version ternaire conserve plus de 95 % des performances de référence en pleine précision et la version 1 bit plus de 90 %, la rétention étant la plus forte en mathématiques et en code et la plus faible pour l’appel d’outils.
Quel fichier Bonsai 27B dois-je télécharger ?
Sur un téléphone ou une machine à mémoire limitée, prenez la version 1-bit (prism-ml/Bonsai-27B-gguf, environ 3,9 Go). Sur un ordinateur de bureau ou un GPU où vous avez de la marge, prenez la version ternaire (prism-ml/Ternary-Bonsai-27B-gguf, environ 5,9 Go) pour quelques points de précision supplémentaires. Des variantes MLX 2-bit et ONNX existent pour Apple Silicon et les environnements d’exécution multiplateformes.
Qu'est-ce que la quantification ternaire ?
Il stocke chaque poids du modèle comme l’une de trois valeurs (-1, 0 ou +1) au lieu d’un nombre en pleine précision, ce qui explique pourquoi le modèle rétrécit de façon aussi spectaculaire. Les facteurs d’échelle FP16 maintiennent les poids compressés à peu près à la bonne magnitude.
Bonsai 27B prend-il en charge les images ?
Oui, il accepte les entrées d’image en plus du texte et renvoie une sortie texte, héritant de la capacité multimodale de sa base Qwen3.6 27B. La qualité visuelle tient moins bien que les performances en math et en code sous la compression.
