Bonsai 27B: Ein 27B-KI-Modell, das auf deinem Smartphone läuft

Zuletzt aktualisiert: 2026-07-15 05:57:40

Bonsai 27B ist PrismMLs ternär quantifizierter Build von Qwen3.6 27B, und seine Hauptaussage stimmt: Er packt ein Modell mit 27 Milliarden Parametern in 3,9 GB und läuft auf einem iPhone 17 Pro mit etwa 11 Tokens pro Sekunde. Die Gewichte sind unter Apache 2.0 frei verfügbar, und die ternäre Version behält mehr als 95 % des Benchmark-Scores der Vollpräzision. Der Haken ist, dass die Qualität, die erhalten bleibt, uneinheitlich ist: Mathematik und Coding bleiben nahezu auf Augenhöhe, während Tool-Calling und Vision abfallen. Bonsai 27B ist also ein nützliches On-Device-Modell für Reasoning und Code und ein wackeliges für agentisches, tool-intensives Arbeiten. Dieser Leitfaden behandelt, wie die Komprimierung funktioniert, was die Zahlen bedeuten, die vier Möglichkeiten, es auszuführen, und wer sich damit beschäftigen sollte.

A small bonsai tree growing out of a smartphone screen on a sunlit desk, illustrating a 27B AI model shrunk to fit a phone

Wie PrismML ein 27B-Modell so verkleinerte, dass es auf ein Telefon passt

Ein standardmäßiges 27B-Modell in FP16 benötigt ungefähr 54 GB Speicher, weit mehr als jedes Telefon hat. Bonsai 27B kommt unter 6 GB, indem Vollpräzisionsgewichte durch winzige diskrete Werte ersetzt werden.

Die ternäre Variante beschränkt jedes Gewicht auf einen von drei Werten: -1, 0 oder +1. Das entspricht theoretisch etwa 1,58 Bit Information pro Gewicht. PrismML fügt ein FP16-Gruppenweises Scaling hinzu (wobei pro Gewichtsgruppe ein Skalierungsfaktor in voller Genauigkeit gespeichert wird, damit die komprimierten Werte weiterhin die richtige Größenordnung haben), was die tatsächlichen Kosten auf ungefähr 1,71 effektive Bit pro Gewicht bringt. Die aggressivere 1-Bit-Binärvariante lässt die Null weg und behält nur -1 und +1 bei, was bei knapp 1,125 effektiven Bit liegt.

Zwei Details sind wichtig. Erstens ist die Komprimierung End-to-End: Embeddings, Attention, die MLP-Blöcke und der Language-Model-Head sind alle quantisiert, ohne dass Vollpräzisionskomponenten als Krücke übrig bleiben. Zweitens ist die Basis Qwen3.6 27B (27,8B Parameter, ein hybrides Attention-Causal-Modell), sodass Bonsai den 262K-Token-Kontextfenster und den multimodalen Input dieses Modells übernimmt.

Dreistufig oder 1-Bit: Welchen Build herunterladen

PrismML wird in zwei Builds geliefert, und die falsche Wahl verschwendet entweder Speicher oder Qualität. Der Kompromiss ist einfach: kleinere Datei, geringere Genauigkeit.

BuildEffektive Bits/GewichtGrößeErhaltene QualitätAm besten geeignet für
Ternär (-1, 0, +1)~1.715.9GB>95% von FP16Desktop, qualitätssensible Arbeit
1-Bit binär (-1, +1)~1.1253.9GB>90% von FP16Telefone, knappe Speicherbudgets

Wenn Sie auf einem Telefon arbeiten, ist der 1-Bit-Build derjenige, der in den Speicherpuffer eines iPhone 17 Pro passt. Wenn Sie einen Laptop oder Desktop mit genügend freiem Speicher haben, bringt der ternäre Build für zwei zusätzliche Gigabyte mehrere Genauigkeitspunkte zurück – das lohnt sich immer dann, wenn die Ausgabequalität wichtiger ist als der Speicherbedarf.

Was die Benchmarks tatsächlich aussagen (und wo die Qualität nachlässt)

Die offiziellen Zahlen beziehen sich auf den ternären Build, der im Durchschnitt 80,49 über 15 Thinking-Mode-Benchmarks erreicht. Besonders hervorzuheben sind die starken Ergebnisse:

BenchmarkWertWas es misst
MATH-50099.20Mathematik von Schulniveau bis Wettkampfniveau
AIME 202590.84Schwere Wettkampfmathematik
HumanEval+93.90Codegenerierung
BFCL v374.41Funktions-/Tool-Aufrufe

Lies diese nebeneinander, und die Form von Bonsai 27B wird klar. Mathematik und Code liegen in den 90ern. Tool-Calling liegt in den 70ern. Diese Lücke ist das mit Abstand Wichtigste, das man verstehen muss, bevor man sich darauf verlässt: Die Quantisierung bewahrt Schlussfolgerungen und Code weit besser als das strukturierte, mehrstufige Verhalten, von dem agentische Workflows abhängen.

Diese Zahlen stammen von PrismML selbst, also betrachten Sie sie eher als Ausgangspunkt denn als letztes Wort, bis unabhängige Benchmarks sich ansammeln. Die Signale, auf die es sich zu achten lohnt, sind diejenigen, die ein Durchschnittswert in der Schlagzeile verdeckt: Prüfen Sie die task-spezifischen Werte statt des Mittelwerts von 80.49, und beachten Sie die Fehlermodi, auf die Nutzer tatsächlich stoßen. Frühe Tester haben berichtet, dass der ternary Build gelegentlich in Reasoning-Loops hängen bleibt, und extreme Quantisierung neigt dazu, die Stabilität bei langem Kontext stärker zu beeinträchtigen, als ein Einzel-Task-Score vermuten lässt. Beides lohnt sich, bevor Sie sich darauf verlassen, mit Ihren eigenen Prompts kurz zu testen.

Wie schnell es läuft und auf welcher Hardware

Kompression, die so aggressiv ist, ist nur dann relevant, wenn die Inferenz schnell genug ist, um sie zu nutzen. Auf geeigneter Hardware ist das der Fall. Dies sind die von PrismML selbst gemeldeten Zahlen:

Gerät1-bitTernär
iPhone 17 Pro11 tok/s
Apple M5 Max87 tok/s58 tok/s
NVIDIA RTX 5090163 tok/s134 tok/s

Die 11 Tokens pro Sekunde auf einem Telefon sind für Chat und kurzes Reasoning brauchbar, wenn auch nicht blitzschnell. Auf einem M5 Max sind 87 Tokens pro Sekunde schnell genug, dass lokale Inferenz bei kurzen Prompts, sobald man die Netzwerk-Roundtrips mit einrechnet, einen Cloud-API-Aufruf schlagen kann. Eine Art und Weise, wie PrismML die Leistung einordnet, ist die intelligence density (Benchmark-Score pro Gigabyte), wobei Bonsai bei etwa 0,53 liegt, also ungefähr zehnmal so hoch wie eine Full-Precision-Baseline.

Vier Möglichkeiten, Bonsai 27B jetzt sofort auszuführen

Da die Gewichte offen sind, gibt es keinen einzelnen „Installations“-Pfad. Hier sind die vier, die heute funktionieren, von Null-Einrichtung bis zur vollständigen Kontrolle.

Auf einem iPhone

Die Locally AI iOS-App führt den 1-Bit-3,9-GB-Build direkt auf dem Gerät aus, ohne Konto oder Server erforderlich. Dies ist der Weg, der das Versprechen von „27B auf einem Handy“ einlöst, und er funktioniert vollständig offline, sobald die Gewichte heruntergeladen wurden.

In einem Browser

PrismML veröffentlicht WebGPU-Kerne, die das 1-Bit-Modell direkt in einem Browser-Tab ausführen, ganz ohne Installation. Es ist der schnellste Weg, Bonsai 27B auszuprobieren, bevor Sie Speicherplatz belegen, allerdings benötigen Sie dafür einen Rechner mit einer GPU, die WebGPU unterstützt.

Auf Ihrem eigenen Rechner

Die GGUF-, MLX- und ONNX-Gewichte sind alle auf Hugging Face und GitHub unter Apache 2.0 verfügbar. Die Haupt-Repositories sind prism-ml/Bonsai-27B-gguf (1-Bit) und prism-ml/Ternary-Bonsai-27B-gguf (ternär), daneben gibt es MLX-2-Bit- und ONNX-Builds. Planen Sie grob 4 GB freien Speicher und RAM für den 1-Bit-Build und 6 GB für den ternären ein. Ein Vorbehalt: Die Reife der Tools hinkt der Veröffentlichung hinterher. Die Gewichte laden in mehreren Runtimes, aber die vollständige Unterstützung in beliebten lokalen Apps wie LM Studio war zum Start noch nicht vorhanden, also rechnen Sie mit etwas manueller Einrichtung.

The Hugging Face prism-ml collection page for Bonsai 27B showing the WebGPU kernels and GGUF model variants with download counts

Über eine gehostete API

Wenn Sie Gewichte lieber nicht selbst verwalten möchten, bietet Together.ai die ternäre Variante über eine standardmäßige API mit dem vollständigen 262K-Kontextfenster, Vision-Eingabe und JSON-Modus an. Der Preis für Eingaben war während der Einführungsaktion mit $0.00 pro Million Tokens angegeben, also prüfen Sie den aktuellen Tarif, bevor Sie damit kalkulieren, da sich Aktionspreise ändern.

The Together.ai model page for PrismML Ternary Bonsai 27B showing CHAT, REASONING, and VISION tags and the 95% quality claim

Bonsai 27B vs Gemma 4 12B QAT

Der Vergleich, der immer wieder auftaucht, ist Gemma 4 12B QAT, Googles quantisierungsbewusst trainiertes Modell, das bei etwa 7 GB liegt und nur geringfügig größer ist als Bonsais ternärer Build.

Sie punkten auf unterschiedlichen Ebenen. Bonsai 27B schlägt Gemma bei Mathematik- und Coding-Benchmarks eindeutig, dank dieser 27B-Basis. Gemma hält sich bei Vision und Tool-Calling tendenziell besser, und seine etwas größeren, weniger aggressiv komprimierten Gewichte machen es auf einem Telefon zur stabileren Wahl für allgemeine Aufgaben. Wenn Ihre On-Device-Workload aus Reasoning und Code besteht, ist Bonsai die stärkere Wahl; wenn sie sich auf Bilder oder Function Calling stützt, ist Gemma 4 12B QAT die sicherere Option.

Wer sollte Bonsai 27B tatsächlich verwenden

Verwenden Sie Bonsai 27B, wenn Sie offline, private Inferenz oder Coding-Unterstützung direkt auf dem Gerät wünschen und ein Gerät der Klasse iPhone 17 Pro oder einen leistungsfähigen Laptop haben. Es ist auch ein überzeugendes Studienobjekt für alle, die sich für extreme Quantisierung interessieren: Die Tatsache, dass ein 27B-Modell in einem Browser-Tab läuft, ist ein echter Meilenstein, und die offene Apache-2.0-Lizenz erleichtert Experimente. Es fügt sich ganz natürlich neben andere offene und kostenlose Modelle, die sich fürs Programmieren lohnen ein, wenn Sie eine lokale Option wünschen.

Verwenden Sie es noch nicht für produktive agentische Systeme, die auf zuverlässige Tool-Aufrufe angewiesen sind, für visuell kritische Aufgaben oder für alles, bei dem der Failure-Mode der Reasoning-Schleife kostspielig wäre. Dafür bleibt ein weniger komprimiertes Modell oder ein Modell mit voller Präzision hinter einer API die sicherere Wahl.

Häufig gestellte Fragen

Ist Bonsai 27B kostenlos nutzbar?

Die Gewichte sind unter der Apache-2.0-Lizenz kostenlos verfügbar, sodass Sie sie ohne Kosten herunterladen und ausführen können. Der gehostete Zugriff über Together.ai hat eine eigene API-Preisgestaltung; zum Start war ein Preis von 0,00 $ pro Million Input-Token angegeben, daher sollten Sie den aktuellen Tarif bestätigen.

Kann Bonsai 27B wirklich auf einem Telefon laufen?

Ja. Der 1-Bit-Build ist 3,9 GB groß und läuft auf einem iPhone 17 Pro mit etwa 11 Tokens pro Sekunde über die Locally AI App, vollständig offline, sobald er heruntergeladen wurde.

Ist Bonsai 27B so gut wie das vollständige Qwen3.6 27B?

Nahe dran, aber nicht identisch. Der ternäre Build behält mehr als 95 % der Full-Precision-Benchmark-Performance bei, und der 1-Bit-Build mehr als 90 %, wobei die Beibehaltung bei Mathematik und Code am stärksten und beim Tool Calling am schwächsten ist.

Welche Bonsai-27B-Datei sollte ich herunterladen?

Auf einem Telefon oder einem speicherknappen Gerät nehmen Sie den 1-bit-Build (prism-ml/Bonsai-27B-gguf, etwa 3,9GB). Auf einem Desktop oder einer GPU, auf der Sie genügend Spielraum haben, nehmen Sie den ternären Build (prism-ml/Ternary-Bonsai-27B-gguf, etwa 5,9GB) für die zusätzlichen paar Punkte an Genauigkeit. MLX-2-bit- und ONNX-Varianten existieren für Apple Silicon und plattformübergreifende Laufzeiten.

Was ist ternäre Quantisierung?

Es speichert jedes Modellgewicht als einen von drei Werten (-1, 0 oder +1) statt als eine Zahl mit voller Präzision, weshalb das Modell so drastisch schrumpft. FP16-Skalierungsfaktoren halten die komprimierten Gewichte ungefähr in der richtigen Größenordnung.

Unterstützt Bonsai 27B Bilder?

Ja, es akzeptiert Bildeingaben zusammen mit Text und gibt Textausgaben zurück, wobei es die multimodale Fähigkeit seiner Qwen3.6 27B-Basis übernimmt. Die Bildqualität hält unter der Kompression nicht so gut mit wie Mathematik und Code.