Bonsai 27B, PrismML'in Qwen3.6 27B için üçlü nicemlemeli derlemesidir ve manşet iddiası gerçekten doğrudur: 27 milyar parametreli bir modeli 3,9 GB içine sığdırır ve bir iPhone 17 Pro üzerinde saniyede yaklaşık 11 token hızında çalışır. Ağırlıklar Apache 2.0 altında ücretsizdir ve üçlü sürüm, tam hassasiyetli benchmark puanının %95'inden fazlasını korur. Ancak koruduğu kalite tutarsızdır: matematik ve kodlama neredeyse eşit seviyede kalırken, araç çağırma ve görme performansı düşer. Bu nedenle Bonsai 27B, muhakeme ve kod için yararlı bir cihaz içi modeldir, fakat ajan benzeri, araç yoğun işler için zayıf kalır. Bu rehber, sıkıştırmanın nasıl çalıştığını, sayıların ne anlama geldiğini, onu çalıştırmanın dört yolunu ve kimin bu işle uğraşması gerektiğini ele alır.
PrismML, 27B’lik bir modeli bir telefona sığacak şekilde nasıl küçülttü
FP16'deki standart bir 27B model, yaklaşık 54GB bellek gerektirir; bu da herhangi bir telefonun sahip olduğundan çok daha fazladır. Bonsai 27B, tam hassasiyetli ağırlıkları küçük ayrık değerlerle değiştirerek 6GB'ın altına iner.
Ternary varyant, her bir ağırlığı üç değerden birine kısıtlar: -1, 0 veya +1. Bu, teoride ağırlık başına yaklaşık 1,58 bit bilgi demektir. PrismML, FP16 grup bazlı ölçekleme ekler (grup başına tam hassasiyetli bir ölçekleme faktörü saklayarak, sıkıştırılmış değerlerin doğru büyüklüğe gelmesini sağlar), bu da gerçek maliyeti ağırlık başına yaklaşık 1,71 etkin bite çıkarır. Daha agresif 1-bit ikili varyant ise sıfırı kaldırır ve yalnızca -1 ile +1'i tutar; bu da yaklaşık 1,125 etkin bite iner.
İki ayrıntı önemlidir. Birincisi, sıkıştırma uçtan uca yapılmıştır: embedding'ler, attention, MLP blokları ve language-model head'in hepsi kuantize edilmiştir; tam hassasiyetli hiçbir bileşen bir dayanak olarak bırakılmamıştır. İkincisi, temel Qwen3.6 27B'dir (27.8B parametreli, hibrit-attention nedensel bir model), bu nedenle Bonsai, bu modelin 262K-token bağlam penceresini ve çok modlu girdisini devralır.
Ternary mi yoksa 1-bit mi: hangi sürümü indirmelisiniz
PrismML iki sürümle gelir ve yanlış olanı seçmek ya bellek ya da kalite israfına yol açar. Değiş tokuş basittir: daha küçük dosya, daha düşük doğruluk.
| Yapı | Etkin bit/ağırlık | Boyut | Korunan kalite | En uygun kullanım |
|---|---|---|---|---|
| Üçlü (-1, 0, +1) | ~1.71 | 5.9GB | FP16'nın >95'i | Masaüstü, kaliteye duyarlı işler |
| 1-bit ikili (-1, +1) | ~1.125 | 3.9GB | FP16'nın >90'ı | Telefonlar, kısıtlı bellek bütçeleri |
Bir telefonda çalışıyorsanız, 1-bit build iPhone 17 Pro'nun bellek payına sığan sürümdür. Fazladan alanı olan bir dizüstü bilgisayarınız veya masaüstünüz varsa, ternary build iki ek gigabayt karşılığında birkaç puan doğruluğu geri kazandırır; çıktı kalitesi ayak izinden daha önemli olduğunda buna değer.
Karşılaştırmaların aslında ne dediği (ve kalitenin nerede düştüğü)
Resmi sayılar, 15 düşünme modu benchmarkı boyunca ortalama 80,49 alan ternary sürüm içindir. Öne çıkanlar güçlüdür:
| Benchmark | Puan | Ne ölçer |
|---|---|---|
| MATH-500 | 99.20 | Okul düzeyinden yarışma düzeyine matematik |
| AIME 2025 | 90.84 | Zor yarışma matematiği |
| HumanEval+ | 93.90 | Kod üretimi |
| BFCL v3 | 74.41 | Fonksiyon/araca çağrı |
Yan yana okuduğunuzda Bonsai 27B’nin yapısı netleşiyor. Matematik ve kod 90’larda yer alıyor. Tool calling 70’lerde yer alıyor. Bu fark, ona güvenmeden önce anlaşılması gereken en önemli şeydir: quantization, reasoning ve code’u, agentic workflows’un dayandığı yapılandırılmış, çok adımlı davranışı koruduğundan çok daha iyi koruyor.
Bu rakamlar PrismML'e ait olduğu için, bağımsız kıyaslamalar birikene kadar onları nihai sözden ziyade bir başlangıç noktası olarak değerlendirin. Takip etmeye değer sinyaller, manşetlerdeki ortalamanın gizlediği sinyallerdir: 80.49 ortalaması yerine görev bazındaki puanlara bakın ve insanların gerçekte karşılaştığı hata modlarını not edin. İlk test edenler, ternary build'in zaman zaman akıl yürütme döngülerinde takılıp kaldığını ve aşırı quantization'ın uzun bağlam kararlılığını tek bir görev puanının düşündürdüğünden daha fazla aşındırma eğiliminde olduğunu bildirdi. İkisi de, ona güvenmeden önce kendi promptlarınız üzerinde hızlı bir testi hak ediyor.
Ne kadar hızlı çalışır ve hangi donanımda
Böylesine agresif bir sıkıştırma yalnızca çıkarım yeterince hızlıysa önemlidir. Yetenekli donanımda öyledir. Bunlar PrismML’nin kendi bildirdiği değerlerdir:
| Cihaz | 1-bit | Üçlü |
|---|---|---|
| iPhone 17 Pro | 11 tok/s | — |
| Apple M5 Max | 87 tok/s | 58 tok/s |
| NVIDIA RTX 5090 | 163 tok/s | 134 tok/s |
Bir telefonda saniyede 11 token, çok hızlı olmasa da sohbet ve kısa akıl yürütme için kullanılabilir. M5 Max üzerinde saniyede 87 token, ağ gidiş dönüşlerini de hesaba kattığınızda, kısa prompt’lar için yerel inference’ın bir cloud API çağrısını geçebileceği kadar hızlıdır. PrismML’nin bu başarıyı çerçeveleme yollarından biri intelligence density’dir (gigabayt başına benchmark skoru); burada Bonsai yaklaşık 0.53’e ulaşır, bu da tam hassasiyetli bir baseline’ın kabaca on katıdır.
Bonsai 27B'yi hemen çalıştırmanın dört yolu
Ağırlıklar açık olduğu için tek bir "kurulum" yolu yoktur. İşte bugün çalışan dört seçenek; sıfır kurulumdan tam denetime kadar.
Bir iPhone'da
Locally AI iOS uygulaması, 1-bit 3.9GB derlemesini doğrudan cihazda çalıştırır; hesap veya sunucu gerekmez. Bu, "bir telefonda 27B" vaadini gerçeğe dönüştüren yoldur ve ağırlıklar indirildikten sonra tamamen çevrimdışı çalışır.
Bir tarayıcıda
PrismML, 1-bit modeli bir tarayıcı sekmesi içinde çalıştıran WebGPU kernel'lerini yayınlar; hiçbir kurulum gerekmez. Disk alanı ayırmadan önce Bonsai 27B'yi denemenin en hızlı yoludur, ancak WebGPU destekli bir GPU'ya sahip bir makineye ihtiyacınız vardır.
Kendi makinenizde
GGUF, MLX ve ONNX ağırlıklarının tümü Hugging Face ve GitHub üzerinde Apache 2.0 lisansı altında yer alıyor. Ana depolar prism-ml/Bonsai-27B-gguf (1-bit) ve prism-ml/Ternary-Bonsai-27B-gguf (ternary) olup, bunların yanında MLX 2-bit ve ONNX sürümleri de bulunuyor. 1-bit yapı için yaklaşık 4GB boş depolama alanı ve RAM, ternary için ise 6GB ayırın. Bir uyarı: araçların olgunluğu sürümün gerisinde kalıyor. Ağırlıklar birkaç çalışma zamanında yüklenebiliyor, ancak LM Studio gibi popüler yerel uygulamalarda tam destek lansman sırasında henüz hazır değildi; bu nedenle bir miktar manuel kurulum bekleyin.
Barındırılan bir API aracılığıyla
Ağırlıkları yönetmek istemiyorsanız, Together.ai ternary sürümünü standart bir API üzerinden, tam 262K context window, vision input ve JSON mode ile sunar. Giriş fiyatlandırması lansman promosyonu sırasında milyon token başına $0.00 olarak listelenmişti; bu nedenle bütçenizi buna göre ayarlamadan önce güncel oranı doğrulayın, çünkü promosyon fiyatlandırması değişebilir.
Bonsai 27B ile Gemma 4 12B QAT
Karşılaştırması sık sık yapılan model Gemma 4 12B QAT, Google'ın kuantizasyon farkındalıklı eğitilmiş modeli olup yaklaşık 7GB yer kaplar ve Bonsai'nin ternary derlemesinden yalnızca biraz daha büyüktür.
Farklı eksenlerde öne çıkıyorlar. Bonsai 27B, 27B temel modelinin de etkisiyle matematik ve kodlama benchmark’larında Gemma’yı açıkça geride bırakıyor. Gemma ise görsel görevlerde ve araç çağırmada genelde daha iyi dayanıyor; biraz daha büyük ve daha az agresif sıkıştırılmış ağırlıkları, telefonda daha istikrarlı bir genel amaçlı tercih olmasını sağlıyor. Cihaz üzerindeki iş yükünüz akıl yürütme ve kod ise, Bonsai daha güçlü seçimdir; görüntülere veya fonksiyon çağırmaya dayanıyorsa, Gemma 4 12B QAT daha güvenli olandır.
Bonsai 27B’yi aslında kimler kullanmalı
Çevrimdışı, gizli, cihaz üzerinde akıl yürütme veya kodlama desteği istiyorsanız ve bir iPhone 17 Pro sınıfı cihaza ya da güçlü bir dizüstü bilgisayara sahipseniz Bonsai 27B’yi kullanın. Aşırı kuantizasyonla ilgilenen herkes için de dikkate değer bir inceleme konusudur: 27B’lik bir modelin bir tarayıcı sekmesinde çalışması gerçek bir dönüm noktasıdır ve açık Apache 2.0 lisansı, onunla deney yapmayı kolaylaştırır. Yerel bir seçenek istediğinizde, programlama için çalıştırmaya değer diğer açık ve ücretsiz modellerin yanında doğal bir şekilde yerini alır.
Güvenilir tool calling'e bağlı üretim agentic sistemler, vision açısından kritik görevler veya reasoning-loop hata modunun maliyetli olacağı herhangi bir şey için henüz kullanmayın. Bunlar için, daha az sıkıştırılmış bir model ya da bir API arkasındaki tam hassasiyetli bir model, daha güvenli seçenek olmaya devam eder.
Sıkça sorulan sorular
Bonsai 27B'yi kullanmak ücretsiz mi?
Ağırlıklar Apache 2.0 lisansı kapsamında ücretsizdir, bu nedenle onu ücretsiz olarak indirebilir ve çalıştırabilirsiniz. Together.ai üzerinden barındırılan erişimin kendi API fiyatlandırması vardır; bu, lansman sırasında milyon giriş tokenı başına $0.00 olarak listelenmişti, bu yüzden güncel oranı doğrulayın.
Bonsai 27B gerçekten bir telefonda çalışabilir mi?
Evet. 1-bit derleme 3,9 GB’dır ve indirildikten sonra tamamen çevrimdışı olarak Locally AI uygulaması üzerinden bir iPhone 17 Pro’da saniyede yaklaşık 11 token hızında çalışır.
Bonsai 27B, tam Qwen3.6 27B kadar iyi mi?
Yakın, ancak aynı değil. Üçlü derleme, tam hassasiyetli benchmark performansının %95’inden fazlasını korur ve 1-bit derleme %90’dan fazlasını korur; bu koruma en güçlü şekilde matematik ve kodda, en zayıf şekilde ise araç çağırmada görülür.
Hangi Bonsai 27B dosyasını indirmeliyim?
Bir telefonda veya belleği kısıtlı bir makinede, 1-bit sürümü alın (prism-ml/Bonsai-27B-gguf, yaklaşık 3.9GB). Boş alanınızın olduğu bir masaüstünde veya GPU üzerinde, ek birkaç doğruluk puanı için ternary sürümü (prism-ml/Ternary-Bonsai-27B-gguf, yaklaşık 5.9GB) alın. MLX 2-bit ve ONNX sürümleri Apple Silicon ve çapraz platform çalışma zamanları için mevcuttur.
Üçlü niceleme nedir?
Her model ağırlığını tam hassasiyetli bir sayı yerine üç değerden biri (-1, 0 veya +1) olarak saklar; bu nedenle model bu kadar dramatik biçimde küçülür. FP16 ölçekleme faktörleri, çöken ağırlıkları yaklaşık doğru büyüklükte tutar.
Bonsai 27B görselleri destekliyor mu?
Evet, metinle birlikte görüntü girdisini kabul eder ve metin çıktısı döndürür; Qwen3.6 27B tabanının çok modlu yeteneğini devralır. Görsel kalite, sıkıştırma altında matematik ve kod kadar iyi korunmaz.
