Bonsai 27B: Um Modelo de IA de 27B que Roda no Seu Celular

Última Atualização: 2026-07-15 05:58:23

Bonsai 27B é a versão quantizada em ternário do Qwen3.6 27B da PrismML, e sua principal दावा é real: ele compacta um modelo de 27 bilhões de parâmetros em 3,9 GB e roda em um iPhone 17 Pro a cerca de 11 tokens por segundo. Os pesos são gratuitos sob a licença Apache 2.0, e a versão ternária mantém mais de 95% da pontuação de benchmark da precisão total. O problema é que a qualidade que ele preserva é irregular: matemática e programação ficam próximas da equivalência, enquanto o uso de ferramentas e a visão sofrem queda. Portanto, o Bonsai 27B é um modelo útil no dispositivo para raciocínio e código, e um modelo instável para trabalho agentic, com uso intenso de ferramentas. Este guia cobre como a compressão funciona, o que os números significam, as quatro maneiras de executá-lo e quem deveria se interessar.

A small bonsai tree growing out of a smartphone screen on a sunlit desk, illustrating a 27B AI model shrunk to fit a phone

Como a PrismML reduziu um modelo de 27B para caber em um celular

Um modelo padrão de 27B em FP16 precisa de cerca de 54GB de memória, muito mais do que qualquer telefone tem. O Bonsai 27B fica abaixo de 6GB ao substituir os pesos de precisão total por valores discretos pequenos.

A variante ternária restringe cada peso a um de três valores: -1, 0 ou +1. Isso corresponde a cerca de 1,58 bits de informação por peso, em teoria. O PrismML adiciona escalonamento por grupo em FP16 (armazenando um fator de escalonamento em precisão total por grupo de pesos para que os valores compactados ainda fiquem na magnitude correta), o que eleva o custo real para aproximadamente 1,71 bits efetivos por peso. A variante binária mais agressiva, de 1 bit, elimina o zero e mantém apenas -1 e +1, chegando perto de 1,125 bits efetivos.

Dois detalhes importam. Primeiro, a compressão é de ponta a ponta: embeddings, atenção, os blocos MLP e o head do modelo de linguagem são todos quantizados, sem componentes em precisão total deixados como muleta. Segundo, a base é o Qwen3.6 27B (27,8B parâmetros, um modelo causal híbrido de atenção), então o Bonsai herda a janela de contexto de 262K tokens desse modelo e a entrada multimodal.

Ternário ou 1-bit: qual build baixar

O PrismML é distribuído em duas versões, e escolher a errada desperdiça memória ou qualidade. A troca é simples: arquivo menor, menor precisão.

BuildBits efetivos/pesoTamanhoQualidade mantidaMelhor para
Binário ternário (-1, 0, +1)~1.715.9GB>95% de FP16Desktop, trabalho sensível à qualidade
Binário de 1 bit (-1, +1)~1.1253.9GB>90% de FP16Celulares, orçamentos de memória apertados

Se você estiver usando um telefone, a versão de 1 bit é a que cabe na margem de memória do iPhone 17 Pro. Se você tiver um laptop ou desktop com espaço de sobra, a versão ternária recupera vários pontos de precisão por dois gigabytes extras, o que vale a pena sempre que a qualidade da saída importa mais do que o tamanho.

O que os benchmarks realmente dizem (e onde a qualidade cai)

Os números oficiais são para a versão ternária, que tem uma média de 80,49 em 15 benchmarks de modo de raciocínio. Os destaques são fortes:

BenchmarkPontuaçãoO que mede
MATH-50099.20Matemática do ensino básico à competição
AIME 202590.84Matemática de competição difícil
HumanEval+93.90Geração de código
BFCL v374.41Chamada de funções/ferramentas

Leia esses resultados lado a lado e a forma do Bonsai 27B fica clara. Matemática e código estão na casa dos 90. A chamada de ferramentas está na casa dos 70. Essa diferença é a coisa mais importante a entender antes de confiar nele: a quantização preserva o raciocínio e o código muito melhor do que preserva o comportamento estruturado e em várias etapas de que os fluxos de trabalho agentivos dependem.

Esses números são do próprio PrismML, então trate-os como um ponto de partida, e não como a palavra final, até que benchmarks independentes se acumulem. Os sinais que valem a pena acompanhar são aqueles que uma média de manchete esconde: verifique as pontuações por tarefa em vez da média de 80.49 e observe os modos de falha que as pessoas realmente encontram. Testadores iniciais relataram que a versão ternária ocasionalmente fica presa em loops de raciocínio, e a quantização extrema tende a corroer a estabilidade em contextos longos mais do que uma pontuação em uma única tarefa sugere. Ambos valem um teste rápido com seus próprios prompts antes de você confiar neles.

Quão rápido ele executa, e em qual hardware

A compressão tão agressiva só importa se a inferência for rápida o suficiente para ser usada. E ela é, em hardware capaz. Estes são os números informados pela própria PrismML:

Dispositivo1-bitTrinário
iPhone 17 Pro11 tok/s
Apple M5 Max87 tok/s58 tok/s
NVIDIA RTX 5090163 tok/s134 tok/s

Os 11 tokens por segundo em um telefone são utilizáveis para chat e raciocínio curto, embora não sejam impressionantes. Em um M5 Max, 87 tokens por segundo é rápido o suficiente para que, ao considerar as idas e voltas da rede, a inferência local possa superar uma chamada de API na nuvem para prompts curtos. Uma forma como a PrismML enquadra a conquista é a densidade de inteligência (pontuação de benchmark por gigabyte), em que o Bonsai fica em torno de 0,53, aproximadamente dez vezes um baseline de precisão total.

Quatro maneiras de executar o Bonsai 27B agora mesmo

Como os pesos são abertos, não existe um único caminho de "instalação". Aqui estão os quatro que funcionam hoje, do zero de configuração ao controle total.

Em um iPhone

O aplicativo iOS Locally AI executa a build de 3,9 GB de 1 bit diretamente no dispositivo, sem necessidade de conta ou servidor. Este é o caminho que cumpre a promessa de "27B em um telefone", e ele funciona totalmente offline depois que os pesos são baixados.

No navegador

O PrismML publica kernels WebGPU que executam o modelo de 1 bit dentro de uma aba do navegador, sem nenhuma instalação. É a forma mais rápida de experimentar o Bonsai 27B antes de comprometer espaço em disco, embora seja necessário um computador com uma GPU compatível com WebGPU.

No seu próprio computador

Os pesos GGUF, MLX e ONNX estão todos no Hugging Face e no GitHub sob a licença Apache 2.0. Os principais repositórios são prism-ml/Bonsai-27B-gguf (1-bit) e prism-ml/Ternary-Bonsai-27B-gguf (ternário), com builds MLX de 2 bits e ONNX junto. Reserve aproximadamente 4 GB de armazenamento livre e RAM para o build de 1 bit e 6 GB para o ternário. Uma ressalva: a maturidade das ferramentas ainda está atrás do lançamento. Os pesos carregam em vários runtimes, mas o suporte الكامل em apps locais populares como o LM Studio ainda não estava disponível no lançamento, então espere alguma configuração manual.

The Hugging Face prism-ml collection page for Bonsai 27B showing the WebGPU kernels and GGUF model variants with download counts

Via uma API hospedada

Se você preferir não gerenciar pesos, Together.ai oferece a versão ternária por trás de uma API padrão com a janela de contexto completa de 262K, entrada de visão e modo JSON. O preço de entrada foi listado como US$ 0,00 por milhão de tokens durante a promoção de lançamento, então verifique a taxa atual antes de fazer seu planejamento, pois os preços promocionais mudam.

The Together.ai model page for PrismML Ternary Bonsai 27B showing CHAT, REASONING, and VISION tags and the 95% quality claim

Bonsai 27B vs Gemma 4 12B QAT

A comparação que continua surgindo é Gemma 4 12B QAT, o modelo treinado com awareness de quantização do Google, que fica em torno de 7GB, apenas um pouco maior do que a versão ternária do Bonsai.

Eles vencem em eixos diferentes. O Bonsai 27B supera claramente o Gemma em benchmarks de matemática e programação, graças à base 27B. O Gemma tende a se sair melhor em visão e chamada de ferramentas, e seus pesos um pouco maiores, menos agressivamente comprimidos, fazem dele uma opção geral mais estável em um telefone. Se a sua carga de trabalho no dispositivo envolve raciocínio e código, o Bonsai é a melhor escolha; se ela depende de imagens ou chamada de funções, o Gemma 4 12B QAT é a opção mais segura.

Quem deve realmente usar o Bonsai 27B

Use Bonsai 27B se você quiser raciocínio ou assistência de programação offline, privada e no dispositivo, e tiver um dispositivo no nível do iPhone 17 Pro ou um laptop capaz. Ele também é um objeto de estudo convincente para qualquer pessoa interessada em quantização extrema: o fato de um modelo 27B rodar em uma aba do navegador é um marco real, e a licença aberta Apache 2.0 facilita a experimentação. Ele se encaixa naturalmente ao lado de outros modelos abertos e gratuitos que valem a pena executar para programação quando você quer uma opção local.

Não o use, ainda, para sistemas agentic de produção que dependem de chamadas de ferramentas confiáveis, para tarefas críticas de visão ou para qualquer coisa em que o modo de falha do loop de raciocínio seja custoso. Para esses casos, um modelo menos comprimido, ou um de precisão total por trás de uma API, continua sendo a aposta mais segura.

Perguntas frequentes

O Bonsai 27B é gratuito para usar?

Os pesos são gratuitos sob a licença Apache 2.0, então você pode baixá-lo e executá-lo sem custo. O acesso hospedado por meio da Together.ai tem sua própria precificação de API, que foi listada em US$ 0,00 por milhão de tokens de entrada durante o lançamento, então confirme a taxa atual.

O Bonsai 27B realmente pode ser executado em um telefone?

Sim. A versão de 1 bit tem 3,9 GB e roda em um iPhone 17 Pro a cerca de 11 tokens por segundo via o app Locally AI, totalmente offline depois de baixado.

O Bonsai 27B é tão bom quanto o Qwen3.6 27B completo?

Perto, mas não idêntico. A versão ternária mantém mais de 95% do desempenho de benchmark em precisão total e a versão de 1 bit mantém mais de 90%, com a retenção mais forte em matemática e código e mais fraca em chamadas de ferramentas.

Qual arquivo Bonsai 27B devo baixar?

Em um telefone ou em uma máquina com pouca memória, use a build de 1 bit (prism-ml/Bonsai-27B-gguf, cerca de 3,9 GB). Em um desktop ou GPU onde você tem espaço de sobra, use a build ternária (prism-ml/Ternary-Bonsai-27B-gguf, cerca de 5,9 GB) para obter alguns pontos extras de precisão. Existem variantes MLX de 2 bits e ONNX para Apple Silicon e runtimes multiplataforma.

O que é quantização ternária?

Ele armazena cada peso do modelo como um dos três valores (-1, 0 ou +1) em vez de um número de precisão total, o que é por isso que o modelo encolhe tão dramaticamente. Os fatores de escala FP16 mantêm os pesos colapsados aproximadamente na magnitude correta.

O Bonsai 27B suporta imagens?

Sim, ele aceita entrada de imagem junto com texto e retorna saída de texto, herdando a capacidade multimodal de sua base Qwen3.6 27B. A qualidade de visão se mantém menos bem do que matemática e código sob a compressão.