Bonsai 27B: Un modelo de IA de 27B que funciona en tu teléfono

Última actualización: 2026-07-15 05:58:05

Bonsai 27B es la compilación cuantizada ternaria de PrismML de Qwen3.6 27B, y su afirmación principal es real: empaqueta un modelo de 27 mil millones de parámetros en 3.9GB y se ejecuta en un iPhone 17 Pro a unos 11 tokens por segundo. Los pesos son gratuitos bajo Apache 2.0, y la versión ternaria conserva más del 95% de la puntuación del benchmark de precisión completa. La pega es que la calidad que conserva es desigual: las matemáticas y la programación se mantienen casi al nivel de paridad, mientras que el uso de herramientas y la visión decaen. Así que Bonsai 27B es un modelo útil en el dispositivo para razonamiento y código, y uno flojo para trabajos agentivos con mucho uso de herramientas. Esta guía cubre cómo funciona la compresión, qué significan las cifras, las cuatro formas de ejecutarlo y quién debería interesarse.

A small bonsai tree growing out of a smartphone screen on a sunlit desk, illustrating a 27B AI model shrunk to fit a phone

Cómo PrismML redujo un modelo de 27B para que cupiera en un teléfono

Un modelo estándar de 27B en FP16 necesita aproximadamente 54GB de memoria, mucho más de lo que tiene cualquier teléfono. Bonsai 27B se queda por debajo de 6GB al reemplazar los pesos de precisión completa con pequeños valores discretos.

La variante ternaria restringe cada peso a uno de tres valores: -1, 0 o +1. Eso equivale a aproximadamente 1,58 bits de información por peso en teoría. PrismML añade escalado por grupos en FP16 (almacenando un factor de escalado de precisión completa por grupo de pesos para que los valores colapsados sigan teniendo la magnitud correcta), lo que eleva el coste real a aproximadamente 1,71 bits efectivos por peso. La variante binaria de 1 bit, más agresiva, elimina el cero y conserva solo -1 y +1, situándose cerca de 1,125 bits efectivos.

Dos detalles importan. Primero, la compresión es de extremo a extremo: los embeddings, la atención, los bloques MLP y la cabeza del modelo de lenguaje están todos cuantizados, sin dejar componentes de precisión completa como muleta. Segundo, la base es Qwen3.6 27B (27.8B parámetros, un modelo causal de atención híbrida), así que Bonsai hereda la ventana de contexto de 262K tokens de ese modelo y la entrada multimodal.

Terario o 1-bit: cuál compilación descargar

PrismML incluye dos compilaciones, y elegir la incorrecta desperdicia memoria o calidad. La compensación es simple: archivo más pequeño, menor precisión.

CompilaciónBits efectivos/pesoTamañoCalidad conservadaMejor para
Ternario (-1, 0, +1)~1.715.9GB>95% de FP16Escritorio, trabajo sensible a la calidad
Binario de 1 bit (-1, +1)~1.1253.9GB>90% de FP16Teléfonos, presupuestos de memoria ajustados

Si estás ejecutándolo en un teléfono, la compilación de 1 bit es la que cabe dentro del margen de memoria de un iPhone 17 Pro. Si tienes una laptop o computadora de escritorio con espacio de sobra, la compilación ternaria recupera varios puntos de precisión por dos gigabytes adicionales, algo que vale la pena siempre que la calidad de salida importe más que la huella.

Lo que realmente dicen los benchmarks (y dónde se resiente la calidad)

Las cifras oficiales corresponden a la versión ternaria, que promedia 80.49 en 15 benchmarks de modo de razonamiento. Los resultados destacados son sólidos:

BenchmarkPuntuaciónQué mide
MATH-50099.20Matemáticas de nivel escolar a competitivo
AIME 202590.84Matemáticas de competición difíciles
HumanEval+93.90Generación de código
BFCL v374.41Llamadas a funciones/herramientas

Lee esos resultados uno al lado del otro y la forma de Bonsai 27B queda clara. Las matemáticas y el código están en los 90. La llamada a herramientas está en los 70. Esa brecha es lo más importante que hay que entender antes de depender de él: la cuantización preserva el razonamiento y el código mucho mejor de lo que preserva el comportamiento estructurado y de varios pasos del que dependen los flujos de trabajo agenticos.

Esas cifras son propias de PrismML, así que tómelas como un punto de partida más que como la última palabra hasta que se acumulen benchmarks independientes. Las señales que vale la pena vigilar son las que oculta un promedio destacado: revise las puntuaciones por tarea en lugar de la media de 80.49, y observe los modos de fallo que la gente realmente encuentra. Los evaluadores tempranos han informado que la compilación ternaria ocasionalmente se queda atascada en bucles de razonamiento, y la cuantización extrema tiende a erosionar la estabilidad en contextos largos más de lo que sugiere una puntuación de una sola tarea. Ambos merecen una prueba rápida con sus propios prompts antes de que dependa de ello.

Qué tan rápido funciona y en qué hardware

Esta compresión tan agresiva solo importa si la inferencia es lo suficientemente rápida como para usarla. Lo es, en hardware capaz. Estas son las cifras informadas por PrismML:

Dispositivo1-bitTerciario
iPhone 17 Pro11 tok/s
Apple M5 Max87 tok/s58 tok/s
NVIDIA RTX 5090163 tok/s134 tok/s

Los 11 tokens por segundo en un teléfono son utilizables para chat y razonamiento breve, aunque no sean vertiginosos. En un M5 Max, 87 tokens por segundo son lo bastante rápidos como para que, una vez que cuentas los viajes de ida y vuelta de la red, la inferencia local pueda superar una llamada a una API en la nube para prompts cortos. Una forma en que PrismML enmarca el logro es la densidad de inteligencia (puntuación de benchmark por gigabyte), donde Bonsai se sitúa alrededor de 0.53, aproximadamente diez veces una línea base de precisión completa.

Cuatro formas de ejecutar Bonsai 27B ahora mismo

Porque los pesos son abiertos, no existe una única ruta de "instalación". Aquí están las cuatro que funcionan hoy, desde configuración cero hasta control total.

En un iPhone

La app iOS de Locally AI ejecuta la versión de 1 bit y 3.9 GB directamente en el dispositivo, sin necesidad de cuenta ni servidor. Esta es la vía que cumple la promesa de "27B en un teléfono", y funciona completamente sin conexión una vez que se han descargado los pesos.

En un navegador

PrismML publica kernels de WebGPU que ejecutan el modelo de 1 bit dentro de una pestaña del navegador, sin necesidad de instalar nada. Es la forma más rápida de probar Bonsai 27B antes de comprometer espacio en disco, aunque necesitas una máquina con una GPU compatible con WebGPU.

En tu propia máquina

Los pesos GGUF, MLX y ONNX están todos en Hugging Face y GitHub bajo Apache 2.0. Los repositorios principales son prism-ml/Bonsai-27B-gguf (1-bit) y prism-ml/Ternary-Bonsai-27B-gguf (ternario), con compilaciones MLX de 2 bits y ONNX junto a ellos. Presupuesta aproximadamente 4 GB de almacenamiento libre y RAM para la compilación de 1 bit y 6 GB para la ternaria. Una advertencia: la madurez de las herramientas va por detrás del lanzamiento. Los pesos se cargan en varios runtimes, pero la compatibilidad completa en aplicaciones locales populares como LM Studio aún no estaba disponible en el lanzamiento, así que espera cierta configuración manual.

The Hugging Face prism-ml collection page for Bonsai 27B showing the WebGPU kernels and GGUF model variants with download counts

Vía una API alojada

Si prefiere no gestionar pesos, Together.ai ofrece la versión ternaria detrás de una API estándar con la ventana de contexto completa de 262K, entrada de visión y modo JSON. El precio de entrada se सूची/?? The Together.ai model page for PrismML Ternary Bonsai 27B showing CHAT, REASONING, and VISION tags and the 95% quality claim

Bonsai 27B vs Gemma 4 12B QAT

La comparación que sigue apareciendo es Gemma 4 12B QAT, el modelo de Google entrenado con awareness de cuantización, que ocupa alrededor de 7 GB, solo ligeramente más grande que la versión ternaria de Bonsai.

Ganan en diferentes ejes. Bonsai 27B supera claramente a Gemma en benchmarks de matemáticas y programación, gracias a esa base de 27B. Gemma suele rendir mejor en visión y llamada de herramientas, y sus pesos ligeramente más grandes y menos agresivamente comprimidos la convierten en una opción generalista más estable en un teléfono. Si tu carga de trabajo en el dispositivo se centra en razonamiento y código, Bonsai es la mejor elección; si depende de imágenes o de la llamada a funciones, Gemma 4 12B QAT es la opción más segura.

Quién debería usar realmente Bonsai 27B

Usa Bonsai 27B si quieres razonamiento o asistencia de programación sin conexión, privada y en el dispositivo, y tienes un dispositivo de clase iPhone 17 Pro o un portátil capaz. También es un objeto de estudio muy atractivo para cualquiera interesado en la cuantización extrema: el hecho de que un modelo de 27B se ejecute en una pestaña del navegador es un auténtico hito, y la licencia abierta Apache 2.0 facilita experimentar con él. Encaja de forma natural junto a otros modelos abiertos y gratuitos que merece la pena ejecutar para programar cuando quieres una opción local.

No lo use todavía para sistemas agénticos de producción que dependan de una llamada a herramientas fiable, para tareas críticas de visión ni para cualquier cosa en la que el modo de fallo del ciclo de razonamiento sería costoso. Para esos casos, un modelo menos comprimido, o uno de precisión completa detrás de una API, sigue siendo la opción más segura.

Preguntas frecuentes

¿Bonsai 27B es gratis de usar?

Los pesos son gratuitos bajo la licencia Apache 2.0, por lo que puedes descargarlo y ejecutarlo sin costo. El acceso alojado a través de Together.ai tiene su propia tarificación de API, que se indicó en $0.00 por millón de tokens de entrada durante el lanzamiento, así que confirma la tarifa actual.

¿Puede Bonsai 27B realmente ejecutarse en un teléfono?

Sí. La versión de 1 bit tiene 3.9GB y se ejecuta en un iPhone 17 Pro a aproximadamente 11 tokens por segundo a través de la app Locally AI, completamente sin conexión una vez descargada.

¿Es Bonsai 27B tan bueno como el Qwen3.6 27B completo?

Cercano, pero no idéntico. La versión ternaria conserva más del 95% del rendimiento de referencia de precisión completa y la versión de 1 bit más del 90%, con la mayor retención en matemáticas y código y la menor en llamadas a herramientas.

¿Qué archivo de Bonsai 27B debo descargar?

En un teléfono o en una máquina con poca memoria, toma la versión de 1 bit (prism-ml/Bonsai-27B-gguf, aproximadamente 3.9GB). En una computadora de escritorio o GPU donde tengas espacio de sobra, toma la versión ternaria (prism-ml/Ternary-Bonsai-27B-gguf, aproximadamente 5.9GB) para esos pocos puntos extra de precisión. Existen variantes MLX de 2 bits y ONNX para Apple Silicon y runtimes multiplataforma.

¿Qué es la cuantización ternaria?

Almacena cada peso del modelo como uno de tres valores (-1, 0 o +1) en lugar de un número de precisión completa, por lo que el modelo se reduce de forma tan drástica. Los factores de escala FP16 mantienen los pesos colapsados aproximadamente en la magnitud correcta.

¿Bonsai 27B admite imágenes?

Sí, acepta entrada de imágenes junto con texto y devuelve salida de texto, heredando la capacidad multimodal de su base Qwen3.6 27B. La calidad visual se mantiene menos bien que las matemáticas y el código bajo la compresión.