Bonsai 27B — это тернарно-квантованная сборка Qwen3.6 27B от PrismML, и её главное утверждение действительно впечатляет: она помещает модель с 27 миллиардами параметров в 3,9 ГБ и работает на iPhone 17 Pro со скоростью около 11 токенов в секунду. Веса доступны бесплатно по лицензии Apache 2.0, а тернарная версия сохраняет более 95% от оценки полноточного бенчмарка. Но есть нюанс: качество, которое она сохраняет, неравномерно: математика и кодинг остаются почти на уровне оригинала, тогда как вызов инструментов и работа с изображениями заметно ухудшаются. Поэтому Bonsai 27B — полезная on-device модель для рассуждений и кода, но сомнительная для agentic-задач, сильно завязанных на инструменты. Это руководство рассказывает о том, как работает сжатие, что означают цифры, о четырёх способах запуска и о том, кому вообще стоит этим заниматься.
Как PrismML уменьшила модель 27B, чтобы она поместилась в телефон
Стандартная модель 27B в FP16 требует примерно 54 ГБ памяти — намного больше, чем есть у любого телефона. Bonsai 27B укладывается менее чем в 6 ГБ, заменяя веса полной точности крошечными дискретными значениями.
Тернарный вариант ограничивает каждый вес одним из трёх значений: -1, 0 или +1. Это примерно 1.58 бита информации на вес в теории. PrismML добавляет групповое масштабирование FP16 (сохранение фактора масштабирования в полноточном формате для каждой группы весов, чтобы сжатые значения по-прежнему попадали в нужный диапазон), что повышает реальную стоимость примерно до 1.71 эффективного бита на вес. Более агрессивный 1-битный бинарный вариант убирает ноль и оставляет только -1 и +1, что даёт около 1.125 эффективного бита.
Две детали имеют значение. Во-первых, сжатие end-to-end: эмбеддинги, attention, блоки MLP и головная часть language model — все квантизированы, без каких-либо полноточных компонентов, оставленных в качестве подпорки. Во-вторых, базой является Qwen3.6 27B (27,8B параметров, гибридная attention причинная модель), поэтому Bonsai наследует у этой модели контекстное окно на 262K токенов и мультимодальный ввод.
Тернарная или 1-битная: какую сборку скачать
PrismML поставляется в двух сборках, и выбор неправильной приводит к потере либо памяти, либо качества. Компромисс прост: меньше файл — ниже точность.
| Сборка | Эффективных бит/вес | Размер | Сохранённое качество | Лучше всего для |
|---|---|---|---|---|
| Троичная (-1, 0, +1) | ~1.71 | 5.9GB | >95% от FP16 | Настольные ПК, задачи, чувствительные к качеству |
| 1-битная бинарная (-1, +1) | ~1.125 | 3.9GB | >90% от FP16 | Телефоны, строгие ограничения по памяти |
Если вы используете телефон, 1-битная сборка — это та, которая помещается в запас по памяти iPhone 17 Pro. Если у вас ноутбук или настольный компьютер с запасом памяти, троичная сборка возвращает несколько пунктов точности ценой двух дополнительных гигабайт — это оправдано всякий раз, когда качество результата важнее занимаемого места.
Что на самом деле говорят бенчмарки (и где качество снижается)
Официальные цифры относятся к троичной сборке, которая в среднем набирает 80.49 по 15 бенчмаркам режима мышления. Особенно выделяются сильные результаты:
| Бенчмарк | Оценка | Что он измеряет |
|---|---|---|
| MATH-500 | 99.20 | Математика от школьного до соревновательного уровня |
| AIME 2025 | 90.84 | Сложная соревновательная математика |
| HumanEval+ | 93.90 | Генерация кода |
| BFCL v3 | 74.41 | Вызов функций/инструментов |
Если читать эти данные бок о бок, становится ясно, что собой представляет Bonsai 27B. Математика и код находятся в 90-х. Вызов инструментов — в 70-х. Этот разрыв — самое важное, что нужно понять, прежде чем полагаться на него: квантизация сохраняет рассуждение и код куда лучше, чем структурированное, многошаговое поведение, от которого зависят agentic workflows.
Эти цифры — собственные данные PrismML, поэтому относитесь к ним как к отправной точке, а не как к окончательному вердикту, пока не накопятся независимые бенчмарки. Стоит следить за сигналами, которые скрывает заголовочное среднее: смотрите на оценки по отдельным задачам, а не на среднее значение 80.49, и обращайте внимание на реальные сбои, с которыми сталкиваются пользователи. Ранние тестировщики сообщали, что ternary-сборка иногда застревает в циклах рассуждений, а экстремальная квантизация, как правило, сильнее подрывает стабильность на длинном контексте, чем может показаться по оценке одной задачи. И то и другое стоит быстро проверить на ваших собственных промптах, прежде чем полагаться на это.
Насколько быстро это работает и на каком оборудовании
Такое агрессивное сжатие имеет значение только в том случае, если скорость инференса достаточно высока для практического использования. На подходящем оборудовании это так. Вот собственные опубликованные PrismML показатели:
| Устройство | 1-бит | Троичная |
|---|---|---|
| iPhone 17 Pro | 11 tok/s | — |
| Apple M5 Max | 87 tok/s | 58 tok/s |
| NVIDIA RTX 5090 | 163 tok/s | 134 tok/s |
11 токенов в секунду на телефоне достаточно для чата и коротких рассуждений, хоть это и не молниеносно. На M5 Max 87 токенов в секунду — это достаточно быстро, чтобы с учетом сетевых задержек локальный inference мог обойти вызов cloud API для коротких запросов. Один из способов, которым PrismML описывает это достижение, — плотность интеллекта (оценка в бенчмарке на гигабайт), где Bonsai достигает примерно 0.53, то есть примерно в десять раз лучше, чем baseline с полной точностью.
Четыре способа запустить Bonsai 27B прямо сейчас
Поскольку веса открыты, не существует единого пути «установки». Вот четыре варианта, которые работают сегодня — от запуска без настройки до полного контроля.
На iPhone
Приложение Locally AI для iOS запускает 1-bit сборку размером 3.9GB напрямую на устройстве, без необходимости аккаунта или сервера. Это путь, который реализует обещание «27B на телефоне», и после загрузки весов оно полностью работает офлайн.
В браузере
PrismML публикует WebGPU-ядра, которые запускают 1-битную модель прямо во вкладке браузера, без какой-либо установки. Это самый быстрый способ попробовать Bonsai 27B, прежде чем выделять место на диске, хотя вам понадобится машина с GPU, поддерживающим WebGPU.
На вашем компьютере
Весы GGUF, MLX и ONNX доступны на Hugging Face и GitHub под лицензией Apache 2.0. Основные репозитории — prism-ml/Bonsai-27B-gguf (1-bit) и prism-ml/Ternary-Bonsai-27B-gguf (ternary), а также сборки MLX 2-bit и ONNX. Закладывайте примерно 4 ГБ свободного хранилища и RAM для 1-bit сборки и 6 ГБ для ternary. Один нюанс: зрелость инструментов отстаёт от релиза. Весы загружаются в нескольких runtime, но полноценная поддержка в популярных локальных приложениях, таких как LM Studio, на момент запуска ещё не была реализована, так что ожидайте некоторой ручной настройки.
Через размещённый API
Если вы предпочитаете не управлять весами, Together.ai предоставляет ternary build через стандартный API с полным окном контекста 262K, поддержкой vision input и режимом JSON. Во время запуска цена на ввод была указана как $0.00 за миллион токенов, поэтому перед планированием бюджета проверьте текущий тариф, так как промо-цены меняются.
Bonsai 27B vs Gemma 4 12B QAT
Сравнение, которое постоянно всплывает, — это Gemma 4 12B QAT, модель Google, обученная с учетом квантизации, которая занимает около 7 ГБ и лишь немного больше тринарной сборки Bonsai.
Они выигрывают по разным параметрам. Bonsai 27B явно превосходит Gemma в математических и кодовых бенчмарках благодаря базе 27B. Gemma обычно лучше справляется с задачами зрения и вызова инструментов, а его немного более крупные, менее агрессивно сжатые веса делают его более стабильным универсальным выбором для телефона. Если ваша on-device нагрузка связана с рассуждением и кодом, Bonsai — более сильный вариант; если она опирается на изображения или вызов функций, Gemma 4 12B QAT — более безопасный выбор.
Кому на самом деле стоит использовать Bonsai 27B
Используйте Bonsai 27B, если вам нужна автономная, приватная, локальная помощь в рассуждениях или программировании, и у вас есть устройство уровня iPhone 17 Pro или производительный ноутбук. Это также весьма интересный объект для изучения для всех, кто интересуется экстремальной квантизацией: тот факт, что модель 27B работает во вкладке браузера, — это настоящий рубеж, а открытая лицензия Apache 2.0 облегчает эксперименты с ней. Она естественно вписывается рядом с другими открытыми и бесплатными моделями, которые стоит запускать для программирования, когда вам нужен локальный вариант.
Пока не используйте его для production agentic systems, которые зависят от надёжного tool calling, для vision-critical tasks или для любых задач, где сбой в reasoning-loop может дорого обойтись. Для них менее сжатая модель или модель полной точности через API остаётся более безопасным выбором.
Часто задаваемые вопросы
Бесплатно ли использовать Bonsai 27B?
Весы доступны бесплатно по лицензии Apache 2.0, так что вы можете скачать и запускать их без затрат. Доступ через Together.ai по API имеет собственную цену, которая на момент запуска была указана как $0.00 за миллион входных токенов, поэтому уточните текущую ставку.
Может ли Bonsai 27B действительно работать на телефоне?
Да. Сборка 1-bit занимает 3,9 GB и работает на iPhone 17 Pro примерно со скоростью 11 токенов в секунду через приложение Locally AI, полностью офлайн после загрузки.
Бонсай 27B так же хорош, как полноценный Qwen3.6 27B?
Близко, но не идентично. Троичная сборка сохраняет более 95% производительности по бенчмаркам полной точности, а 1-битная сборка — более 90%; при этом сохранение показателей наиболее сильное в математике и коде и наиболее слабое при вызове инструментов.
Какой файл Bonsai 27B мне следует загрузить?
На телефоне или на машине с ограниченной памятью возьмите 1-битную сборку (prism-ml/Bonsai-27B-gguf, около 3.9GB). На настольном ПК или GPU, где у вас есть запас по ресурсам, возьмите троичную сборку (prism-ml/Ternary-Bonsai-27B-gguf, около 5.9GB), чтобы получить несколько дополнительных пунктов точности. Варианты MLX 2-bit и ONNX доступны для Apple Silicon и кроссплатформенных runtime.
Что такое тернарная квантизация?
Он хранит каждый вес модели как одно из трёх значений (-1, 0 или +1) вместо числа полной точности, поэтому модель так сильно уменьшается. Масштабирующие коэффициенты FP16 сохраняют свернутые веса примерно в правильном диапазоне.
Поддерживает ли Bonsai 27B изображения?
Да, он принимает изображения вместе с текстом и возвращает текстовый вывод, унаследовав мультимодальную возможность своей базовой модели Qwen3.6 27B. Качество работы с изображениями под сжатием сохраняется хуже, чем в математике и коде.
