AIREITER

Bonsai 27B: ИИ-модель на 27 млрд параметров, которая запускается на смартфоне

Последнее обновление: 2026-07-29 11:19:30

Запустить модель на 27 млрд параметров прямо на смартфоне — уже не просто эффектная демонстрация. Bonsai 27B от PrismML действительно помещается в 3,9 ГБ и выдаёт на iPhone 17 Pro около 11 токенов в секунду. Это квантизированная версия Qwen3.6 27B с открытыми весами по лицензии Apache 2.0. Тернарная сборка сохраняет свыше 95% результата полновесной FP16-модели в бенчмарках, но качество распределено неравномерно: математика и код почти не проседают, а вызов инструментов и работа с изображениями заметно слабее. Для локальных рассуждений и программирования Bonsai 27B выглядит интересным вариантом; для агентных сценариев с активным использованием инструментов — пока не самым надёжным. Ниже — как достигнуто такое сжатие, что означают цифры тестов, как запустить модель и кому это имеет смысл.

Небольшое дерево бонсай растёт из экрана смартфона на освещённом солнцем столе — иллюстрация ИИ-модели на 27 млрд параметров, уменьшенной до размера для телефона

Как PrismML уместила модель 27B в памяти смартфона

Обычной модели на 27 млрд параметров в FP16 требуется примерно 54 ГБ памяти — для любого телефона это недостижимо. Bonsai 27B занимает менее 6 ГБ, поскольку вместо весов полной точности использует компактные дискретные значения.

В тернарной версии каждый вес ограничен тремя вариантами: -1, 0 или +1. Теоретически это около 1,58 бита информации на один вес. PrismML дополняет такую схему групповым масштабированием FP16: для каждой группы весов хранится коэффициент полной точности, чтобы сжатые значения сохраняли подходящий масштаб. В итоге фактическая стоимость составляет примерно 1,71 эффективного бита на вес. Ещё более агрессивный 1-битный бинарный вариант исключает ноль, оставляя только -1 и +1, и опускается примерно до 1,125 эффективного бита.

Здесь важны два момента. Во-первых, квантизация охватывает модель целиком: embeddings, attention, MLP-блоки и голову языковой модели. Полноточных компонентов, которые могли бы поддерживать качество, не остаётся. Во-вторых, основой служит Qwen3.6 27B — гибридная causal-модель с 27,8 млрд параметров. От неё Bonsai наследует контекстное окно в 262K токенов и мультимодальный ввод.

Тернарная или 1-битная: какую сборку выбрать

PrismML предлагает две сборки, и выбор здесь сводится к понятному компромиссу: меньший размер означает более низкую точность. Неподходящий вариант либо зря займёт память, либо даст ненужную потерю качества.

СборкаЭффективных бит на весРазмерСохранённое качествоЛучший сценарий
Тернарная (-1, 0, +1)~1,715,9 ГБ>95% от FP16Десктопы и задачи, чувствительные к качеству
1-битная бинарная (-1, +1)~1,1253,9 ГБ>90% от FP16Смартфоны и устройства с ограниченной памятью

Для смартфона стоит брать 1-битную сборку: именно она укладывается в доступный запас памяти iPhone 17 Pro. Если же у вас ноутбук или настольный компьютер с запасом памяти, тернарная версия за дополнительные 2 ГБ возвращает несколько пунктов точности. В случаях, когда важнее качество ответа, а не размер модели, это оправданный обмен.

Что показывают бенчмарки — и где начинаются потери

Официальные результаты относятся к тернарной сборке: её средний балл составляет 80,49 по 15 бенчмаркам в thinking-режиме. Отдельные показатели выглядят особенно сильно:

БенчмаркРезультатЧто измеряет
MATH-50099,20Математика от школьного до олимпиадного уровня
AIME 202590,84Сложные олимпиадные математические задачи
HumanEval+93,90Генерация кода
BFCL v374,41Вызов функций и инструментов

Если посмотреть на эти цифры вместе, профиль Bonsai 27B становится очевиден. Математика и программирование держатся на уровне 90+, а вызов инструментов — в диапазоне 70. Это ключевое ограничение, которое стоит учитывать до внедрения модели: квантизация гораздо лучше сохраняет способность рассуждать и писать код, чем структурированное многошаговое поведение, необходимое агентным системам.

Все приведённые результаты опубликованы самой PrismML, поэтому пока их разумнее считать отправной точкой, а не окончательным вердиктом — независимых тестов ещё должно накопиться. Среднее значение 80,49 скрывает важные детали: смотрите на результаты по конкретным задачам и на реальные сценарии сбоев. Первые тестировщики сообщали, что тернарная сборка иногда зацикливается в рассуждениях. Кроме того, экстремальная квантизация обычно сильнее ухудшает стабильность на длинном контексте, чем это видно по оценке одиночной задачи. Перед использованием в важном процессе стоит проверить модель на собственных промптах.

Скорость генерации на разных устройствах

Столь агрессивное сжатие имеет смысл лишь при достаточной скорости инференса. На производительном железе она есть. Ниже — данные PrismML:

Устройство1-битнаяТернарная
iPhone 17 Pro11 ток/с—
Apple M5 Max87 ток/с58 ток/с
NVIDIA RTX 5090163 ток/с134 ток/с

11 токенов в секунду на телефоне достаточно для чата и коротких рассуждений, хотя молниеносной такую скорость не назовёшь. На M5 Max 87 токенов в секунду — это уже уровень, при котором локальный запуск на коротких запросах может обогнать облачный API с учётом сетевых задержек. PrismML также предлагает смотреть на плотность интеллекта — балл бенчмарков на гигабайт. У Bonsai этот показатель около 0,53, то есть примерно в десять раз выше, чем у полновесной базовой модели.

Четыре способа запустить Bonsai 27B уже сейчас

Весы открыты, поэтому единственной команды для установки здесь нет. Вот четыре рабочих способа — от варианта без настройки до полного контроля над запуском.

На iPhone

Приложение Locally AI для iOS запускает 1-битную сборку размером 3,9 ГБ прямо на устройстве — без аккаунта и сервера. Именно этот путь реализует обещание «27B на телефоне»: после загрузки весов модель работает полностью офлайн.

В браузере

PrismML публикует WebGPU-ядра, позволяющие запустить 1-битную модель прямо во вкладке браузера без установки. Это самый быстрый способ попробовать Bonsai 27B, прежде чем выделять ей место на диске. Но потребуется компьютер с GPU, поддерживающим WebGPU.

Локально на компьютере

Веса в форматах GGUF, MLX и ONNX доступны на Hugging Face и GitHub по лицензии Apache 2.0. Основные репозитории — prism-ml/Bonsai-27B-gguf для 1-битной версии и prism-ml/Ternary-Bonsai-27B-gguf для тернарной; рядом доступны сборки MLX 2-bit и ONNX. Для 1-битного варианта стоит заложить около 4 ГБ свободного места и RAM, для тернарного — 6 ГБ. Есть нюанс: инструменты ещё не успели полноценно догнать релиз. Веса загружаются в нескольких рантаймах, но на момент запуска популярные локальные приложения, включая LM Studio, ещё не получили полной поддержки. Вероятно, понадобится ручная настройка.

Страница коллекции prism-ml Bonsai 27B на Hugging Face с WebGPU-ядрами, вариантами модели GGUF и числом загрузок

Через облачный API

Если не хочется самостоятельно управлять весами, тернарная сборка доступна через стандартный API на Together.ai. Поддерживаются полное контекстное окно 262K, ввод изображений и JSON mode. Во время стартовой акции цена входных токенов была указана как $0.00 за миллион токенов. Перед расчётом бюджета обязательно проверьте актуальный тариф: промоцену могут изменить.

Страница модели PrismML Ternary Bonsai 27B на Together.ai с тегами CHAT, REASONING и VISION, а также заявлением о сохранении 95% качества

Bonsai 27B или Gemma 4 12B QAT

Чаще всего Bonsai сравнивают с Gemma 4 12B QAT — моделью Google, обученной с учётом квантизации. Она занимает около 7 ГБ, то есть лишь немного больше тернарной версии Bonsai.

У моделей разные сильные стороны. Благодаря базе на 27B Bonsai 27B заметно превосходит Gemma в математических и кодовых бенчмарках. Gemma обычно лучше сохраняет качество в задачах зрения и вызова инструментов, а её чуть более крупные и менее агрессивно сжатые веса делают её более стабильным универсальным выбором для смартфона. Для локальных рассуждений и работы с кодом сильнее Bonsai; если в нагрузке много изображений или function calling, безопаснее выбрать Gemma 4 12B QAT.

Кому действительно стоит использовать Bonsai 27B

Bonsai 27B подойдёт тем, кому нужны приватные локальные рассуждения или помощь с программированием без подключения к сети, а в распоряжении есть устройство уровня iPhone 17 Pro или производительный ноутбук. Модель также интересна как объект для изучения экстремальной квантизации: запуск 27B-модели во вкладке браузера сам по себе стал важной вехой, а открытая лицензия Apache 2.0 упрощает эксперименты. Она органично дополняет другие открытые и бесплатные модели для программирования, когда нужен локальный вариант.

Пока не стоит применять её в промышленных агентных системах, где критичен надёжный вызов инструментов, в задачах с высокими требованиями к зрению или там, где дорого обойдётся зацикливание рассуждений. В таких случаях более слабо квантизированная модель либо полновесная версия через API остаётся более безопасным выбором.

Частые вопросы

Bonsai 27B можно использовать бесплатно?

Да, веса распространяются бесплатно по лицензии Apache 2.0: их можно скачать и запускать без оплаты. У хостингового доступа через Together.ai собственные тарифы API; на старте цена входных токенов была заявлена как $0.00 за миллион. Уточняйте текущую стоимость.

Bonsai 27B действительно работает на телефоне?

Да. 1-битная сборка занимает 3,9 ГБ и через приложение Locally AI работает на iPhone 17 Pro со скоростью около 11 токенов в секунду. После загрузки она полностью автономна.

Bonsai 27B так же хороша, как полная Qwen3.6 27B?

Почти, но не полностью. Тернарная сборка сохраняет более 95% результатов FP16-версии в бенчмарках, 1-битная — более 90%. Лучше всего сохраняются математика и код, хуже всего — вызов инструментов.

Какой файл Bonsai 27B скачивать?

Для телефона или машины с ограниченной памятью выбирайте 1-битную сборку — prism-ml/Bonsai-27B-gguf, около 3,9 ГБ. Для десктопа или GPU с запасом памяти лучше взять тернарную — prism-ml/Ternary-Bonsai-27B-gguf, около 5,9 ГБ: она даёт несколько дополнительных пунктов точности. Для Apple Silicon и кроссплатформенных рантаймов также есть варианты MLX 2-bit и ONNX.

Что такое тернарная квантизация?

При ней каждый вес модели хранится не как число полной точности, а как одно из трёх значений: -1, 0 или +1. За счёт этого размер модели резко сокращается. Коэффициенты масштабирования FP16 помогают сжатым весам сохранять примерно правильную величину.

Bonsai 27B поддерживает изображения?

Да. Модель принимает изображения вместе с текстом и возвращает текстовый ответ, наследуя мультимодальные возможности базовой Qwen3.6 27B. Однако после сжатия качество работы со зрением сохраняется хуже, чем в математике и программировании.