Bonsai 27B: 휴대폰에서 실행되는 27B AI 모델

마지막 업데이트: 2026-07-15 05:58:37

Bonsai 27B는 PrismML의 Qwen3.6 27B 삼진 양자화 빌드이며, 핵심 주장도 사실입니다: 270억 개 파라미터 모델을 3.9GB에 담아 iPhone 17 Pro에서 초당 약 11개의 토큰으로 실행합니다. 가중치는 Apache 2.0 아래 무료로 제공되며, 삼진 버전은 전체 정밀도 벤치마크 점수의 95% 이상을 유지합니다. 다만 유지되는 품질은 들쭉날쭉합니다: 수학과 코딩은 거의 동등한 수준을 유지하지만, tool-calling과 비전은 성능이 떨어집니다. 따라서 Bonsai 27B는 추론과 코드 작업을 위한 유용한 온디바이스 모델이지만, agentic하고 tool-heavy한 작업에는 다소 불안정한 모델입니다. 이 가이드에서는 압축이 어떻게 작동하는지, 수치가 무엇을 의미하는지, 이를 실행하는 네 가지 방법, 그리고 누가 관심을 가질 만한지 다룹니다.

A small bonsai tree growing out of a smartphone screen on a sunlit desk, illustrating a 27B AI model shrunk to fit a phone

PrismML이 27B 모델을 휴대폰에 맞게 줄인 방법

FP16의 표준 27B 모델은 대략 54GB의 메모리가 필요하며, 이는 어떤 휴대폰이 가진 용량보다 훨씬 큽니다. Bonsai 27B는 전체 정밀도 가중치를 작은 이산 값으로 대체하여 6GB 미만으로 줄였습니다.

삼진 변형은 모든 가중치를 -1, 0, +1 중 하나로 제한합니다. 이론적으로 이는 가중치당 약 1.58비트의 정보에 해당합니다. PrismML은 FP16 그룹별 스케일링(가중치 그룹마다 전체 정밀도 스케일링 계수를 저장하여 축약된 값이 여전히 올바른 크기에 도달하도록 함)을 추가하여 실제 비용을 가중치당 약 1.71개의 유효 비트로 만듭니다. 더 공격적인 1비트 이진 변형은 0을 제거하고 -1과 +1만 유지하여 유효 비트 수가 약 1.125비트에 이릅니다.

두 가지 세부 사항이 중요합니다. 첫째, 압축은 엔드투엔드입니다. 임베딩, 어텐션, MLP 블록, 그리고 언어 모델 헤드까지 모두 양자화되어 있으며, 의존할 수 있는 풀 프리시전 구성 요소는 남아 있지 않습니다. 둘째, 기반 모델은 Qwen3.6 27B(27.8B 파라미터, 하이브리드 어텐션 인과 모델)이므로, Bonsai는 이 모델의 262K 토큰 컨텍스트 윈도우와 멀티모달 입력을 그대로 이어받습니다.

3진법 또는 1비트: 어떤 빌드를 다운로드해야 하나요

PrismML은 두 가지 빌드로 제공되며, 잘못된 것을 선택하면 메모리 또는 품질이 낭비됩니다. 트레이드오프는 간단합니다: 파일이 작을수록 정확도는 낮아집니다.

빌드유효 비트/가중치크기유지된 품질최적 용도
3진수 (-1, 0, +1)~1.715.9GBFP16의 >95%데스크톱, 품질에 민감한 작업
1비트 이진 (-1, +1)~1.1253.9GBFP16의 >90%휴대폰, 메모리 제약이 큰 환경

휴대폰에서 실행 중이라면, 1비트 빌드는 iPhone 17 Pro의 메모리 여유 공간에 들어가는 버전입니다. 여유가 있는 노트북이나 데스크톱이 있다면, 삼진수 빌드는 추가로 2GB를 들여 몇 포인트의 정확도를 되찾아 줍니다. 출력 품질이 용량보다 더 중요할 때는 그만한 가치가 있습니다.

벤치마크가 실제로 말하는 것(그리고 품질이 떨어지는 지점)

공식 수치는 ternary 빌드 기준이며, 이는 15개의 사고 모드 벤치마크에서 평균 80.49를 기록합니다. 특히 뛰어난 항목들은 매우 인상적입니다:

벤치마크점수측정 대상
MATH-50099.20학년 수준에서 대회 수학까지
AIME 202590.84어려운 대회 수학
HumanEval+93.90코드 생성
BFCL v374.41함수/도구 호출

이들을 나란히 읽어보면 Bonsai 27B의 특징이 분명해집니다. 수학과 코드는 90점대에 있습니다. 도구 호출은 70점대에 있습니다. 이 격차는 그것을 신뢰하기 전에 반드시 이해해야 할 가장 중요한 단 하나의 사실입니다. 즉, 양자화는 에이전트형 워크플로우가 의존하는 구조화된 다단계 동작보다 추론과 코드를 훨씬 더 잘 보존합니다.

그 수치들은 PrismML 자체의 것이므로, 독립적인 벤치마크가 충분히 쌓이기 전까지는 최종 결론이 아니라 출발점으로 보아야 합니다. 주목할 만한 신호는 헤드라인 평균이 가려버리는 부분입니다. 80.49의 평균 대신 작업별 점수를 확인하고, 사람들이 실제로 겪는 실패 모드를 살펴보세요. 초기 테스터들은 ternary 빌드가 때때로 추론 루프에 갇힌다고 보고했으며, 극단적인 양자화는 단일 작업 점수가 시사하는 것보다 장문 컨텍스트 안정성을 더 크게 저하시키는 경향이 있습니다. 둘 다 실제로 사용하기 전에, 자신의 프롬프트로 간단히 테스트해 볼 가치가 있습니다.

얼마나 빠르게 실행되는지, 그리고 어떤 하드웨어에서 실행되는지

이 정도로 공격적인 압축은 추론이 사용할 수 있을 만큼 충분히 빠를 때만 중요합니다. 적절한 하드웨어에서는 그렇습니다. 다음은 PrismML이 자체적으로 보고한 수치입니다:

기기1-bitTernary
iPhone 17 Pro11 tok/s
Apple M5 Max87 tok/s58 tok/s
NVIDIA RTX 5090163 tok/s134 tok/s

휴대폰에서 초당 11 토큰은 매우 빠르지는 않더라도 채팅과 짧은 추론에는 사용할 수 있습니다. M5 Max에서는 초당 87 토큰이면 네트워크 왕복 시간을 감안할 때 짧은 프롬프트에 대해서는 로컬 추론이 클라우드 API 호출보다 더 빠를 수 있을 만큼 충분히 빠릅니다. PrismML이 이 성과를 설명하는 한 가지 방식은 지능 밀도(기가바이트당 벤치마크 점수)인데, 여기서 Bonsai는 약 0.53에 도달하며, 이는 완전 정밀도 기준선의 대략 10배에 해당합니다.

지금 바로 Bonsai 27B를 실행하는 네 가지 방법

가중치가 공개되어 있기 때문에, 하나의 "설치" 경로는 없습니다. 현재 사용할 수 있는 네 가지 방법을, 설정이 전혀 필요 없는 방식부터 완전한 제어까지 순서대로 소개합니다.

iPhone에서

Locally AI iOS 앱은 1-bit 3.9GB 빌드를 기기에서 직접 실행하며, 계정이나 서버가 필요하지 않습니다. 이것이 "27B on a phone" 약속을 실현하는 경로이며, 가중치가 다운로드되면 완전히 오프라인에서 작동합니다.

브라우저에서

PrismML은 설치 없이 브라우저 탭 안에서 1비트 모델을 실행하는 WebGPU 커널을 제공합니다. 디스크 공간을 할당하기 전에 Bonsai 27B를 시험해 볼 수 있는 가장 빠른 방법이지만, WebGPU를 지원하는 GPU가 있는 머신이 필요합니다.

자신의 머신에서

GGUF, MLX, 및 ONNX 가중치는 모두 Hugging Face와 GitHub에서 Apache 2.0 하에 제공됩니다. 주요 저장소는 prism-ml/Bonsai-27B-gguf (1-bit) 및 prism-ml/Ternary-Bonsai-27B-gguf (ternary)이며, 여기에 MLX 2-bit 및 ONNX 빌드도 함께 제공됩니다. 1-bit 빌드에는 대략 4GB의 여유 저장 공간과 RAM을, ternary에는 6GB를 예상하세요. 한 가지 주의할 점은 도구 성숙도가 출시를 따라가지 못한다는 것입니다. 가중치는 여러 런타임에서 로드되지만, LM Studio 같은 인기 있는 로컬 앱에 대한 완전한 지원은 출시 시점에는 아직 갖춰져 있지 않았으므로, 어느 정도 수동 설정이 필요할 것으로 예상하세요.

The Hugging Face prism-ml collection page for Bonsai 27B showing the WebGPU kernels and GGUF model variants with download counts

호스팅된 API를 통해

가중치를 직접 관리하고 싶지 않다면, Together.ai는 표준 API를 통해 262K 전체 컨텍스트 윈도우, 비전 입력, JSON 모드를 갖춘 ternary build를 제공합니다. 출시 프로모션 기간에는 입력 가격이 백만 토큰당 $0.00로 안내되었으므로, 프로모션 가격은 변경될 수 있으니 이를 기준으로 예산을 잡기 전에 현재 요금을 확인하세요.

The Together.ai model page for PrismML Ternary Bonsai 27B showing CHAT, REASONING, and VISION tags and the 95% quality claim

Bonsai 27B 대 Gemma 4 12B QAT

계속해서 언급되는 비교 대상은 Gemma 4 12B QAT로, Google의 양자화 인지 학습 모델이며, 크기는 약 7GB로 Bonsai의 3진수 빌드보다 약간 큰 정도입니다.

각기 다른 축에서 강점이 있습니다. Bonsai 27B는 27B 기반 덕분에 수학과 코딩 벤치마크에서 Gemma를 분명히 앞섭니다. Gemma는 비전과 tool calling에서 더 잘 버티는 편이고, 약간 더 크고 덜 공격적으로 압축된 가중치 덕분에 휴대폰에서 사용하는 범용 모델로는 더 안정적인 선택입니다. 온디바이스 작업이 추론과 코드라면 Bonsai가 더 강한 선택이고, 이미지나 function calling에 더 치중한다면 Gemma 4 12B QAT가 더 안전한 선택입니다.

실제로 Bonsai 27B를 사용해야 하는 사람은 누구인가

오프라인에서, 개인적으로, 기기 내 추론이나 코딩 지원이 필요하고 iPhone 17 Pro급 기기나 성능 좋은 노트북을 가지고 있다면 Bonsai 27B를 사용하세요. 또한 극단적인 양자화에 관심이 있는 사람이라면 누구에게나 매력적인 연구 대상입니다. 27B 모델이 브라우저 탭에서 실행된다는 사실은 정말 중요한 이정표이며, 개방형 Apache 2.0 라이선스 덕분에 실험하기도 쉽습니다. 로컬 옵션이 필요할 때는 프로그래밍용으로 실행해 볼 가치가 있는 다른 오픈 및 무료 모델과 자연스럽게 함께 사용할 수 있습니다.

아직은 신뢰할 수 있는 도구 호출에 의존하는 프로덕션 에이전틱 시스템, 비전이 중요한 작업, 또는 추론 루프 실패 모드의 비용이 큰 용도에는 사용하지 마세요. 그런 경우에는 더 덜 압축된 모델이나, API 뒤에 있는 full-precision 모델이 여전히 더 안전한 선택입니다.

자주 묻는 질문

Bonsai 27B를 무료로 사용할 수 있나요?

가중치는 Apache 2.0 라이선스에 따라 무료이므로, 비용 없이 다운로드하여 실행할 수 있습니다. Together.ai를 통한 호스팅 액세스에는 별도의 API 요금이 적용되며, 출시 당시 입력 토큰 100만 개당 $0.00로 안내되었으므로 현재 요금을 확인하세요.

Bonsai 27B가 정말 휴대폰에서 실행될 수 있나요?

네. 1비트 빌드는 3.9GB이며, Locally AI 앱을 통해 iPhone 17 Pro에서 초당 약 11 토큰 속도로 실행되며, 다운로드 후에는 완전 오프라인으로 동작합니다.

Bonsai 27B는 전체 Qwen3.6 27B만큼 좋은가요?

가깝지만 동일하지는 않습니다. 3비트 빌드는 전체 정밀도 벤치마크 성능의 95% 이상을 유지하고, 1비트 빌드는 90% 이상을 유지하며, 보존율은 수학과 코드에서 가장 높고 tool calling에서는 가장 낮습니다.

어떤 Bonsai 27B 파일을 다운로드해야 하나요?

휴대폰이나 메모리가 부족한 기기에서는 1-bit 빌드(prism-ml/Bonsai-27B-gguf, 약 3.9GB)를 사용하세요. 여유 공간이 있는 데스크톱이나 GPU에서는 몇 점의 정확도를 더 얻기 위해 ternary 빌드(prism-ml/Ternary-Bonsai-27B-gguf, 약 5.9GB)를 사용하세요. MLX 2-bit 및 ONNX 변형은 Apple Silicon과 크로스 플랫폼 런타임용으로 제공됩니다.

삼항 양자화란 무엇인가요?

각 모델 가중치를 전체 정밀도 숫자 대신 세 가지 값(-1, 0, 또는 +1) 중 하나로 저장하므로, 모델이 그렇게 극적으로 작아집니다. FP16 스케일링 인자는 압축된 가중치의 크기를 대략 올바르게 유지합니다.

Bonsai 27B는 이미지를 지원하나요?

예, 텍스트와 함께 이미지 입력을 받아들이고 텍스트 출력을 반환하며, Qwen3.6 27B 베이스의 멀티모달 기능을 계승합니다. 비전 품질은 압축 하에서 수학과 코드보다 덜 잘 유지됩니다.