Bonsai 27B:一款可在手机上运行的 27B AI 模型

最后更新: 2026-07-15 05:58:53

Bonsai 27B 是 PrismML 对 Qwen3.6 27B 的三元量化版本,而它最醒目的说法是确有其事:它将一个 270 亿参数的模型压缩到 3.9GB,并且能在 iPhone 17 Pro 上以约每秒 11 个 token 的速度运行。权重可在 Apache 2.0 许可下免费获取,而三元版本保留了超过 95% 的全精度基准分数。问题在于,它保留下来的质量并不均衡:数学和编程几乎与原版持平,而工具调用和视觉能力则明显下降。因此,Bonsai 27B 是一个适合在设备端进行推理和代码任务的实用模型,但对于依赖 agent、工具较多的工作来说则不太可靠。本指南将介绍压缩的工作原理、这些数字的含义、运行它的四种方式,以及哪些人值得一试。

A small bonsai tree growing out of a smartphone screen on a sunlit desk, illustrating a 27B AI model shrunk to fit a phone

PrismML 如何将一个 27B 模型压缩到适配手机

标准的 27B 模型在 FP16 下大约需要 54GB 内存,远远超过任何手机的容量。Bonsai 27B 通过用微小的离散值替代全精度权重,将内存占用降至 6GB 以下。

三值变体将每个权重限制为三个取值之一:-1、0 或 +1。理论上,这大约相当于每个权重 1.58 比特的信息量。PrismML 增加了 FP16 组级缩放(为每组权重存储一个全精度缩放因子,以便折叠后的数值仍能落在正确的量级上),这使得实际成本约为每个权重 1.71 个有效比特。更激进的 1 比特二值变体去掉了零,只保留 -1 和 +1,约为 1.125 个有效比特。

有两个细节很重要。首先,这种压缩是端到端的:embeddings、attention、MLP blocks 以及语言模型头都经过了量化,不再保留任何全精度组件作为依赖。其次,其基础模型是 Qwen3.6 27B(27.8B 参数,一个 hybrid-attention causal 模型),因此 Bonsai 继承了该模型的 262K-token 上下文窗口和多模态输入能力。

三态还是 1 位:下载哪个构建版本

PrismML 提供两个构建版本,选错了会浪费内存或降低质量。权衡很简单:文件越小,准确率越低。

构建有效位/权重大小保留质量最适合
三元(-1、0、+1)~1.715.9GB>95% 的 FP16桌面端,对质量敏感的工作
1 位二进制(-1、+1)~1.1253.9GB>90% 的 FP16手机,内存预算紧张

如果你在手机上运行,1-bit 构建是最适合 iPhone 17 Pro 内存余量的版本。如果你有一台笔记本或台式机,并且还有足够的空间,三进制构建可以用额外 2 GB 的内存换回几个百分点的准确率;只要输出质量比占用空间更重要,这就很值得。

基准测试实际说明了什么(以及质量在哪些方面下降)

官方数字适用于三元构建版本,该版本在 15 个思考模式基准测试中的平均分为 80.49。表现突出的结果非常强劲:

基准分数衡量内容
MATH-50099.20从校内到竞赛级数学
AIME 202590.84高难度竞赛数学
HumanEval+93.90代码生成
BFCL v374.41函数/工具调用

将这些并排来看,Bonsai 27B 的轮廓就变得清晰了。数学和代码表现位于 90 分段。工具调用表现位于 70 分段。在依赖它之前,最重要的一点就是理解这一差距:量化对推理和代码的保留远好于对结构化、多步骤行为的保留,而代理式工作流正是依赖这种行为。

这些数据是 PrismML 自己提供的,因此在独立基准测试结果积累起来之前,应将其视为一个起点,而不是最终结论。真正值得关注的是那些被标题中的平均分掩盖的信号:查看各任务得分,而不是 80.49 的平均值,并留意人们实际遇到的失败模式。早期测试者报告称,三进制构建有时会陷入推理循环,而极端量化往往比单个任务分数所显示的更容易削弱长上下文稳定性。这两点都值得在你自己的提示上快速测试一下,然后再依赖它。

运行速度有多快,以及在什么硬件上运行

只有在推理速度足够快、能够实际使用时,这种激进的压缩才有意义。在性能足够的硬件上,确实如此。以下是 PrismML 自己报告的数据:

设备1-bit三值
iPhone 17 Pro11 tok/s
Apple M5 Max87 tok/s58 tok/s
NVIDIA RTX 5090163 tok/s134 tok/s

手机上每秒 11 个 token 对于聊天和简短推理来说是可用的,尽管算不上飞快。在 M5 Max 上,每秒 87 个 token 的速度已经足够快,以至于一旦把网络往返延迟算进去,本地推理在短提示场景下就可能比云端 API 调用更快。PrismML 对这一成就的一种表述方式是智能密度(基准分数/每 GB),其中 Bonsai 大约达到 0.53,约为全精度基线的十倍。

立即运行 Bonsai 27B 的四种方式

由于权重是开放的,因此没有单一的“安装”路径。以下是目前可用的四种方式,从零配置到完全控制。

在 iPhone 上

Locally AI iOS 应用直接在设备上运行 1-bit 3.9GB 构建版本,无需账户或服务器。这条路径兑现了“在手机上运行 27B”的承诺,并且在权重下载完成后可完全离线工作。

在浏览器中

PrismML 发布可在浏览器标签页中运行 1-bit 模型的 WebGPU 内核,完全无需安装。它是在决定是否占用磁盘空间之前试用 Bonsai 27B 的最快方式,不过你需要一台配备支持 WebGPU 的 GPU 的机器。

在您的本地机器上

GGUF、MLX 和 ONNX 权重都在 Hugging Face 和 GitHub 上,采用 Apache 2.0 许可。主要仓库是 prism-ml/Bonsai-27B-gguf(1-bit)和 prism-ml/Ternary-Bonsai-27B-gguf(ternary),旁边还有 MLX 2-bit 和 ONNX 构建版本。1-bit 构建大约需要 4GB 的可用存储和内存,ternary 需要 6GB。需要注意的一点是:工具链成熟度落后于发布节奏。权重可以在多个运行时中加载,但像 LM Studio 这类常见本地应用的完整支持在发布时尚未到位,因此需要做一些手动设置。

The Hugging Face prism-ml collection page for Bonsai 27B showing the WebGPU kernels and GGUF model variants with download counts

通过托管 API

如果你不想管理权重,Together.ai 通过标准 API 提供该三值版本,并支持完整的 262K 上下文窗口、视觉输入和 JSON 模式。发布促销期间,输入价格标为每百万 token $0.00,因此在据此规划预算前请先确认当前费率,因为促销定价会变化。

The Together.ai model page for PrismML Ternary Bonsai 27B showing CHAT, REASONING, and VISION tags and the 95% quality claim

Bonsai 27B 与 Gemma 4 12B QAT

反复出现的比较对象是 Gemma 4 12B QAT,这是 Google 的量化感知训练模型,大小约为 7GB,只比 Bonsai 的三值构建版本略大一点。

它们在不同维度上各有优势。Bonsai 27B 在数学和编程基准测试上明显胜过 Gemma,这要归功于其 27B 基础模型。Gemma 在视觉和工具调用方面往往表现更好,而且它稍大一些、压缩不那么激进的权重使其在手机上作为通用选择更加稳健。如果你的端侧工作负载侧重于推理和代码,Bonsai 是更强的选择;如果更依赖图像或函数调用,Gemma 4 12B QAT 则更安全。

谁真正应该使用 Bonsai 27B

如果你想要离线、私密、设备端推理或编码辅助,并且你拥有一台 iPhone 17 Pro 级别的设备或一台性能足够的笔记本电脑,那么可以使用 Bonsai 27B。对于任何对极端量化感兴趣的人来说,它也很值得研究:一个 27B 模型竟然能在浏览器标签页中运行,这确实是一个重要里程碑,而且开放的 Apache 2.0 许可证也让实验变得很容易。当你需要一个本地选项时,它也能自然地与其他值得用于编程的开源和免费模型并列使用。

暂时不要将其用于依赖可靠工具调用的生产级 agentic 系统、对视觉至关重要的任务,或任何推理循环失败代价高昂的场景。对于这些场景,压缩程度较低的模型,或通过 API 提供的全精度模型,仍然是更安全的选择。

常见问题

Bonsai 27B 可以免费使用吗?

这些权重在 Apache 2.0 许可下免费,因此您可以免费下载并运行它。通过 Together.ai 提供的托管访问有其自己的 API 定价,在发布时列为每百万输入 tokens $0.00,因此请确认当前费率。

Bonsai 27B 真的可以在手机上运行吗?

是的。1 位版本大小为 3.9GB,通过 Locally AI 应用可在 iPhone 17 Pro 上以每秒约 11 个 token 的速度运行,下载后完全离线。

Bonsai 27B 和完整的 Qwen3.6 27B 一样好吗?

接近,但不完全相同。三值构建保留了超过 95% 的全精度基准性能,1 位构建保留了超过 90%,其中在数学和代码方面的保留最强,而在工具调用方面最弱。

我应该下载哪个 Bonsai 27B 文件?

在手机或内存紧张的机器上,请选择 1-bit 构建(prism-ml/Bonsai-27B-gguf,约 3.9GB)。在有余裕的桌面或 GPU 上,请选择 ternary 构建(prism-ml/Ternary-Bonsai-27B-gguf,约 5.9GB),以获得额外的少量准确度提升。针对 Apple Silicon 和跨平台运行时,还提供 MLX 2-bit 和 ONNX 变体。

什么是三元量化?

它将每个模型权重存储为三个值之一(-1、0 或 +1),而不是完整精度的数字,这就是模型体积大幅缩小的原因。FP16 缩放因子使折叠后的权重保持在大致正确的量级。

Bonsai 27B 支持图像吗?

是的,它接受图像输入以及文本输入,并返回文本输出,继承了其 Qwen3.6 27B 基座的多模态能力。在压缩下,视觉质量的表现不如数学和代码。