Hacker News 中文摘要

RSS订阅

盆景27B:一款可在手机上运行的27B级模型 -- Bonsai 27B: A 27B-Class Model that runs on a phone

文章摘要

Bonsai 27B是首个能在手机上运行的27B级多模态模型,基于Qwen3.6 27B开发。它提供三元和1位两种变体,分别仅需5.9GB和3.9GB内存,支持多步推理、工具调用和视觉任务,将大模型能力首次带入手机和笔记本电脑。

文章总结

今天,我们正式发布Bonsai 27B——基于Qwen3.6 27B的多模态旗舰模型,也是同类能力级别中首个能在手机上运行的模型。

此前发布的模型已证明,1比特和三进制权重的模型能产出商业可用的语言模型。Bonsai 27B将这一边界拓展至新的能力层级:多步推理、结构化工具调用、视觉任务,以及跨多步骤保持连贯的计算机使用代理循环。此前,本地部署该层级模型因具体原因而不可行:一个27B模型在16位精度下占用约54GB,即使优秀的4位量化版本也需18GB,对手机和多数笔记本电脑而言仍过大。

Bonsai 27B改变了这一局面。它提供两个版本:

  • 三进制Bonsai 27B:采用三进制权重{−1, 0, +1},配合FP16分组缩放,每权重有效比特数达1.71。5.9GB的版本注重质量,可在日常笔记本电脑上运行,具备完整的推理、工具调用和代理能力。
  • 1比特Bonsai 27B:采用二进制权重{−1, +1},同样配合分组缩放,每权重有效比特数为1.125。3.9GB的版本注重占用空间,适配iPhone 17 Pro的内存预算,首次将27B级模型带入手机。

与所有Bonsai版本一样,低比特表示贯穿语言网络、嵌入层、注意力机制、MLP和语言模型头部,全程无高精度逃逸通道。两个版本均为多模态,视觉塔以紧凑的4位形式提供,使设备端工作流能处理截图、文档和摄像头输入,而非仅限文本。Bonsai 27B支持完整的26.2万token上下文,并支持推测解码,通过无损草稿-验证加速提升速度。所有内容今日起在Apache 2.0许可下提供。

保留智能

在涵盖知识、推理、数学、编码、指令遵循、工具调用和视觉的15项基准测试中(以思考模式评估,即模型充分推理),三进制Bonsai 27B保留了全精度基线的95%,1比特Bonsai 27B保留了90%。

| 类别(基准测试) | Qwen 3.6 27B | 三进制Bonsai 27B | 1比特Bonsai 27B | | --- | --- | --- | --- | | 数学(GSM8K, MATH-500, AIME25, AIME26) | 95.3 | 93.4 | 91.7 | | 编码(HumanEval+, MBPP+, LiveCodeBench) | 88.7 | 86.0 | 81.9 | | 代理与工具调用(BFCL v3, TauBench) | 80.0 | 74.0 | 66.0 | | 指令遵循(IFEval, IFBench) | 78.4 | 71.8 | 65.8 | | 知识/STEM(MMLU-Redux, MuSR) | 83.1 | 77.0 | 73.4 | | 视觉(MMMU Pro, OCRBench) | 72.6 | 65.2 | 59.6 | | 总体(15项基准) | 85.0 | 80.5 | 76.1 |

按能力阅读表格,故事比平均值更清晰:数学和编码几乎未受影响,工具调用与全精度相差无几——这正是代理工作负载所依赖的能力。作为对比,同一基础模型最激进的常规低比特构建版本得分显著低于1比特Bonsai 27B,同时占用2.5倍内存。

这是我们在早期语言和图像模型中展示的相同帕累托偏移,如今在27B规模上实现:27B级能力,占用空间小于全精度2B模型。以智能密度(我们随1比特Bonsai 8B引入的衡量标准)计算,1比特Bonsai 27B每GB提供0.53:是全精度基线的10倍以上,约为最佳低比特替代方案的2.7倍。

为何这是重要的范式转变

最有价值的AI工作负载正从单次响应转向持续工作:操作真实工具的助手、无人值守运行后返回结果的工作流,以及综合数十份文档的研究。这一转变改变了工作负载的形态——代理不会只调用一次模型,而是数百次,每次携带上下文、产生结构化输出并馈入下一步。

云API对许多产品仍是正确选择。但对于代理工作负载,纯云执行带来结构性限制:每一步都是远程请求,每次迭代累积每token成本,每个计划、工具调用和中间结果都通过网络传输,包括用户的私人文件、屏幕和数据。

本地执行改变了局面。当能持续执行代理工作的模型适配设备时,代理可驻留在产品内部:百步循环的边际成本为零,用户数据永不离开设备。全新类别由此开启——持久化设备端代理、离线工作的助手、天然能推理私有本地数据的助手。此前缺少的正是足够小以部署、足够强以信任的模型。Bonsai 27B正是这样的模型。

它还解锁了新的系统架构:混合部署将非前沿和隐私敏感任务路由至能力强大的本地模型,仅将最难的步骤保留给前沿云模型——从而降低代理系统的每任务成本。

Bonsai 27B在NVIDIA GeForce RTX 5090上可达163 tok/s(1比特)和134 tok/s(三进制)。在M5 Max上,可达87 tok/s(1比特)和58 tok/s(三进制)。

适配手机比存储数字所暗示的更严格。手机从不向应用暴露全部内存——12GB的iPhone约提供6GB供模型使用,且模型需与KV缓存和激活值共享该预算。没有27B模型的常规构建版本能接近通过。约4GB的1比特Bonsai 27B是首个通过并留有工作空间的模型。

这一约束正是家族推出两个精心设计运行点的原因:三进制面向笔记本电脑级质量,1比特面向手机级占用空间。

前沿持续推进

每次Bonsai发布都将每GB智能前沿向左推进,Bonsai 27B将其推过实用门槛:现代模型的完整能力集——包含思考、多模态理解、视觉、可靠工具使用——如今适配人们已拥有的设备。

我们相信智能密度将是AI下一阶段的关键衡量轴之一。原始能力决定模型能做什么;密度决定它能在哪里做。前沿的每次左移都扩展了先进AI能运行的设备、产品和环境范围,并改变其触及的每个部署表面的经济性——从手机到单GPU服务。Bonsai背后的方法论与架构无关,前沿将持续推进:更大模型和新架构已在开发中。

早期计算机占据整个房间;如今它们存在于我们口袋中。智能正经历同样的旅程,Bonsai 27B是其迄今最大的一步。

平台覆盖

Bonsai 27B通过MLX原生运行于Apple设备(Mac、iPhone、iPad),并通过CUDA运行于NVIDIA GPU,依托为其混合注意力架构构建的自定义低比特内核。模型权重今日起在Apache 2.0许可下提供。本次发布中,我们提供限时免费开发者预览API,方便开发者试用模型。

完整技术细节(压缩、评估和基准测试流程)见我们的白皮书。

加入我们

PrismML源自加州理工学院研究团队,在Khosla Ventures、Cerberus和Google支持下成立,并持续获得三星支持。我们多年致力于该领域最棘手问题之一:在不牺牲推理能力的前提下压缩神经网络。

若您希望帮助构建下一代先进AI,我们期待您的加入。请查看我们的招聘页面。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 技术特性与性能:评论指出1位模型实际为1.58位(含+1、0、-1三个值),但运行UD_Q2变体时性能下降约5%,对实际应用影响显著。有用户尝试Ornith 9B模型,声称匹配或超越更大模型(如Gemma 4-31B),但实际表现仅略优于Qwen 9B。KV-cache内存使用非常节省,适合多智能体编码工作流。

    • 关键引用:alvatech: "TIL that 1 bit models are actually 1.58 bit with three values +1, 0 and -1"
    • 关键引用:liuliu: "the number is pretty close to 1-bit model here and the 5% drop in tool-call is significant than it suggests in real-life use cases"
  2. 可用性与兼容性:模型已在Hugging Face发布,但用户尝试在LM Studio运行GGUF和MLX版本时失败,推测需升级引擎。有用户反映在Android上仅输出"!!!!!!!!!!!!!"。评论认为该模型可能“完全无用”,但另一用户期待其能在10GB VRAM上运行。

    • 关键引用:simonw: "I've tried a couple in LM Studio... but neither worked there"
    • 关键引用:luckystarr: "Tried it on Android and got '!!!!!!!!!!!!!' for answers"
  3. 行业动态与质疑:苹果正与PrismML洽谈合作。有评论质疑博客内容为AI生成,并认为量化技术(如MPO)可能类似“蛇油”,依赖基准测试优化而非实际效果。小型AI实验室的商业模式(免费开源模型、客户集成)引发关注。

    • 关键引用:kristianp: "Apple is 'in talks' with the PrismML"
    • 关键引用:wy35: "Entire blog post seems to be AI-generated :/"
    • 关键引用:comandillos: "heavy quantization methods... start feeling a bit like snake oil"

平衡性总结:评论呈现两极分化——部分用户对三元模型在边缘设备上的潜力表示兴奋(如Arcuru期待多年),另一些则质疑其实际性能(如theLiminator认为“完全无用”)和兼容性(如simonw、luckystarr的失败体验)。技术讨论聚焦于量化效率与基准测试的可靠性,行业层面则关注苹果合作与开源生态的可持续性。