文章摘要
DeepGrove发布开源模型Maple-Preview,参数量20B-A1B,采用三元权重,性能在同级中领先,可解IMO级别难题,在Mac mini M4上运行速度超200 tokens/s,比同类高效模型快5至16倍。
文章总结
好的,这是根据您的要求,对原文进行中文重述后的版本:
标题:DeepGrove 发布 Maple-Preview 模型
DeepGrove 今日推出 Maple-Preview,这是一个开源的 20B-A1B 三值权重推理大语言模型。该模型在其重量级别中达到了最先进的水平,甚至能与更大的模型竞争。它能够解决国际数学奥林匹克(IMO)级别的问题,并在 Mac mini M4 上以每秒超过 200 个 token 的速度运行,比 Gemma 4、Qwen3.5 和 gpt-oss 等高效模型快 5 到 16 倍。
核心性能数据: * 模型规模: 20B-A1B * 推理速度: M4 Mac mini 上达 218 tokens/s * 模型大小: 5.31 GB 检查点 * 上下文长度: 131,072 tokens
关键演示: * 解决 IMO 问题: Maple-Preview 在 MacBook Pro (M5 Pro) 上以 281.5 tokens/s 的速度,为 IMO 2024 问题 1 获得了满分 7/7。 * 移动端速度优势: 在 iPhone 上,Maple-Preview 的推理速度达到 127 tokens/s,是 1-bit Bonsai 27B 模型的 13 倍。
核心理念:
DeepGrove 认为,AI 的发展方向应从单一的大模型转向始终在线的设备端助手。这需要更高效、性能更强的架构,使得模型能够在笔记本电脑和手机等日常设备上训练和运行。Maple-Preview 证明了超低精度是实现这一目标的关键。
在超低位宽下,矩阵乘法可被加法有效替代,从而降低推理所需的算术工作量。DeepGrove 相信,未来大部分推理将由更小、更个性化的模型在本地完成,只有极少数困难任务才会交由云端模型处理。
当前的低精度方法主要关注将全精度训练的模型转换为低位宽。DeepGrove 认为这是根本性的错误方法,因为它不必要地限制了性能和效率。他们主张,创建一个高性能、高效率的模型,其过程应类似于创建一个高性能模型本身。因此,与其专注于如何让高性能模型变得高效,不如将精力投入到优化、数据等方面,通过一个感知推理架构的设计循环,同时提升模型性能和效率。
DeepGrove 坚信,模型运行的精度应该就是它学习的精度。他们研究高效模型的学习方式,重新思考架构、训练基础设施、优化和硬件设计,将低精度视为一等公民。Maple-Preview 是一个原生训练的三值权重网络,证明了低精度并不意味着妥协。
架构:
Maple-Preview 是一个 20B-A1B 的推理模型,从一开始就为高效的设备端推理而设计。其架构是硬件感知的,所有配置都在 Mac mini 上进行了推理速度测试。最终选择了 24 层、256 专家的配置,作为模型性能和推理效率之间的折中方案。此外,还采用了混合滑动窗口和全局注意力机制,以限制 KV 缓存增长。
评估结果:
在基准测试中,Maple-Preview 在内存-性能和速度-性能的帕累托前沿上树立了新的标杆,展示了其强大的推理能力。但需要注意的是,该预览版主要侧重于原始推理能力,在智能体(Agent)基准测试中可能表现不佳。DeepGrove 计划在正式版发布前,通过扩展训练来继续提升通用性能。
设备端自适应:
DeepGrove 认为,未来的模型将通过调整自身权重来学习用户偏好,而非依赖上下文中的大量文本。Maple-Preview 的轻量级特性使其能够实现设备端自适应。在演示中,当用户提到有素食饮食限制时,Maple-Preview 能识别这一重要信息,并在“梦境”中生成少量数据并自我训练。当用户随后询问购买皮包建议时,模型能给出使用合成材料的推荐。而使用 Claude Sonnet 5 在相同场景下,它未能识别这一细节,仍推荐了真皮包。
未来工作:
Maple-Preview 的发布是 DeepGrove 在追求高效、可适应智能道路上的早期成果。该模型在智能体领域仅经过极少的后训练,也只进行了小规模的通用强化学习。DeepGrove 计划扩展智能体训练、设备端学习方法和强化学习,以进一步提升模型能力。
评论总结
根据评论内容,总结如下:
主要观点与论据:
积极评价(认可度较高):
- 评论1(HenryNdubuaku):“This is cool!” 直接表达赞赏。
- 评论3(zooloo99):“Super cool and a taste of what's to come with local AI becoming more accessible to low-end hardware.” 认为该模型让本地AI在低端硬件上更易用,前景光明。
质疑与批评(认可度中等):
- 评论2(Havoc):“Looks promising though much like the bonsai tenary one it hallucinates knowledge quite aggressively.” 指出模型存在幻觉问题,但搜索工具部分掩盖了这一点。
- 评论5(walrus01):“I wish that 'small' LLMs would stop being confidently very incorrect.” 通过测试“schlong”词源,发现模型给出错误答案,而Qwen 3.6 35B表现更好,强调小模型在非技术领域易出错。
- 评论6(beautiful_apple):“A benchmark table comparing to Qwen 3.5 35B-A3B seems strange when Qwen 3.6 35B-A3B has been out for some time and is significantly better.” 批评基准测试未使用最新版本,可能误导读者。
实用性与应用场景(认可度中等):
- 评论7(arjie):“For small models like this, it’s super important that it works well at tool calling etc.” 强调小模型应擅长工具调用,适合快速本地任务,如语音通道中的基础操作。
- 评论9(kamranjon):“Very excited to see how it performs... really cool to see one trained from scratch in the ternary format.” 赞赏从零训练的三进制格式,认为优于转换现有模型。
怀疑与负面反馈(认可度较低):
- 评论4(jsphweid):“3 of the 5 comments on this page are just 0-1 karma accounts high-fiving the article. Suspicious.” 质疑评论真实性,暗示可能存在水军。
- 评论10(hahahaa):“In mice. I mean Mac Mini M4 not an iPhone.” 讽刺模型运行在Mac Mini而非手机,并调侃AI网站装腔作势的风格。
- 评论11(momojo):“At this point I think Apple just needs to simply not do anything stupid and these small model makers are going to hand them models.” 暗示苹果无需作为,小模型开发者会主动提供模型。
平衡性总结: - 正面:模型在低端硬件上运行快、前景好,三进制训练方法创新。 - 负面:幻觉问题严重,小模型易自信犯错,基准测试不严谨,评论真实性存疑。 - 中立:适合工具调用等特定场景,但需注意其局限性。