Hacker News 中文摘要

RSS订阅

Show HN:在Mac上仅用4.3GB内存运行80B参数的Qwen模型,以及在iPhone上运行35B参数模型 -- Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac, and a 35B on an iPhone

文章摘要

Swiftlet 是一个基于 Swift 和 Metal 的开源项目,支持 macOS 14+ 和 iOS 17+,专注于利用 GPU 进行高性能计算或图形渲染。

文章总结

好的,这是根据您的要求,对原文进行中文重述和精简后的版本:

项目名称: Swiftlet

核心功能: 一个基于Swift和Metal的运行时,专为Qwen3-Next和Qwen3.5/3.6系列的MoE(混合专家)模型设计。它能让普通苹果设备(包括iPhone)运行高达35B和80B参数级别的大模型。

工作原理: 这些模型每处理一个token,只激活约30亿参数。Swiftlet利用这一特性,将模型的核心密集参数(如注意力机制)常驻内存,而将数量庞大的“专家”权重按需从硬盘流式加载。具体来说: 1. 内存驻留: 仅保留模型的小型密集核心部分,35B模型约占用1.3GB,80B模型约2.5GB。 2. 专家流式加载: 将成千上万的专家权重打包成固定大小的数据块。当需要某个专家时,直接从SSD读取,避免了内存页缓存抖动。 3. 缓存机制: 使用一个有限大小的缓存池来存储最近使用过的专家,利用LFU(最不经常使用)和近期性策略进行淘汰。由于苹果SSD性能出色,缓存命中率对速度影响不大。 4. Metal加速: 整个前向传播过程在Metal上运行,并使用运行时编译的着色器,无需在构建时安装Metal工具链,便于在iOS上部署。

性能表现: - Qwen3.6-35B-A3B (4-bit): 占用18GB硬盘,峰值内存2.6GB,在M5 Mac上解码速度为7-11 tok/s。 - Qwen3-Next-80B-A3B (4-bit): 占用42GB硬盘,峰值内存4.3GB,在M5 Mac上解码速度为4.5-5 tok/s。 - iPhone运行: 35B模型可在iPhone 17上运行,占用约2.5GB内存,速度约1 tok/s。据称这是该级别模型首次在手机上原生运行。

使用方式: 1. Swift包: 作为库集成到macOS或iOS应用中,提供会话管理、流式输出、采样等功能。 2. 命令行工具: 提供chatgeneraterepack命令,用于本地使用、基准测试和模型打包。 3. 服务器: 提供兼容OpenAI API的本地服务器,任何兼容的聊天UI都可连接使用。 4. iOS应用: 已集成在名为“Priv AI”的App Store应用中,用户可直接下载模型并聊天。

正确性验证: 项目对前向传播的每一层(包括Gated DeltaNet循环、GQA注意力、稀疏MoE路由)都进行了验证,确保其与mlx-lm参考实现一致。Metal内核与CPU参考实现进行了对比测试,确保输出一致。

与其他项目的关系: Swiftlet借鉴了TurboFieldfare项目关于专家流式传输的设计思路(如使用pread、固定步长打包等),但针对Qwen模型的全新架构(混合专家、Gated DeltaNet等)进行了从头实现,并增加了iPhone支持、聊天会话层、量化计算等新功能。

许可协议: Apache 2.0。模型权重需单独下载,并遵循其自身许可(Qwen模型为Apache 2.0)。

评论总结

根据评论内容,总结主要观点如下:

1. 性能与实用性争议(评分:None) - 批评者认为解码速度慢、预填充成为瓶颈,且磁盘交换方法会缩短硬盘寿命。
- “these decode times don't really tell the whole story, because prefill becomes the bottleneck.”
- “These disk swapping methods all have the same drawbacks - kill your drive early, and slow as hell.”

2. 技术进步与乐观态度(评分:None) - 支持者认为这种不完美的尝试是进步的必要过程,未来有望实现低成本运行大模型。
- “People will keep plugging away at this and figure out how to avoid wearing the hard drive, how to make it run faster.”
- “I personally can't wait for the day when a 1t param model runs off a $200 SSD instead of a $50k rack of Nvidia chips.”

3. 苹果硬件与未来趋势(评分:None) - 有评论推测苹果押注未来LLM效率极高,可在iPhone/Mac上轻松运行。
- “Apple is betting that the LLMs in the future will be so efficient that those that consumers will use everyday will be easily computed by the iPhone or even bigger ones on Macs.”

4. 内存利用与优化建议(评分:None) - 用户希望利用更多RAM加速模型运行,并有人表示将测试增加RAM缓存的效果。
- “I wonder, is there a way to make the RAM usage tunable? … take advantage of the additional RAM to make it run faster.”
- “you can increase the RAM cache so if you have a Mac with 24-32GB it should speed up a lot.”

5. 对项目协作方式的疑问(评分:None) - 有评论质疑README中“与Claude Code协作”的表述,是真实合作还是AI工具声明。
- “Did this really happen … or is it some kind of requirement when you develop some software with Claude Code?”
- “Is it like someone saying 'built in collaboration with VS Code' … or merely a disclaimer about vibe-coding or AI written tool?”

6. 对项目起源的感谢(评分:None) - 原作者感谢项目使用其TurboFieldfare作为起点,并乐见其启发更多人探索设备端AI。
- “Thank you for using TurboFieldfare as a starting point for this project … I am glad it inspired more people to explore area of on-device AI further!”