Hacker News 中文摘要

RSS订阅

在无GPU的13年老Xeon上以5 tokens/sec运行Gemma 4 26B -- Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU

文章摘要

作者用一台13年前、无GPU的旧服务器(双路Xeon E5-2690 v2,仅支持AVX1指令集)成功运行了Google的Gemma 4 26B模型,解码速度约5.2 tokens/秒。文章强调,真正的AI能力不在于租用GPU或订阅服务,而在于理解模型、解决实际问题并判断答案正确性。

文章总结

好的,这是根据您的要求,对原文进行中文重述和精简后的版本:

标题:在13年前的至强服务器上,无GPU运行Gemma 4 26B模型,速度达5 tokens/秒

核心内容:

作者在地下室有一台约13年前、价值不到300美元的旧惠普存储服务器(双路至强E5-2690 v2,仅支持AVX1指令集,无GPU)。本周,他成功在这台机器上以约5.2 tokens/秒的解码速度运行了谷歌的260亿参数混合专家模型(MoE)Gemma 4。

起因与挑战:

作者受一篇名为《A 10 year old Xeon is all you need》的文章启发,尝试在其更老的Ivy Bridge架构CPU上运行Gemma 4。但文章作者使用的2016年Broadwell芯片支持AVX2指令集,而作者的CPU不支持,导致代码中的优化内核无法执行,程序启动即崩溃。

解决方案:

作者将问题交给AI助手Claude分析。Claude迅速定位了问题根源:代码中的快速内核依赖AVX2和FMA3指令集,而作者的CPU仅支持AVX1。随后,Claude接手了作者未完成的方案,重写了关键代码路径,使其能在不支持AVX2的芯片上优雅地降级运行,而非直接调用不存在的指令。

具体技术细节(针对技术读者):

  • 问题根源: 代码中的MOE_FUSED_UP_GATEFUSED_UP_GATE两个图操作在构建时被无条件生成,但在不支持AVX2的构建中,调度器没有对应的处理分支,导致这些操作被静默跳过。结果就是模型每层约240个张量的计算被跳过,输出变成了基于未初始化内存的“多语言乱码”。
  • 修复方法: 作者提交了三个补丁:
    1. 编译修复: 修正了非AVX2路径下的代码,使其能正常编译。
    2. 运行时错误修复: 修改图构建器,使其在不支持AVX2时,将无法执行的融合操作拆分为多个有对应实现的基本操作(如mul_mat_idfused_mul_unary),从而正确计算结果。
    3. CI存根修复: 补充了缺失的代码存根,确保测试套件能在非AVX2硬件上运行。
  • 性能: 修复后,在双路E5-2690 v2上,Gemma 4 26B模型(Q8_0量化)的解码速度约为5.2 tokens/秒,提示词处理速度约为16 tokens/秒。注意,运行时需关闭--run-time-repack标志,因为它会重新排列权重为仅AVX2支持的格式。

作者观点:

作者认为,真正的AI技能不是简单地付费订阅云服务,而是深入了解模型,并能将其应用于非标准化的具体问题,同时能判断模型输出的正确性。这次成功运行老旧硬件的经历,正是这种能力的体现。他希望这个补丁能让其他拥有老旧企业级硬件的用户,也能在本地运行一个AI模型,作为付费API的备用方案或处理批量任务的低成本选择。

评论总结

好的,以下是对评论内容的总结:

核心发现与性能表现

  • 主要观点:作者成功在2013年的至强(Xeon)CPU上运行了Gemma 4模型,并修复了一个导致输出乱码的静默错误。该修复已作为PR #2138提交。
  • 关键引用
    • "Author here... the fun bug was the silent one... so every expert FFN output was uninitialized memory. Deterministic, NaN-free, fluent-looking multilingual gibberish." (neomindryan)
    • "The fix is open upstream as PR #2138" (neomindryan)
  • 性能数据:多位用户报告了在老旧CPU上的运行速度,普遍在5-12 tokens/秒之间。
  • 关键引用
    • "I run the same setup Gemma 4 26B on a 2013 Mac Pro... I also get about 5 t/s." (broabprobe)
    • "That's quite slow I'm getting 8-12 t/s on a 13 year old CPU." (throwaway2027)

不同观点与讨论

  • 正面评价与展望:部分评论认为这展示了未来可能性,并预测更大模型将在消费级硬件上运行。
  • 关键引用
    • "Truly amazing. This gives a peek into the future for what's possible." (aniwalunj)
    • "I have a prediction. By the mid of 2027, we will have >200B MoE models running on basic consumer hardware." (dwa3592)
  • 质疑与批评:有评论质疑文章本身是AI生成的,并认为Transformer架构本质上不适合本地推理。
  • 关键引用
    • "Unfortunately, the post comes off as AI-written. Why not just write your own posts?" (indigodaddy)
    • "The transformer architecture is fundamentally unsuitable for local inference, while being efficient at scale." (jeswin)
  • 成本与效率对比:有用户计算后指出,使用推理服务提供商的token成本可能低于本地运行的电费,尤其是在电价较高的地区。
  • 关键引用
    • "I would assume that token costs when using an inference provider are cheaper than electricity of using locally." (hagen8)
    • "In Germany where 1kwh cost around 0.3USD, 180k tokens inferred locally would therefore cost 0.15USD which is 3x the costs of using an inference provider." (hagen8)
  • 其他关注点:有用户关注上下文窗口长度的重要性,也有用户询问具体硬件配置(如内存大小)。
  • 关键引用
    • "To me context means everything. Tokens per second is a great metric but in the real world context window is the deal breaker..." (okokwhatever)
    • "Is it just me or does this post not mention how much RAM they had?" (mmastrac)