Hacker News 中文摘要

RSS订阅

LongCat-2.0:总参数量1.6T、激活参数量48B的大规模MoE模型 -- LongCat-2.0, a large-scale MoE model with 1.6T total and 48B Active

文章摘要

LongCat-2.0是一个1.6万亿参数的MoE语言模型,每次激活约480亿参数。它完全基于AI ASIC超算集群训练,处理超35万亿token且无训练中断。模型引入稀疏注意力机制,支持百万级上下文,在编程和智能体任务上表现优异。

文章总结

我们很高兴地宣布并开源 LongCat-2.0,这是一个大规模混合专家(MoE)语言模型,拥有1.6万亿总参数,每个 token 激活约480亿参数。相比之前的 LongCat 模型,它在架构上有了显著提升。

该模型的完整训练和大规模部署完全基于 AI ASIC 超级计算集群。预训练过程在超过35万亿个 token 上运行,累计使用了数百万加速器天数,且没有出现回滚或不可恢复的损失峰值,这证明了我们在替代硬件平台上进行前沿规模训练的能力。

为了增强模型在长周期任务上的表现,我们引入了 LongCat 稀疏注意力机制,并使用数千亿 token 的 1M 上下文数据对 LongCat-2.0 进行了训练。结合专门的后期训练,这使得 LongCat-2.0 在编码和智能体任务上表现出色。

LongCat-2.0 已深度集成到 Claude Code、OpenClaw 和 Hermes 等主流框架中,在代码理解、仓库级编辑、自动化任务执行和智能体工作流方面均展现出强劲性能,为开发者提供了更稳定、高效的协作体验。

架构方面,我们的设计基于 LongCat-Flash,进一步提升了参数效率,并加快了长上下文训练和推理的速度。在注意力机制上,我们引入了 LongCat 稀疏注意力(LSA),这是 DeepSeek 稀疏注意力的一种演进,它采用更轻量级的索引器,在加速长上下文处理的同时不牺牲模型质量。为了充分利用每个参数,我们添加了 N-gram 嵌入模块,通过 N-gram token 组合将嵌入空间扩大了约100倍,从而捕捉更丰富的局部上下文并增强 token 级别的表示。

基础设施方面,LongCat-2.0 的训练和部署建立在由数万个 AI ASIC 超级计算集群组成的大规模集群上。我们投入了大量精力来构建一个稳定、安全且可扩展的基础设施。在训练方面,我们通过系统优化,实现了超过35%的训练吞吐量提升,同时增强了可靠性。在推理方面,为了在1M token 上下文中服务一个1.6T参数的模型,我们通过模型、设备和部署层面的优化栈来应对 HBM 容量、I/O 带宽和节点间互联带宽的严格限制。

后期训练方面,我们引入了一种专门的专家组设计,分为三类:智能体专家推理专家交互专家。智能体专家专注于提升复杂现实场景中的自主任务执行能力;推理专家增强了模型的逻辑推理深度,并能根据问题难度进行自适应计算;交互专家则专注于人类对齐和用户体验优化。最后,我们采用 MOPD 架构来整合这三组专家的最强能力,使最终模型能够结合强大的智能体执行、深度推理和高质量交互能力。

评估方面,我们在代码、通用智能体和基础能力等多个维度上,将 LongCat-2.0 与领先的专有模型进行了对比。在代码智能体方面,它在 Terminal-Bench 2.1 上得分为70.8,在 SWE-bench Pro 上为59.5,在 SWE-bench Multilingual 上为77.3。在通用智能体方面,它在 FORTE 上得分为73.2,在 BrowseComp 上为79.9,在 RWSearch 上为78.8。在基础能力方面,它在 IFEval 上得分为90.0,在 Writing Bench 上为83.8,在 IMO-AnswerBench 上为81.8,在 GPQA-diamond 上为88.9。

评论总结

以下是对评论内容的总结,关注主要观点、论据及认可度,并保持不同观点的平衡性:

1. 模型原创性与技术贡献 - 观点一:部分评论认为LongCat-2.0主要基于DeepSeek V4的微调或后训练,原创性有限。但作者随后修正,承认其在架构上引入了新内容,不过对完整技术报告和模型权重的开源持怀疑态度。 - 关键引用:"So... is this literally a... finetune of DeepSeek V4-Pro or post-trained version of DeepSeek V4-Pro Base?" (dryarzeg) - 关键引用:"their contribution far exceeds merely post-training the base model in a different way. They did introduce something new to the architecture" (dryarzeg) - 观点二:有评论质疑其开源承诺,认为无法从Hugging Face下载模型,结合公司历史,可能被视为“骗局”。 - 关键引用:"Nothing can be downloaded from their Huggingface, and given this company's consistent track record, it can basically be considered a scam" (tcper)

2. 硬件与基础设施 - 评论指出,模型训练基于大规模AI ASIC超算集群(可能使用华为昇腾910C芯片),而非成熟的NVIDIA GPU生态,这被视为真正的新闻点。 - 关键引用:"The training and deployment of LongCat-2.0 are built on large-scale clusters of tens of thousands of AI ASIC superpods... This is the real news story." (gardnr) - 关键引用:"1024 Huawei Ascend superpods = 50K 910C chips. That is a tiny tiny system." (throwa356262)

3. 性能与对比测试 - 用户通过核反应堆燃料选择问题测试,发现LongCat-2.0给出错误答案(偏好Pu-241),而Qwen 3.7 Plus和Gemini Flash正确回答(偏好U-235)。Gemini Flash被认为最佳,Qwen次之,LongCat-2.0排名第三。 - 关键引用:"LongCat-2.0 gave a very well reason but incorrect answer that Pu-241 is preferable... Overall I rate Gemini Flash the best, Qwen 3.7 Plus an acceptable second, and LongCat-2.0 an ok'ish third." (credit_guy) - 另有用户发现,在英文界面启用搜索功能后,模型返回中文结果,反映了其上下文响应特性。 - 关键引用:"I asked a question with 'Search' enabled, with the app set to English, and got results back in Chinese." (gwerbin)

4. 公司背景与开源生态 - 评论指出LongCat-2.0来自美团(中国外卖公司),其创始人王兴的背景被类比为硅谷剧中的角色。 - 关键引用:"Apparently this comes from Meituan which is a Chinese food delivery company." (skybrian) - 关键引用:"The bad ass 'resume' of the founder - sounds like the Chinese guy from the Silicon Valley tv show" (chvid) - 有用户希望模型能在llama.cpp上运行,并公布常见硬件的token/s性能数据。 - 关键引用:"I wish they would release the requirements to run on llama.cpp with any announcements of open models." (aetherspawn)

5. 其他猜测 - 有评论推测LongCat-2.0可能是此前秘密发布的openrouter/owl-alpha模型。 - 关键引用:"There was some earlier speculation this is the model behind the stealth-released openrouter/owl-alpha model" (mappu)

总结:评论对LongCat-2.0的原创性、硬件基础设施、实际性能及开源承诺存在分歧。正面观点关注其基于非NVIDIA生态的集群训练和架构创新;负面观点则质疑其性能表现、开源真实性及公司信誉。