Hacker News 中文摘要

RSS订阅

Nvidia Nemotron 3.5 Lightning -- Nvidia Nemotron 3.5 Lightning

文章摘要

NVIDIA发布Nemotron-3.5-Lightning-30B-A3B-NVFP4模型,采用MoE-Mamba-2+Attention混合架构,仅3B参数活跃,支持百万token上下文,可在单GPU部署,适用于长时自主代理和本地推理。

文章总结

NVIDIA Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型概述

模型摘要

  • 总参数量:300亿(30B),其中活跃参数为30亿(3B)
  • 架构:混合专家模型(MoE),结合Mamba-2、MoE和注意力机制
  • 上下文长度:最高支持100万tokens
  • 单GPU部署:支持DGX Spark(GB10)或H100
  • 支持硬件:NVIDIA Blackwell系列、Hopper系列(H100/H200)、Ampere系列(通过W4A16)
  • 支持语言:英语、西班牙语、法语、德语、意大利语、日语及编程语言
  • 推测解码:提供DSpark(适用于低并发数据中心和DGX Spark)、MTP(多token预测)和DFlash
  • 推荐采样参数:温度1.0,Top_P 0.95
  • 最佳用途:长时间运行的自主智能体、子智能体工作部署、个人硬件上的高效本地推理
  • 许可证:OpenMDW License Agreement 1.1版
  • 发布日期:2026年8月11日

模型详情

开发者:NVIDIA Corporation
开发时间:2025年12月至2026年5月
数据时效:预训练数据截止2025年9月,后训练数据截止2026年5月

Nemotron系列:NVIDIA推出的开放模型家族,提供开放权重、训练数据和配方,用于构建专业AI智能体。

模型描述:该模型采用混合专家架构,交错使用Mamba-2和MoE层,并包含选择性注意力层。总参数量30B,活跃参数3B,已准备好投入商业使用。

训练方法

模型经过五个阶段的训练: 1. 预训练:使用超过20万亿tokens的数据,采用NVFP4配方 2. 多token预测(MTP)持续预训练:训练MTP层预测多个未来token 3. 监督微调:在代码、数学、科学、工具调用等数据上微调 4. 强化学习:使用GRPO算法在多环境中进行强化学习 5. 后训练量化(PTQ):使用NVIDIA Model Optimizer进行量化

性能基准测试

模型在多项基准测试中表现优异,包括: - 通用知识:MMLU Pro 81.62 - 推理能力:GPQA Diamond 75.57 - 编程与智能体:SWE-bench Verified 52.80 - 指令遵循:IFBench 72.88 - 长上下文:AA-LCR 49.19

部署指南

模型支持多种部署方式,包括vLLM、TensorRT-LLM和SGLang,并提供详细的配置示例。推荐使用DSpark推测解码方案,特别适合DGX Spark和低并发数据中心场景。

伦理考量

NVIDIA强调可信AI是共同责任,建议开发者确保模型满足特定行业和用例的要求,并妥善处理潜在的产品滥用问题。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 技术架构与性能对比

    • 评论1指出Mamba 2架构正在追赶传统Transformer架构,值得关注。
    • 评论2认为Qwen3.6 35b-a3b表现优异,虽大20%但分数也高20%,希望Qwen推出新版本。
    • 评论3强调Nemotron模型在基准测试中看似落后,但泛化能力更强、训练更开放,且NVIDIA有持续推动开源模型的动力。
    • 评论7指出从bf16到fp4的SWEBench分数大幅下降。
  2. 开源与生态价值

    • 评论5赞赏Nemotron完全开源训练流程,认为这是其他模型难以比拟的成就。
    • 评论3补充NVIDIA因硬件销售需求,有长期开源激励。
  3. 用户体验与批评

    • 评论9反馈模型在Mac上运行快(~100 tokens/s),但存在“过度思考”问题,如生成多个SVG草图后仍输出不佳结果。
    • 评论6批评NVIDIA“为平民扔垃圾”,认为应降低DGX价格而非发布低质模型。
  4. 基准测试异常

    • 评论8质疑Agentic Coding基准中codex harness分数显著低于其他测试,原因不明。

平衡性总结:
- 正面:模型架构创新、开源生态贡献、本地运行速度。
- 负面:基准测试落后、fp4精度损失、过度思考、商业动机质疑。

关键引用(保留中英文):
- 评论1:“Developing on the Mamba 2 architecture is a really interesting point to note.”
- 评论3:“nemotron models feel to me a bit less benchmaxxed / 'stubborn'... they generalise a bit better”
- 评论5:“this is an entirely open source training pipeline, this is quite impressive”
- 评论6:“Nvidia just throwing something 'for peasants' to stay relevant... Make 1TB DGX priced affordably”
- 评论9:“Runs fast on my Mac... but it's a bit of an over-thinker.”