Hacker News 中文摘要

RSS订阅

英伟达Nemotron 3.5闪电版与NeMo Switchyard -- Nvidia Nemotron 3.5 Lightning and NeMo Switchyard

文章摘要

NVIDIA发布Nemotron 3.5 Lightning模型和NeMo Switchyard开源库,前者是面向自主AI代理的高效混合专家模型,后者实现智能路由,灵活调度多种模型,提升AI部署效率与控制力。

文章总结

随着人工智能从聊天机器人向自主智能体演进,开放模型正满足市场对AI运行位置、部署方式及演进路径完全掌控的需求。

近日,英伟达扩展了Nemotron 3模型家族,推出Nemotron 3.5 Lightning——同类模型中效率最高的长期运行智能体工作负载模型。该模型紧随Nemotron 3 Nano发布,体现了英伟达持续优化开放模型以提升准确性与速度的承诺。

Nemotron 3.5 Lightning专为大型多智能体系统中的特定任务设计,是一个300亿参数的混合专家模型,有助于创建更智能、更高效的智能体应用。同时,英伟达还发布了NeMo Switchyard,这是一个用于主流智能体工具中智能路由的开源库。企业可基于自身需求构建路由器,部署后能智能地将每个请求导向最合适、最强大的模型,无需重写应用。

两者结合,让用户对AI的部署位置、运行方式及效率拥有更大控制权——覆盖PC、工作站、数据中心和云端。

始终在线的智能体需要模型系统

现代智能体系统日益以模型集成的方式运作,不同模型专精于不同任务。英伟达Nemotron开放模型正是为此架构设计。前沿推理模型如Nemotron 3 Ultra或GPT-5.6可规划编排工作流,而像Nemotron 3.5 Lightning这样的小型专业模型则执行代码审查、工具使用、安全警报监控和账单查询等针对性任务。

用Nemotron 3.5 Lightning驱动高容量专业任务

Nemotron 3.5 Lightning是一款完全可定制的开放模型,专为驱动始终在线智能体的高容量任务打造。该模型输出速度提升高达4倍,智能体任务完成速度比同类模型快30%。由于开放且可定制,用户可借助英伟达NeMo轻松用自身领域数据、工具和工作流进行后训练,提升专业任务准确性。

各行业AI领导者正在为自身工作负载定制该模型,包括CrowdStrike用于网络安全、Harvey与Trajectory用于法律服务、CodeRabbit与Baseten用于代码审查等,帮助提升领域特定智能体任务的准确性。此外,Lila Sciences正帮助提升物理与生命科学领域智能体任务的推理能力,Fastino Labs定制后已在软件开发、金融和医疗工作负载上取得领先精度。

Nemotron 3.5 Lightning还赋予组织对隐私和部署的控制权。它可在本地AI系统上运行,包括英伟达RTX PC、DGX Spark、DGX Station和Jetson,帮助用户最大化现有基础设施投资,或扩展至边缘AI设备、RTX PRO工作站、数据中心和云环境。对于需要快速响应的高容量专业任务,它可在本地或本地部署运行。

与每次Nemotron发布一样,英伟达在许可允许范围内公开尽可能多的训练数据和技术,实现可追溯性、审计和其他模型训练。同时,英伟达还发布了用于后训练编码智能体能力的强化学习数据集。

通过模型路由实现更高效的AI应用

不同模型各有擅长:有的适合编码,有的擅长推理,有的适合轻量任务,有的优化为本地运行以提升隐私和效率。如果用户依赖单一默认模型,可能要么超支要么损失质量;若手动管理路由,则集成工作会拖慢部署。

英伟达NeMo Switchyard是一个面向AI智能体的开源模型路由库。该技术能根据具体需求,自动将提示路由到每个工作流步骤中最强大、最高效的模型。智能体应用开发者可调整或修改路由器,匹配质量、延迟和成本等优先级。在模型系统中,企业可创建具有改进代币经济学的强大AI智能体。

内部基准测试显示,NeMo Switchyard在保持前沿准确性的同时,将任务完成成本降至仅Opus 4.8的三分之一。

英伟达正与AI生态系统合作伙伴合作,将智能模型路由引入开发者已使用的工具和平台。合作伙伴包括Boomi(实现100%域路由准确性,将59%流量导向速度提升5倍的微调模型,延迟降低21%)、Cadence(通过ChipStack AI超级代理提升9.9%效率)、Classmethod(内部测试显示成本降低27%且质量不变)、Cognition(集成到Devin Desktop,在FrontierCode Main上实现近前沿性能,平均成本降低28%)、Kong(通过Kong AI网关原生提供路由)、LangChain(在145个多轮Deep Agents任务中成本降低74%,仅7%调用前沿模型,准确率折损6%)、LiteLLM(将NeMo Switchyard作为插件添加到代理层)、Nous Research(集成到Hermes提供易配置路由系统)、Ramp(匹配前沿模型性能的同时成本降低58%、运行时间减少33%)以及Siemens(正在基准测试以提升Fuse EDA AI代理效率)。

Nemotron 3.5 Lightning可通过Hugging Face、ModelScope、OpenRouter和build.nvidia.com获取,也可作为NVIDIA NIM微服务使用,并通过广泛的英伟达云合作伙伴、后训练平台、推理平台和云服务提供商生态系统获得。NeMo Switchyard已在GitHub上发布,即将登陆合作伙伴平台。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 对NeMo Switchyard路由机制的疑问(评论1):用户质疑智能路由如何处理提示缓存,提出“会话内固定模型”方案可能导致后续消息无法匹配最合适的模型。关键引用:"How do routers like this handle prompt caching when you send the second request?""Sticky models per session? but then the second message... will only be sent to the same model as previous one."

  2. 模型性能对比(评论3):用户认为Meta新发布的30B模型明显优于Nemotron,并提供了对比链接。关键引用:"The new Meta 30B models seems A LOT better""https://aibenchy.com/compare/meta-muse-glimmer-30b-xhigh/nvidia-nemotron-3-5-lightning-high/"

  3. 信息过载与简洁沟通(评论4):建议人类采用极简写作风格应对AI带来的信息洪流,例如将整个网页浓缩为十个要点。关键引用:"massive deluge of information because of AI""human beings should adopt a minimalist style of communicating in writing."

  4. 小型高效模型趋势(评论5):认为“参数大爆炸”将推动小型高效模型发展,并可能引发结构性变革。关键引用:"multi-trillion parameter models are fundamentally missing things""push to smaller, more efficient will drive evolutionary structural changes"

  5. 基准测试选择性缺失(评论6):批评Artificial Analysis图表故意排除Qwen系列模型(除Max变体),质疑其公正性。关键引用:"They conveniently decided not to include the Qwen range of models""At least be brave and honest."

  6. 硬件需求询问(评论7):询问Nemotron 3.5 Lightning在低显存环境(如16GB)下的运行能力。关键引用:"Nemotron 3.5 Lightning runs on how little GPU vram?""Can q4 run on 16gb?"

  7. 小模型实用体验(评论8):肯定NVIDIA模型在Apple Silicon上的表现,但指出运行速度慢。关键引用:"Pleasantly surprising that an NVIDIA model runs so well on Apple Silicon using MLX!""no bad experiences except for running slowly."

平衡性说明: 评论呈现了技术质疑(路由机制、基准测试)、性能对比(Meta vs NVIDIA)、趋势预测(小模型崛起)及实用反馈(硬件需求、运行体验),观点多元且未出现明显对立冲突。