文章摘要
NVIDIA发布Nemotron 3.5 Lightning模型和NeMo Switchyard开源库,前者是面向自主AI代理的高效混合专家模型,后者实现智能路由,灵活调度多种模型,提升AI部署效率与控制力。
文章总结
随着人工智能从聊天机器人向自主智能体演进,开放模型正满足市场对AI运行位置、部署方式及演进路径完全掌控的需求。
近日,英伟达扩展了Nemotron 3模型家族,推出Nemotron 3.5 Lightning——同类模型中效率最高的长期运行智能体工作负载模型。该模型紧随Nemotron 3 Nano发布,体现了英伟达持续优化开放模型以提升准确性与速度的承诺。
Nemotron 3.5 Lightning专为大型多智能体系统中的特定任务设计,是一个300亿参数的混合专家模型,有助于创建更智能、更高效的智能体应用。同时,英伟达还发布了NeMo Switchyard,这是一个用于主流智能体工具中智能路由的开源库。企业可基于自身需求构建路由器,部署后能智能地将每个请求导向最合适、最强大的模型,无需重写应用。
两者结合,让用户对AI的部署位置、运行方式及效率拥有更大控制权——覆盖PC、工作站、数据中心和云端。
始终在线的智能体需要模型系统
现代智能体系统日益以模型集成的方式运作,不同模型专精于不同任务。英伟达Nemotron开放模型正是为此架构设计。前沿推理模型如Nemotron 3 Ultra或GPT-5.6可规划编排工作流,而像Nemotron 3.5 Lightning这样的小型专业模型则执行代码审查、工具使用、安全警报监控和账单查询等针对性任务。
用Nemotron 3.5 Lightning驱动高容量专业任务
Nemotron 3.5 Lightning是一款完全可定制的开放模型,专为驱动始终在线智能体的高容量任务打造。该模型输出速度提升高达4倍,智能体任务完成速度比同类模型快30%。由于开放且可定制,用户可借助英伟达NeMo轻松用自身领域数据、工具和工作流进行后训练,提升专业任务准确性。
各行业AI领导者正在为自身工作负载定制该模型,包括CrowdStrike用于网络安全、Harvey与Trajectory用于法律服务、CodeRabbit与Baseten用于代码审查等,帮助提升领域特定智能体任务的准确性。此外,Lila Sciences正帮助提升物理与生命科学领域智能体任务的推理能力,Fastino Labs定制后已在软件开发、金融和医疗工作负载上取得领先精度。
Nemotron 3.5 Lightning还赋予组织对隐私和部署的控制权。它可在本地AI系统上运行,包括英伟达RTX PC、DGX Spark、DGX Station和Jetson,帮助用户最大化现有基础设施投资,或扩展至边缘AI设备、RTX PRO工作站、数据中心和云环境。对于需要快速响应的高容量专业任务,它可在本地或本地部署运行。
与每次Nemotron发布一样,英伟达在许可允许范围内公开尽可能多的训练数据和技术,实现可追溯性、审计和其他模型训练。同时,英伟达还发布了用于后训练编码智能体能力的强化学习数据集。
通过模型路由实现更高效的AI应用
不同模型各有擅长:有的适合编码,有的擅长推理,有的适合轻量任务,有的优化为本地运行以提升隐私和效率。如果用户依赖单一默认模型,可能要么超支要么损失质量;若手动管理路由,则集成工作会拖慢部署。
英伟达NeMo Switchyard是一个面向AI智能体的开源模型路由库。该技术能根据具体需求,自动将提示路由到每个工作流步骤中最强大、最高效的模型。智能体应用开发者可调整或修改路由器,匹配质量、延迟和成本等优先级。在模型系统中,企业可创建具有改进代币经济学的强大AI智能体。
内部基准测试显示,NeMo Switchyard在保持前沿准确性的同时,将任务完成成本降至仅Opus 4.8的三分之一。
英伟达正与AI生态系统合作伙伴合作,将智能模型路由引入开发者已使用的工具和平台。合作伙伴包括Boomi(实现100%域路由准确性,将59%流量导向速度提升5倍的微调模型,延迟降低21%)、Cadence(通过ChipStack AI超级代理提升9.9%效率)、Classmethod(内部测试显示成本降低27%且质量不变)、Cognition(集成到Devin Desktop,在FrontierCode Main上实现近前沿性能,平均成本降低28%)、Kong(通过Kong AI网关原生提供路由)、LangChain(在145个多轮Deep Agents任务中成本降低74%,仅7%调用前沿模型,准确率折损6%)、LiteLLM(将NeMo Switchyard作为插件添加到代理层)、Nous Research(集成到Hermes提供易配置路由系统)、Ramp(匹配前沿模型性能的同时成本降低58%、运行时间减少33%)以及Siemens(正在基准测试以提升Fuse EDA AI代理效率)。
Nemotron 3.5 Lightning可通过Hugging Face、ModelScope、OpenRouter和build.nvidia.com获取,也可作为NVIDIA NIM微服务使用,并通过广泛的英伟达云合作伙伴、后训练平台、推理平台和云服务提供商生态系统获得。NeMo Switchyard已在GitHub上发布,即将登陆合作伙伴平台。
评论总结
根据评论内容,总结如下:
主要观点与论据:
对NeMo Switchyard路由机制的疑问(评论1):用户质疑智能路由如何处理提示缓存,提出“会话内固定模型”方案可能导致后续消息无法匹配最合适的模型。关键引用:"How do routers like this handle prompt caching when you send the second request?" 和 "Sticky models per session? but then the second message... will only be sent to the same model as previous one."
模型性能对比(评论3):用户认为Meta新发布的30B模型明显优于Nemotron,并提供了对比链接。关键引用:"The new Meta 30B models seems A LOT better" 和 "https://aibenchy.com/compare/meta-muse-glimmer-30b-xhigh/nvidia-nemotron-3-5-lightning-high/"
信息过载与简洁沟通(评论4):建议人类采用极简写作风格应对AI带来的信息洪流,例如将整个网页浓缩为十个要点。关键引用:"massive deluge of information because of AI" 和 "human beings should adopt a minimalist style of communicating in writing."
小型高效模型趋势(评论5):认为“参数大爆炸”将推动小型高效模型发展,并可能引发结构性变革。关键引用:"multi-trillion parameter models are fundamentally missing things" 和 "push to smaller, more efficient will drive evolutionary structural changes"
基准测试选择性缺失(评论6):批评Artificial Analysis图表故意排除Qwen系列模型(除Max变体),质疑其公正性。关键引用:"They conveniently decided not to include the Qwen range of models" 和 "At least be brave and honest."
硬件需求询问(评论7):询问Nemotron 3.5 Lightning在低显存环境(如16GB)下的运行能力。关键引用:"Nemotron 3.5 Lightning runs on how little GPU vram?" 和 "Can q4 run on 16gb?"
小模型实用体验(评论8):肯定NVIDIA模型在Apple Silicon上的表现,但指出运行速度慢。关键引用:"Pleasantly surprising that an NVIDIA model runs so well on Apple Silicon using MLX!" 和 "no bad experiences except for running slowly."
平衡性说明: 评论呈现了技术质疑(路由机制、基准测试)、性能对比(Meta vs NVIDIA)、趋势预测(小模型崛起)及实用反馈(硬件需求、运行体验),观点多元且未出现明显对立冲突。