随着人工智能从单轮聊天机器人转变为连续运行的自主代理,NVIDIA 正在扩展其开放模型阵容以应对这一时刻。 2026 年 8 月 11 日,该公司推出了 Nemotron 3.5 Lightning,这是一个拥有 300 亿个参数的专家混合模型,被称为同类中针对长期运行的代理 AI 工作负载效率最高的模型。 Kari Briski 在 NVIDIA 博客上详细介绍了该版本,它与 NeMo Switchyard 一起发布,NeMo Switchyard** 是一个开源路由库,旨在自动将每项任务引导至最有能力且最具成本效益的模型。要了解最新的 AI 行业报道,请关注代理 AI 堆栈的形成。

为永远在线的代理构建的模型

现代代理系统越来越多地按照 NVIDIA 所描述的“模型系统”或模型集合的方式运行。 Nemotron 3 Ultra 或 GPT-5.6 等前沿推理模型可能会规划和编排工作流程,而较小的专用模型则处理有针对性的任务,例如代码审查、工具使用、安全警报监控或回答计费问题。 Nemotron 3.5 Lightning 专为第二层而构建:为始终在线的代理提供支持的大容量、专业任务。

据 NVIDIA 称,与同类其他型号相比,该型号的输出速度快 4 倍,从而使代理任务完成速度大约**30%。据报道,NVIDIA 自己的 PinchBench 基准测试表明,Nemotron 3.5 Lightning 保持了前沿水平的精度,同时比同类产品更快地完成任务。该模型是在 Nemotron 联盟的贡献下开发的,该联盟的成员提供了评估方法、推理软件和数据集来帮助推进该模型。

由于 Nemotron 3.5 Lightning 具有开放性和可定制性,组织可以在自己的领域数据、工具和工作流程上使用 NVIDIA NeMo 对 Nemotron 3.5 Lightning 进行后期训练,以提高专门任务的准确性。 NVIDIA 还发布了 Nemotron-RL-Agentic-Terminal-Pivot,这是一个代理强化学习数据集,用于对编码代理功能的模型进行后训练。

从边缘到云端,随处运行

Nemotron 3.5 Lightning 的核心卖点之一是部署灵活性。该模型可以在本地 AI 系统上运行,包括 NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 和 NVIDIA Jetson,让组织能够最大限度地利用现有基础设施投资。它还可以跨边缘 AI 设备、NVIDIA RTX PRO 工作站、数据中心和企业用例的云环境进行扩展。对于处理必须保留在本地的敏感数据的组织来说,这种灵活性很重要。

与每一次 Nemotron 发布一样,NVIDIA 表示,它会在许可允许的范围内发布尽可能多的训练数据和技术,以便对其他模型进行可追溯、审计和训练。这种对透明度的承诺已成为一种竞争优势,因为企业会权衡开放模型与专有替代方案,而专有替代方案对模型的构建方式的可见性较低。

NeMo Switchyard:模型系统的智能路由

如果 Nemotron 3.5 Lightning 是主力,那么 NeMo Switchyard 就是调度员。该开源库根据特定需求,自动将提示路由到代理工作流程的每个步骤中最有能力、最高效的模型。有些模型更适合编码,有些模型更适合推理,有些模型更适合轻量级任务,有些模型经过优化可以在本地运行,以提高隐私性和效率。依赖单一默认模型可能意味着超支或牺牲质量;同时,手动管理路由成为可能减慢部署速度的集成工作。

代理应用程序开发人员可以使用不同的路由算法调整或修改路由器,以匹配其优先级,例如质量、延迟和成本要求。 NVIDIA 的内部基准测试表明,NeMo Switchyard 保持了前沿水平的准确性,同时将任务完成成本降低到仅 Opus 4.8 的近三分之一 — 对于运行大量代理任务的组织来说,这是一个惊人的效率提升。

该公司强调了一系列合作伙伴整合。 Boomi 报告域路由准确性为 100%,并将 59% 的流量发送到速度提高 5 倍的微调模型。 Cadence 将形式验证用例的效率提高了 9.9%。 Cognition 将 Switchyard 集成到 Devin Desktop 中,在 FrontierCode Main 上实现近乎前沿的性能,同时将平均成本降低 28%。 LangChain 报告称,通过仅将 7% 的呼叫路由到前沿模型,145 个多轮深度代理任务的成本降低了 74%。 LiteLLM 正在将 NeMo Switchyard 作为插件添加到其代理层,而 Kong 现在通过 Kong AI Gateway 本地提供路由。值得注意的是,Nous Research 将 NeMo Switchyard 集成到 Hermes 中,为开发人员提供易于配置的路由系统,以提高代理效率。

行业采用和大局观

各行业的人工智能领导者已经在为其工作负载定制 Nemotron 3.5 Lightning。 CrowdStrike 正在将其应用于网络安全,Harvey 正在将其用于法律服务,CodeRabbit 正在将其部署用于代码审查。 Lila Sciences 正在帮助提高物理和生命科学领域代理任务的推理能力,而 Fastino Labs 定制了该模型,并报告了软件开发、金融和医疗保健工作负载的领先准确性。

该版本强调了更广泛的行业趋势:随着代理人工智能的成熟,没有任何单一模型能够以可接受的成本做好所有事情。未来属于整体——协调专业工人队伍的前沿规划者——以及将他们联系在一起的工具。 NVIDIA 的赌注是,开放模型和智能路由将使企业能够组装这些系统,而无需将自己锁定在单一提供商的堆栈中。

保持人工智能领先地位

NVIDIA 的 Nemotron 3.5 Lightning 和 NeMo Switchyard 标志着代理 AI 的发展方向:更快、更便宜、更透明且可在任何地方部署。为了跟上模型发布和重塑格局的企业工具,请探索我们的突发人工智能新闻

阅读更多人工智能新闻 →