NVIDIA 发布开源 30B MoE 模型与 NeMo Switchyard 路由器,优化智能体执行层效率

NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Model Router Interface

在人工智能快速演进的浪潮中,模型效率与成本控制已成为企业落地应用的核心痛点。近日,NVIDIA 宣布推出两款重磅开源产品——Nemotron 3.5 Lightning 模型以及 NeMo Switchyard 模型路由器。这两款工具的发布,标志着 NVIDIA 在构建高效、可扩展的 AI 智能体执行层方面迈出了关键一步,旨在为开发者提供一种全新的、成本效益更高的模型部署方案。

Nemotron 3.5 Lightning:轻量级高性能 MoE 模型

Nemotron 3.5 Lightning 是 NVIDIA 发布的最新开源模型,其最引人注目的特性在于其独特的架构设计。该模型拥有 300 亿(30B)的总参数量,但在推理过程中,仅有 30 亿(3B)参数处于激活状态。这种设计属于典型的混合专家模型(MoE,Mixture of Experts)架构。

在传统的密集模型中,所有参数都需要参与每一次计算,而 MoE 架构则通过稀疏激活的方式,在保持模型拥有庞大“知识库”的同时,大幅降低了计算开销。NVIDIA 通过 Nemotron 3.5 Lightning 证明了,即使总参数量达到 300 亿,通过高效的稀疏激活,其推理速度和成本可以与更小的模型相媲美,同时还能保持接近顶尖密集模型的性能表现。作为开源模型,它将极大地降低开发者获取高性能基础模型的技术门槛。

NeMo Switchyard:智能体的智能路由中枢

如果说 Nemotron 3.5 Lightning 是“强健的肌肉”,那么 NeMo Switchyard 则是“聪明的指挥官”。NeMo Switchyard 是一个创新的模型路由框架,专门为 AI 智能体的执行层设计。

在构建复杂的 AI 智能体时,任务往往千差万别:有些任务需要极强的逻辑推理能力,有些则只需要简单的对话回复。直接为所有任务部署昂贵的顶级大模型会导致巨大的资源浪费。NeMo Switchyard 的核心功能就是智能路由——它能根据具体任务的需求,将输入动态地路由到最合适、最经济的模型上。

例如,对于简单的查询,路由器可能会调用一个小型的、低成本的模型来处理,从而节省算力;而对于复杂的代码生成或数学推理任务,路由器则会自动切换到 Nemotron 3.5 Lightning 或其他更强大的模型。这种“按需分配”的策略,不仅优化了资源利用率,还确保了智能体在各种场景下都能输出高质量的响应。

行业影响与应用场景

NVIDIA 这一系列产品的发布,深刻地回应了当前 AI 行业对于“智能体执行层”的迫切需求。随着 AI 智能体从概念走向落地,企业需要构建能够自主规划、调用工具并完成复杂任务的系统。然而,模型成本和延迟一直是制约其大规模部署的瓶颈。

Nemotron 3.5 Lightning 和 NeMo Switchyard 的结合,为构建企业级智能体提供了标准化的解决方案。开发者可以利用这些工具,构建出既具备复杂决策能力,又具备成本意识的 AI 助手。潜在的应用场景包括:企业内部的自动化工作流助手、需要处理多轮对话的智能客服系统,以及能够自主调用 API 完成任务的自动化代理。

总的来说,NVIDIA 通过开源 Nemotron 3.5 Lightning 和 NeMo Switchyard,正在推动 AI 基础设施向更加开放、高效和智能的方向发展。这不仅为开发者提供了强大的工具箱,也为整个行业探索更高效的 AI 运行模式提供了宝贵的实践参考。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/11/nvidia-ai-releases-nemotron-3-5-lightning-and-nemo-switchyard/

封面图片来源:Unsplash / 摄影师 Mariia Shalabaieva

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注