关注我们: 微信公众号

扫码关注我们

NVIDIA 发布 AI 模型“智能路由器”:自动切换大小模型,调用成本最高降低 74%

云头条 2026-08-13 9

2026 年 8 月 13 日,英伟达推出开源模型路由工具 NeMo Switchyard。

3.jpg

Switchyard 可以根据任务难度、成本、延迟和模型能力,在多个大模型之间自动分配请求,让简单任务交给便宜的小模型,复杂任务再调用 Claude 等前沿模型,以降低企业运行 AI Agent 的推理成本。 

Switchyard 本质上是位于 AI 应用与模型之间的一层“智能路由器”。

企业可以同时接入开源模型、自托管模型以及 OpenAI、Anthropic 等商业模型,Switchyard 会在运行过程中分析请求以及上下文,再决定由哪个模型处理,而不需要应用本身针对每个模型重新开发调用逻辑。 

例如,复杂规划、连续出错或者需要较强推理能力的任务,可以被发送至能力更强的前沿模型;代码修改、格式整理、工具调用验证等相对机械的任务,则可以交给成本更低的小模型。

4.jpg

英伟达的测试显示,不同模型不仅能力存在差异,Token 消耗特征也明显不同。其中,Kimi 在 Prompt Token 使用上整体更高效,而 Qwen 在输出 Token 控制上更有优势。

选择模型不能只看准确率,还需要同时考虑输入、输出 Token、延迟和实际调用成本,这也是 Switchyard 进行动态路由的核心依据。

Switchyard 支持根据一个 Agent 的执行阶段动态更换模型,而不是一次会话始终使用同一个模型。

英伟达披露的一项 LangChain 测试显示,在包含 145 个多轮 Agent 任务的内部评测中,Switchyard 使用“升级路由”在 Nemotron 3.5 Lightning 和 Claude Opus 4.8之间动态切换,最终只有 7% 的调用被发送至 Claude Opus 4.8

与全部使用 Claude Opus 4.8 相比,整体任务完成成本下降 74%,但准确率也下降约 6 个百分点 

另一项与 Cognition 的测试中,Devin Desktop 在 Opus 5 和 Kimi K2.7 之间进行路由,在 FrontierCode Main 编程基准上取得 50.6% 的成绩,平均任务成本为 3.11 美元;准确率较全部使用 Opus 5 低 2.8 个百分点,但平均成本下降约 28%。

Switchyard 同期还与英伟达新发布的 Nemotron 3.5 Lightning 配套推出。该模型采用 MoE 架构,总参数量为 300 亿,每次推理激活约 30 亿参数,定位于高频、低延迟的 Agent 执行任务。英伟达希望形成一种“大模型负责规划、小模型负责执行”的架构,通过 Switchyard 自动决定什么时候值得调用昂贵的前沿模型。 

目前,NeMo Switchyard 已完全开源,并支持 OpenAI、Anthropic 等常见 API 请求格式。

英伟达还在与 Cognition、LangChain、LiteLLM、Kong、Ramp、Siemens、Cadence 等厂商合作,将模型路由能力接入现有 Agent、网关和企业应用。

模型路由本身并非新概念。

此前 OpenAI 在 GPT-5 中已经采用类似机制,根据任务复杂度决定调用不同模型;AT&T 也通过自己的智能路由系统,将部分任务从闭源模型迁移至开放模型,并称部分应用的成本因此降低 80% 至 90%

英伟达此次的不同之处,是希望将这一套模型调度能力做成通用、开源的软件基础设施,供企业直接部署。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

关键词:

网友留言2

未查询到任何数据!
◎欢迎您留言咨询,请在这里提交您想咨询的内容。