英伟达推出NeMo Switchyard,利用AI模型路由技术降低智能体运行成本
Odaily星球日报讯 英伟达(NVIDIA)推出 AI 模型路由系统 NeMo Switchyard,旨在帮助开发者在多个大模型之间动态分配 AI 智能体(AI Agent)任务,在保证性能的同时降低成本和延迟。
英伟达表示,构建 AI 智能体并不意味着必须依赖单一大模型。不同模型在推理能力、响应速度和运行成本方面各有优势,例如分类任务可能适合轻量模型,复杂推理则需要更强大的前沿模型。如果所有请求都发送至最大规模模型,将导致成本和延迟增加;而全部使用小模型则可能降低复杂任务完成质量。NeMo Switchyard 通过智能路由机制,根据任务需求、模型能力、成本、延迟以及系统状态等因素,在多个专用模型和前沿模型之间自动选择最合适的执行模型。该系统支持开发者在不改变应用架构的情况下切换不同模型供应商和模型版本。
英伟达介绍,NeMo Switchyard 提供多种路由策略,包括无需训练的 LLM 分类器路由、阶段路由(Stage Router)、升级路由(Escalation Router),以及基于真实工作负载数据训练的可调节路由模型。其中,升级路由会优先将任务分配给低成本模型,并在检测到任务复杂度提升、持续错误或执行停滞时,将请求升级至更强模型,从而实现性能与成本之间的平衡。
英伟达表示,在相关测试中,NeMo Switchyard 通过在不同模型之间分配任务,在保持较高任务完成率的同时显著降低 AI Agent 运行成本。例如,与仅使用前沿模型相比,基于升级路由的方案在 LangChain 多轮智能体测试中降低约 74%的成本,仅有 7%的请求需要调用前沿模型。
此外,英伟达已与 Cognition、Nous Research、Ramp、LangChain、LiteLLM、Kong 等企业合作,将 NeMo Switchyard 集成至 AI Agent 开发流程和企业应用基础设施中。
