英伟达本周发布了一款名为NeMo Switchyard的软件平台,试图缓解企业AI基础设施和模型定价飙升带来的成本压力。该平台本质上是一个路由器,作为推理服务器API端点与模型之间的代理,可根据成本、延迟或输出质量等指标,将提示词路由至不同模型,而非将所有请求发送至同一模型。英伟达声称,通过将部分请求路由至更小、更便宜甚至本地托管的AI模型,Switchyard可将任务完成成本降低74%,相较于单独使用Claude Opus 4.8,但代价是准确率约损失6个百分点。该平台与英伟达最新开源模型Nemotron 3.5-30B-A3B-Lightning一同发布,后者是一个300亿参数的混合专家(MoE)模型,定位为低延迟通用模型,可独立使用,也可通过Switchyard等路由器与更大、更智能的模型配合使用。
英伟达强调的关键指标是“完成成本”而非“每token价格”。一个模型的价格可能仅为OpenAI或Anthropic顶级模型的十分之一,但如果它完成任务所需的token数量是后者的10倍,那么实际上并不更便宜。某些AI工作负载可能受益于更大、更智能的模型,但并非所有任务都如此。例如,用Claude Opus生成标题卡或总结网站内容可能大材小用,虽然能完成任务,但成本远高于使用Haiku或针对该任务微调的本地托管模型。在大型智能模型上消耗的token越少,API账单就越低。
英伟达软件团队多年来一直为此开发模型,本周发布的Lightning只是最新成果。公司还开发了多个应用专用模型,例如Nemotron Parse,这是一个10亿参数的小模型,擅长从PDF中提取并解释图表、表格等上下文。英伟达AI软件与模型高级总监Joey Conway表示,许多前沿模型在处理PDF时表现不佳,因为PDF是为人类设计的,而将这类工作卸载给任务专用模型,企业不仅能提高AI应用的准确性,还能降低成本。
模型路由器并非新概念。OpenAI在推出GPT-5时,ChatGPT就曾根据提示词复杂度动态路由至不同模型版本,以减少处理重写邮件等琐碎任务的计算周期。据《华尔街日报》报道,AT&T也部署了自家的“智能路由器”来自动选择模型,从专有模型转向开源权重模型,在某些应用中节省了80%至90%的成本。目前该公司约25%的AI工作负载由开源模型驱动,管理层预计未来几年这一比例将升至70%至80%。
尽管将简单请求卸载至更小、更便宜模型的想法听起来直观,但实施起来并非易事。标题卡和网页摘要等任务相对简单,开源聊天机器人如Open WebUI已支持此类功能一年多。然而,有时并不清楚何时何地应使用任务模型。Switchyard是英伟达简化这一过程的尝试,通过自动将请求路由至合适的模型。此外,英伟达还在探索其他方法,例如AI代理和代码助手可以边工作边生成“技能”——即标准操作流程——记录过程以供未来参考。Conway指出,通过这种迭代过程,代理可以自学何时何地可以使用更小、更便宜的任务模型,以及何时需要更大的前沿模型。他观察到“代理和子代理工作流”的迹象,前沿模型可能充当编排者,将工作分派给更快、更专业的较小模型,这反映了公司的组织结构——“我们有专家,也有帮助编排和理解问题复杂性的人”。此外,代理还可以即时生成训练数据,用于微调模型以提高效率。
无论哪种方法最终胜出,任何促进企业采用AI的举措对英伟达都是利好。