輝達本週釋出了一款名為NeMo Switchyard的軟體平台,試圖緩解企業AI基礎設施和模型定價飆升帶來的成本壓力。該平台本質上是一個路由器,作為推理伺服器API端點與模型之間的代理,可根據成本、延遲或輸出質量等指標,將提示詞路由至不同模型,而非將所有請求傳送至同一模型。輝達聲稱,通過將部分請求路由至更小、更便宜甚至本地託管的AI模型,Switchyard可將任務完成成本降低74%,相較於單獨使用Claude Opus 4.8,但代價是準確率約損失6個百分點。該平台與輝達最新開源模型Nemotron 3.5-30B-A3B-Lightning一同釋出,後者是一個300億引數的混合專家(MoE)模型,定位為低延遲通用模型,可獨立使用,也可通過Switchyard等路由器與更大、更智慧的模型配合使用。

輝達強調的關鍵指標是“完成成本”而非“每token價格”。一個模型的價格可能僅為OpenAIAnthropic頂級模型的十分之一,但如果它完成任務所需的token數量是後者的10倍,那麼實際上並不更便宜。某些AI工作負載可能受益於更大、更智慧的模型,但並非所有任務都如此。例如,用Claude Opus生成標題卡或總結網站內容可能大材小用,雖然能完成任務,但成本遠高於使用Haiku或針對該任務微調的本地託管模型。在大型智慧模型上消耗的token越少,API賬單就越低。

輝達軟體團隊多年來一直為此開發模型,本週釋出的Lightning只是最新成果。公司還開發了多個應用專用模型,例如Nemotron Parse,這是一個10億引數的小模型,擅長從PDF中提取並解釋圖表、表格等上下文。輝達AI軟體與模型高階總監Joey Conway表示,許多前沿模型在處理PDF時表現不佳,因為PDF是為人類設計的,而將這類工作解除安裝給任務專用模型,企業不僅能提高AI應用的準確性,還能降低成本。

模型路由器並非新概念。OpenAI在推出GPT-5時,ChatGPT就曾根據提示詞複雜度動態路由至不同模型版本,以減少處理重寫郵件等瑣碎任務的計算週期。據《華爾街日報》報道,AT&T也部署了自家的“智慧路由器”來自動選擇模型,從專有模型轉向開源權重模型,在某些應用中節省了80%至90%的成本。目前該公司約25%的AI工作負載由開源模型驅動,管理層預計未來幾年這一比例將升至70%至80%

儘管將簡單請求解除安裝至更小、更便宜模型的想法聽起來直觀,但實施起來並非易事。標題卡和網頁摘要等任務相對簡單,開源聊天機器人如Open WebUI已支援此類功能一年多。然而,有時並不清楚何時何地應使用任務模型。Switchyard是輝達簡化這一過程的嘗試,通過自動將請求路由至合適的模型。此外,輝達還在探索其他方法,例如AI代理和程式碼助手可以邊工作邊生成“技能”——即標準操作流程——記錄過程以供未來參考。Conway指出,通過這種迭代過程,代理可以自學何時何地可以使用更小、更便宜的任務模型,以及何時需要更大的前沿模型。他觀察到“代理和子代理工作流”的跡象,前沿模型可能充當編排者,將工作分派給更快、更專業的較小模型,這反映了公司的組織結構——“我們有專家,也有幫助編排和理解問題複雜性的人”。此外,代理還可以即時生成訓練資料,用於微調模型以提高效率。

無論哪種方法最終勝出,任何促進企業採用AI的舉措對輝達都是利好。