輝達今日釋出了兩款面向企業AI的新產品:高效模型Nemotron 3.5 Lightning和智慧體模型路由器NeMo Switchyard。這一組合標誌著輝達正從單純的晶片供應商,向提供完整AI工作流解決方案的平台公司轉型。

Nemotron 3.5 Lightning是一款總引數約300億的混合專家模型,單次推理僅啟用約30億引數。輝達稱,相比同類模型,其輸出速度最高提升約4倍,智慧體任務完成速度提升約30%。該模型定位為多智慧體系統中的“執行型”模型,負責程式碼審查、安全監控、資料處理、告警分析等專業化任務,而複雜推理仍由前沿大模型承擔。混合專家架構使每次推理只啟用部分引數,從而降低單次token計算成本。

值得注意的是,輸出速度提升4倍並不等於整體任務提速4倍。模型推理只是智慧體工作流的一環,工具呼叫、API響應、多智慧體間的任務編排都會形成新瓶頸,因此實際任務提速被壓縮至約30%。這正是輝達同時推出NeMo Switchyard的原因——不僅要讓單個模型跑得快,還要解決“每一步該用哪個模型”的排程問題。

第三方評測機構Artificial Analysis的資料顯示,Lightning的Intelligence Index得分為24,比上一代小尺寸型號Nemotron 3 Nano高出9分,與OpenAI的gpt-oss-120b相當,僅落後於規模約為其4倍的Nemotron 3 Super 2分。在代理任務相關的GDPval-AA v2評測上,其Elo達到824,超越Nemotron 3 Super和gpt-oss-120b;在Terminal-Bench v2.1上取得24%的成績,而Nemotron 3 Nano僅為7%。預釋出測試中,其輸出速度接近每秒670個token。

Lightning的另一大特點是開放且易於定製。企業可在自有硬體上,用NeMo框架針對專有領域資料、工具和工作流進行二次訓練。輝達生成式AI副總裁Kari Briski介紹,CodeRabbit用輝達的標準模型配方訓練一個epoch,約兩小時、花費85美元就產出了一個路由智慧體;另一合作伙伴將Lightning直接放入已有後訓練棧,無需任何改動;還有公司用單張H100卡完成訓練,或晚上跑訓練任務、早上取結果。輝達同時開放了資料集、後訓練資料集以及訓練配方和框架,開發者可將輝達的後訓練資料與企業自有資料混合,構建“取兩家之長”的定製模型。

NeMo Switchyard是一個開源模型路由庫,它根據當前可用模型的數量和能力,在智慧體工作流的每一步將請求路由到最合適、最高效的模型,開發者可按質量、延遲、成本等優先順序自定義路由策略。輝達已與Boomi、Cadence Design Systems、Classmethod、Cognition、Kong、Langchain、Nous Research、Siemens等生態夥伴合作,將智慧路由整合到開發者現有工具中。

這兩款產品是輝達開源模型戰略的最新一步。Nemotron 3家族於去年12月推出,包含Nano、Super、Ultra三個尺寸。據The Information報道,輝達正在開發下一代Nemotron 4,目標引數量至少1萬億,約為現有最大模型Nemotron 3 Ultra的兩倍,旨在與全球頂尖開源模型比肩。輝達還組建了包含Reflection、Cursor、Thinking Machines、Mistral等在內的“Nemotron聯盟”,多方在推進自身模型的同時,向Nemotron 4貢獻訓練資料、評估支援和設計方案。

輝達的處境微妙:其晶片需求高度集中於OpenAI、微軟、SpaceX等少數前沿實驗室和雲服務商,而輝達已向OpenAI投資300億美元;另一邊,Nemotron 4定位為企業提供成本更低的替代方案,與這些前沿實驗室形成競爭。它一邊給客戶供晶片,一邊下場造模型,邊界日益模糊。

不過,這未必是零和遊戲。AI模型評測機構Arena的執行長Anastasios Angelopoulos指出:“無論哪家公司做出優秀的開源模型,輝達都是贏家。”開源生態越繁榮、參與主體越多元,GPU的整體需求就越旺盛。輝達的角色正從賣晶片的轉變為賣整個AI工作流的,只要模型跑在輝達的路由、推理和部署體系內,無論企業最終選擇誰的模型,它都能從整個工作流中獲益。這正是Switchyard與Nemotron 3.5同時釋出的深層含義。