輝達於 8 月 11 日釋出開源模型 Nemotron 3.5 Lightning,這是一款 30B 引數的混合專家(MoE)模型,但僅有 3B 引數在每次推理時啟用。該模型專為長時執行的 AI 代理設計,旨在處理高頻、低延遲的執行任務,如工具呼叫、結果驗證和子代理委派,從而避免為每一步執行都呼叫前沿推理模型所帶來的高昂成本與延遲。
在架構上,MoE 模型通過路由器將每個 token 僅傳送給少數專家,因此每次推理只啟用部分引數,從而以較小計算成本獲得接近大型稠密模型的能力。Nemotron 3.5 Lightning 是 Nemotron 3 家族中最小成員,繼承了家族多項最佳化技術,包括投機解碼(訓練時引入多 token 預測)、DFlash 與 DSpark 推理最佳化,以及針對流行代理框架(如 OpenClaw 和 Hermes Agent)的訓練最佳化,使代理在高頻任務中能更準確呼叫並降低延遲。模型還支援 NVFP4 和 BF16 量化檢查點,輸出速度較同類模型最高提升 4 倍,可部署於從 NVIDIA DGX Spark 到資料中心的各類環境。
輝達同時推出 NeMo Switchyard 模型路由庫,允許開發者將 Nemotron 3.5 Lightning 與其他開源或閉源模型一同作為路由目標,實現任務智慧分配:規劃類任務路由至前沿模型(如 Nemotron 3 Ultra),執行類任務則路由至 Lightning,從而高效利用 token 預算。該模型以 OpenMDW-1.1 許可釋出,提供權重、訓練資料和配方,支援 LoRA 或全量微調,並附帶 Nemotron-RL Agentic Terminal Pivot 資料集,用於訓練編碼代理能力。
在效能上,輝達稱該模型在 Artificial Analysis Intelligence Index(綜合九項評估,涵蓋代理任務、編碼、科學推理和通用智慧)上實現了同類最高的輸出速度與領先的準確性,佔據準確率-速度帕累託前沿。
此次釋出反映了代理式 AI 開發中“模型系統”趨勢的加速:前沿模型負責複雜規劃,而輕量高效模型承擔高頻執行。對於 AI 產業而言,這有助於降低長時執行代理的推理成本,提升整體效率,並可能推動模型編排與路由技術的成熟。