DeepSeek正式加入超大引數競賽。據The Information報道,該公司目前正在訓練一個約2萬億引數的新模型;梁文鋒在近期一場投資者會議上表示,公司下一步計劃把模型規模繼續推到8萬億引數。這一目標相當於DeepSeek今年4月釋出的V4-Pro(1.6萬億總引數、490億啟用引數)的約5倍。

放在一年前,8萬億還是難以想象的數字。但如今,Kimi K3已做到2.8萬億總引數、1040億啟用引數,仍是已正式釋出、引數規模最大的開放權重模型;位元組被曝正在預訓練一個最高可能達到10萬億引數的新模型,由Seed Foundation負責人項亮主導;阿里CEO吳泳銘公開宣佈,下一代模型計劃做到5萬億到10萬億引數Anthropic雖不公開引數,但FT此前援引業內估計稱,其最新旗艦Mythos 5大約在8萬億引數左右。

這一轉向對DeepSeek而言頗為反常。2024年底釋出V3時,DeepSeek曾把訓練賬單擺上台面:6710億總引數、每Token啟用370億引數,完整訓練消耗278.8萬H800 GPU小時,按每GPU小時2美元計算,官方給出的訓練成本僅557.6萬美元。效率而非規模,一度是DeepSeek最鮮明的標籤。

條件變化是路線調整的直接原因。DeepSeek今年6月完成成立以來首輪外部融資,募資約74億美元;第二輪約500億元人民幣(約75億美元)的融資已進入最後敲定階段,對應估值約5000億元人民幣。若順利完成,幾個月內累計外部融資將接近150億美元。公司已聘請中信證券籌備科創板IPO,新增資本明確用於算力基礎設施、模型開發和人才投入;9月21日,原高瓴創投合夥人嚴文韜正式出任CFO,結束了成立三年來CFO空缺的狀態。資金與算力條件改善後,DeepSeek開始有能力在引數規模上大膽投入。

引數重新成為焦點,背後是主流架構的變化。過去Dense架構下,引數規模與計算量基本繫結,模型越大、訓練和推理成本越高。如今超大模型普遍採用MoE(混合專家)架構,模型可擁有數百甚至數千個專家,但每次任務只啟用其中一小部分。例如Kimi K3的2.8萬億總引數中,每Token僅啟用約1040億,佔比約3.7%;DeepSeek V4-Pro每Token啟用約490億,佔比約3%。總引數與單次啟用引數由此成為兩個獨立數字,模型可以繼續擴大容量,而不必讓每次計算同比變重。月之暗面稱,靠更稀疏的MoE和架構最佳化,K3整體Scaling效率相比K2提升約2.5倍

Agent時代的到來進一步放大了這種容量的價值。過去衡量Chatbot能力往往逐項測試,數學、程式碼、問答各自看峰值;而Agent把能力串進同一條任務鏈,一次長任務可能涉及搜尋、讀網頁、寫程式碼、呼叫終端、處理報錯、協調子Agent等數十上百步操作。OpenAI今年9月釋出Agents API時,就把長時間執行、上下文管理、工具使用和子Agent協調列為核心基礎設施,強調Agent需可靠執行數小時甚至數天。任務越長,對能力覆蓋面和穩定性的要求越高,前沿競爭因此出現明顯的“木桶效應”。METR已直接用“任務時間跨度”衡量Agent能力。

更大的引數容量因此有了新的意義:任務越長,模型越不能偏科;Agent能做的事情越多,底座需要覆蓋的能力就越廣。MoE打開了容量擴張的空間,Agent則把容量的價值進一步放大。於是,模型廠商一邊拼命提高效率,一邊重新把引數往5萬億、8萬億、10萬億推。省下來的算力並沒有讓Scaling消失,反而為新一輪Scaling騰出了空間。