7月底至8月中旬,開源大模型迎來一波密集釋出潮:國內Kimi K3、Qwen3.8-Max先後放出權重,DeepSeek V4 Pro正式版上線;沉寂一年多的美國開源陣營也強勢迴歸,Meta推出Muse Glimmer,輝達帶來Nemotron 3.5 Lightning。面對如此盛況,矽星GenAI(作者週一笑)將五款模型接入同一測試環境,進行了一場全面橫評,涵蓋邏輯推理、程式碼畫圖、Agent任務、Blender指令碼生成和寫作改寫等維度,所有結果由指令碼加真人盲評打分。
測試設計上,每道題設定了統一的輸出上限,思考與作答共用額度,超限即視為未交卷;同時,超限任務會放開上限單獨完整跑一遍作為對照。最終成績顯示,Kimi K3表現最全面,十項測試中六項拿到滿分,DeepSeek V4 Pro緊隨其後位居第二。值得注意的是,部分0分源於模型思考過長被截斷,而非能力缺失。
在邏輯推理環節,24點與五位數密碼鎖題目暴露了大小模型的差距。K3和Qwen在密碼鎖上全對,而Muse Glimmer和Nemotron 3.5 Lightning兩個小模型因思考過長撞上輸出上限,直接交了白卷——託管平台給它們的單次輸出額度分別只有16K和24K token。放開上限補跑後,Muse密碼鎖兩次全對,Nemotron燒掉六萬token仍給出錯誤答案,DeepSeek則全對。加時賽中,每個模型有30美分預算,可重試至花完。DeepSeek一輪全對,五題全解僅花4美分,比靠重試磨出結果的Muse便宜四倍;K3一次認真思考就要35美分,Qwen也需近20美分。
程式碼畫圖環節,測試要求模型用SVG程式碼繪製“白頭鷹騎車、熊貓撐傘”的畫面。多模態模型K3和Qwen表現最佳,能一眼認出劇情;Nemotron和Muse的作品則“需要觀眾自帶想象力”。第二道題要求用虛構城市的地鐵資料(四條線26個站)編寫單檔案網頁,實現線路圖繪製、路線計算與換乘動畫。K3兩次滿分,Muse畫圖但路線算錯,Nemotron功能缺失大半,Qwen在上限內未寫完但放開後補交完成度很高的版本,DeepSeek排第二。第三道題讓模型為自己的成績單製作視覺化網頁,DeepSeek兩次都在上限內完成並拿下最高分,Muse兩次完成居第二。
Agent能力測試中,模型需自主讀檔案、跑命令、改程式碼。修bug任務(埋三個bug、十二個測試全綠)五家全部完成,但成本差異顯著:兩個30B模型一次不到1美分,萬億引數模型貴數倍,DeepSeek僅0.3美分。賬單清洗任務中,K3、Qwen、DeepSeek滿分,Muse十五輪全耗在編碼問題上,Nemotron僅獲部分分數。首次測試時託管商不支援Nemotron原生工具呼叫,後補測仍未能通過賬單題。
Blender指令碼測試要求從零構建一座中式庭院,K3兩份指令碼一次跑通並渲染出圖,Qwen放開上限後出圖,Muse指令碼報錯,Nemotron先被截斷後寫錯介面名,DeepSeek一份出圖、另一份因廢棄引數失敗。寫作環節的四道改寫題中,簡單題差距不大,難題(漲價說明、年終盤點)沒有模型摸到4分,K3是唯一在兩道難題中都拿到3分的模型。
綜合來看,大模型與小模型的差距依然存在,但各自優勢明顯。K3在衝能力上限,可與最前沿閉源模型比肩,但相對貴且慢;Qwen穩而全能,給足時間大多能完成;DeepSeek則是最讓人意外的——能力不弱、價格極低,加時賽五題全對僅花4美分,與兩個小引數模型同屬低成本梯隊,其價效比優勢可能進一步拉低市場對“強模型合理價格”的預期。小模型在簡單任務上快而便宜,但面對長時間推理、複雜程式碼或連續工具呼叫時仍顯吃力。
此次橫評也折射出開源生態的活躍:Meta預告旗艦Muse Spark 1.2權重未來幾周放出,阿里已將Qwen3.8大杯權重上傳Hugging Face。半個月內如此多開源模型集中出現,一年前難以想象。對模型使用者而言,更多選擇無疑是好事。需要說明的是,本次測試通過OpenRouter接入各家託管商,花費按託管商標價結算,與官方API價目不完全一致。