今日凌晨,DeepSeek V4 Pro正式版與Grok 4.6在約兩小時內相繼釋出,兩者引數規模相近(分別為1.6T1.5T),體驗均逼近Claude Fable 5。作者卡茲克在體驗後表示,這兩款模型將大模型市場推入新的“斬殺線”,可能淘汰大量中間層玩家。

卡茲克在文中詳細對比了兩款模型的效能與價格。DeepSeek V4 ProTerminal Bench 2.1評測中得分從預覽版的72.1升至87.9,僅比Fable 5的88.0低0.1分;在DeepSWE評測中從12.8大幅提升至62.7,雖仍低於Fable 5的70分,但進步顯著。其API價格僅為百萬輸出Token 0.87美元,輸入0.43美元,快取命中輸入0.0036美元,相比Fable 5(輸入10美元、輸出50美元)便宜數十倍。不過,該模型仍缺乏多模態能力,且在純知識推理和困難軟體工程任務上落後Fable 5約十幾分。

Grok 4.6的API起步價為百萬輸入Token 2美元、輸出6美元,較Fable 5便宜5倍和8.3倍。卡茲克特別提到,訂閱SuperGrok Heavy(300美元)可獲贈價值200美元的Cursor Ultra會員,且額度消耗極慢——他連續開發4小時僅消耗周額度的2%。在真實任務(如財務模型、PPT、法律案件)中,Grok 4.6表現不輸Kimi K3,但開發與Agent能力仍略遜於Fable 5。

卡茲克認為,這兩款模型從不同方向打破了“效能、價格、速度”的不可能三角:DeepSeek以極低價格提供準Fable級Agent能力,Grok則兼具接近Fable的綜合性能與極快速度。他預測,這將抬高行業門檻,使夾在中間的模型難以生存,並稱“大模型世界,再無活口”。他還透露,已將日常主力開發切換至Grok Build + Grok 4.6,並將自動化任務交給DeepSeek V4 Pro,同時為兩者分別充值了300美元會員和1000元API額度。

作者最後提到,馬斯克宣稱Grok 4.7將超越所有模型,他對此表示相信。整體而言,這次釋出標誌著大模型競爭進入新階段,價效比與速度成為關鍵分水嶺。