7月,大模型行業迎來罕見的釋出高峰:一個月內,9款旗艦模型扎堆亮相,從月初騰訊混元Hy3釋出正式版並開源,到月末Anthropic釋出Claude Opus 5,其間Kimi K3、Qwen3.8-Max預覽版、Grok 4.5等陸續登場。這被行業視為近一年少見的密集釋出潮,也標誌著“最強模型”的保質期正在縮短,競爭進入“月拋”時代。

這一輪發布反映出兩個顯著變化。第一,模型之間的能力差距正在縮小。據Artificial Analysis最新綜合智慧指數,頭部模型分差明顯收窄,單一維度的絕對領先越來越難維持,各家開始圍繞不同任務尋找優勢。第二,開源模型正在進入第一梯隊。7月釋出的騰訊混元Hy3、Kimi K3等選擇開放權重,其中Kimi K3在Code Arena前端程式設計榜單中排名第一,超過GPT-5.6 Sol和Claude Fable 5。過去兩年,開源模型多被視為閉源模型的追趕者,如今已在部分開發場景中與閉源模型直接競爭。

競爭維度已從“誰更聰明”擴充套件到多個方向。程式碼能力成為最明顯的爭奪焦點:OpenAI強化程式設計和複雜推理,擴充套件Codex生態;Anthropic押注程式碼理解和安全審計;Grok 4.5強調速度和低成本,並與AI程式設計工具Cursor繫結。大模型研究者姚宇航對「定焦One」表示,各家公司都在重點投入程式設計能力,差距快速縮小,Kimi K3的程式碼能力已接近頭部閉源模型。Agent是另一爭奪方向,GPT-5.6 Sol配合Codex探索自動化程式設計,Opus 5強調長程任務執行,Kimi K3展示連續執行能力,騰訊混元Hy3則結合微信生態探索智慧體應用。但Agent在實際工作中仍不成熟,獨立開發者北城指出,部分智慧體的短板在任務排程能力,如Codex的Ultra模式開啟多個子代理重複讀取檔案,導致Token消耗增加但有效工作未增。姚宇航認為,智慧體是值得關注的方向,但離成熟還有距離,垂直領域如醫療、金融仍有較大機會,下一階段差距取決於場景實用性和客戶付費意願。

引數規模與推理效率的競爭成為另一主線。7月多款模型進入萬億甚至數萬億引數區間,但引數規模已不能簡單等同於能力。MoE架構讓模型擁有更大引數容量,同時只啟用一小部分完成推理,降低成本。行業形成兩條路線:一是繼續擴大規模,二是強調效率。價格成為最直接的變數:海外廠商差異化定價,OpenAI拆分GPT-5.6版本,Anthropic維持高效能旗艦路線,Grok 4.5輸出價格僅為Opus系列的四分之一;國內廠商則持續下調API價格,以低成本擴大使用者規模。

具體來看,7月模型表現可分為三類。超出預期的一類包括Kimi K3、Grok 4.5和混元Hy3。Kimi K3採用MoE架構,總引數達萬億級別,釋出當天以1679分登頂Code Arena前端程式設計榜,較前代Kimi K2.6的第18名提升17個位次,一週後進入Arena綜合榜全球Top 10。但其幻覺率從K2.6的39%升至51%,輸出速度約33 Token/s,低於同類。北城認為Kimi K3優勢集中在前端開發、UI設計和產品表達,複雜工程任務表現不穩定。Grok 4.5於7月9日釋出,進入Artificial Analysis智慧指數前列,在工具呼叫測試中表現突出,被開發者視為價效比之選。北城稱其最大優勢是速度,同一需求用Grok 4.5可能三五分鐘完成,而GPT-5.6有時需二十分鐘甚至半小時。姚宇航認為其程式設計能力經專門最佳化,搭配Cursor體驗良好。背景是SpaceX此前宣佈收購Cursor母公司Anysphere,交易預計三季度交割,xAI與Cursor的資料合作被認為幫助優化了Grok 4.5的程式設計體驗。混元Hy3總引數295B、啟用引數僅21B,以不到旗艦模型五分之一的引數規模在多個公開基準中接近更大競品,但在SWE-Bench Pro中57.9分與Claude Opus 4.8的69.2分仍有明顯差距。姚宇航認為混元Hy3相比騰訊之前模型有進步,開源加小尺寸設計是中等體量裡的不錯選擇。

穩定在第一梯隊但驚喜有限的是GPT-5.6 Sol和Claude Opus 5。GPT-5.6 Sol強化複雜推理和智慧體程式設計,在Terminal-Bench 2.1測試中達88.8%,Ultra模式提升至91.9%;Claude Opus 5保持複雜任務優勢,效能接近Fable 5但價格只有後者一半。北城表示GPT-5.6已覆蓋大部分日常開發需求,複雜問題會呼叫Opus 5,後者定位更像“專家”。反饋分化的一類是Gemini 3.6 Flash和Qwen3.8-Max預覽版。Gemini 3.6 Flash在Artificial Analysis智慧指數得分為50,與前代持平,開發者反饋提升不明顯,但多模態理解仍出色。Qwen3.8-Max預覽版效果不穩定,北城認為思考深度高但有時陷入長時間推理,卡普迪姆則用前端審美測評發現實際能力與宣傳有差距,最終表現待正式版驗證。

7月沒有出現全維度領先的模型,不同模型圍繞具體場景形成分工。開發者會按任務選擇工具:GPT-5.6負責日常開發,Grok 4.5用於快速需求,Kimi K3用於產品和前端,Claude Opus 5解決複雜問題。

這輪密集釋出背後,模型迭代方式正在變化。過去能力提升依賴重新訓練更大模型,週期長、成本高;如今強化學習、後訓練技術成熟,模型升級更多依賴訓練後最佳化。姚宇航指出,近兩年釋出速度加快,重要原因是行業掌握了更成熟的後訓練方法,很多提升無需重新訓練,而是基於已有模型繼續最佳化。這意味著競爭週期縮短,領先視窗可能只有幾周,釋出時間本身成為競爭的一部分。7月是多個節點疊加:國內廠商借世界人工智慧大會(WAIC)集中釋出,海外廠商也選擇此時更新以佔據主動。

開源與閉源之爭在7月升溫。當高效能模型可免費獲得,模型公司的API和訂閱收入可能被分流。支援開源者認為開放權重降低技術門檻,推動生態發展;閉源陣營則擔心使用者分流,Anthropic等公司認為開放權重可能帶來安全風險。這場爭論背後對應不同利益:輝達等基礎設施企業受益於更多部署需求,OpenAI、Anthropic等模型公司依賴閉源維持收入。但開源擴大部署的同時,引數效率提升可能攤薄單位任務算力消耗,算力市場增量未必與開放程度同步。對國內廠商,開放權重也是爭取開發者生態、雲服務和商業化入口的策略。

7月之後,開發者社群普遍預計DeepSeek V4正式版、Fable 5.1、GPT-6等將在8月釋出。模型能力差距縮小,單靠釋出更強模型難以建立長期優勢。值得觀察的指標包括:DeepSeek V4正式版能否推高開源模型能力上限,API價格是否繼續下探,智慧體能否出現穩定付費場景,以及開源模型能否進入更多企業私有化部署。這些答案將比榜單名次更能說明這場混戰的實際影響。