8月28日,騰訊混元釋出並開源了新一代大模型Hy4 preview,這是自今年2月騰訊重建預訓練與強化學習基建以來,混元系列在約127天內推出的又一重要版本。Hy4 preview總引數達到770B,是上一代Hy3的2.6倍;啟用引數從21B提升至49B,上下文長度從256K擴充套件到1M。在多項基準測試中,Hy4 preview表現亮眼:軟體工程實戰基準DeepSWE上得分64.3,超過DeepSeek V4 Pro的62.7;Terminal-Bench 2.1上得分85.4,與Claude Opus 5持平。相比之下,7月初發布的Hy3在DeepSWE上僅得28.0分,而同期Claude Opus 4.8為58.0。混元團隊表示,Hy4 preview的釋出旨在通過儘快獲得廣泛真實反饋,以顯著提升正式版質量。
混元的迭代速度顯著加快,大版本週期已壓縮至約兩個月,接近Anthropic、OpenAI、智譜等頭部廠商的更新頻率。值得注意的是,騰訊是在重建地基的同時實現這一速度的。自Hy3 preview以來,混元在多項主流benchmark上均呈現顯著上升曲線,尤其在長上下文任務、程式碼庫重構、專業科學推理等接近真實生產力的領域,追趕勢頭明顯。
混元的加速邏輯核心在於“實戰驅動”。Hy4 preview釋出當天,騰訊同步開啟WorkBuddy和CodeBuddy兩週免費體驗,延續了Hy3 preview的“preview-first”策略。這一機制借鑑了OpenAI的“迭代式部署”理念:讓模型在真實世界中受控使用,再根據反饋修正。混元團隊將Hy3 preview視為“從讀萬卷書到行萬里路的開端”,其正式版在50多個業務中獲得廣泛反饋,幻覺率從12.5%降至5.4%,常識錯誤率從25.4%降至12.7%,多輪對話問題率從17.4%降至7.9%。
實戰反饋如何轉化為模型能力?混元團隊強調,Hy4 preview的能力提升來自與騰訊內部軟體工程、遊戲、金融、安全等領域專家的高質量資料共建。這體現了“Co-Design”方法:使用者提供問題分佈,專家提供質量標準,產品提供任務環境,模型團隊將三者整合進後訓練和評測體系。混元內部建立了50多套評測,不再將外部排名作為唯一標準。
騰訊的Agent產品矩陣成為混元的“訓練場”。WorkBuddy介面集成了混元、DeepSeek、GLM、Kimi、MiniMax等多款模型,使用者可自由切換,這為混元提供了直接的對照反饋。自Hy3正式版上線WorkBuddy以來,主動選擇Hy3 preview的使用者數量增長了6倍;接入正式版後,WorkBuddy內部測評的任務成功率從72%提升至90%,平均耗時縮短34%。混元已接入騰訊內部百餘個業務場景,包括元寶、CodeBuddy、ima、騰訊會議等,不同產品提供多樣化的任務環境,使模型習得的能力可遷移。
Hy4 preview更進一步,將實戰閉環搬進模型研發內部。它首次參與最佳化自己的推理系統,通過分析瓶頸、提出運算元融合和通訊最佳化方案,使端到端吞吐相對基線提升31.8%。在一個小模型後訓練任務中,Hy4 preview作為researcher協調多個Codex Session,8項評測全部優於Codex獨立探索。這標誌著行業正從“AI for Coding”走向“AI for AI”,模型開始參與改進承載自己的基礎設施。
回顧這127天,混元的加速度並非僅靠更大規模的預訓練,而是通過“釋出-實戰-反饋-再訓練”的閉環,將產品、使用者、專家和模型組織進同一條反饋鏈。騰訊的意義在於,它開始將模型、Agent產品、真實任務、資料反饋和推理基建整合為一個持續運轉的系統。大模型競爭正從算力、引數和文本資料轉向另一組能力:誰能找到真正有價值的問題,構造足夠真實的環境,並讓反饋鏈轉得更快。模型仍然重要,但決定下一次迭代速度的,還有圍繞模型運轉的整個系統。