騰訊混元於8月28日釋出新一代大模型Hy4 preview,憑藉開源第一的基準成績迅速引發關注。該模型總引數770B、啟用引數49B、上下文長度1M,在Terminal Bench 2.1上得分85.4,SWE-bench Multilingual得分82.9,兩項均為開源第一。釋出當天,API排隊使用者即超過5000人,騰訊WorkBuddy隨後對推理叢集進行緊急擴容,並宣佈將Hy3限免延長至2026年9月30日,以緩解高峰時段的排隊壓力。
Hy4 preview是騰訊基礎模型部成立後推出的首款新模型,也是姚順雨理念的集中體現。姚順雨於今年7月統管合併後的基礎模型部,首次打通了訓練、資料、評估、推理的全鏈路。此前,騰訊的大語言模型部和多模態模型部分屬不同體系,各自擁有獨立的資料與技術框架,而合併後,姚順雨得以將自進化機制貫穿模型研發的四個環節:訓練方法、資料策略、評估體系和底層運算元。
在技術層面,Hy4 preview的注意力模組採用DeepSeek的Gated機制與MTP層做投機解碼,配以智譜的IndexCache實現跨層稀疏索引複用,殘差通路則使用位元組的iHC(identity Hyper-Connections)。儘管借鑑了多方技術,混元團隊在技術報告中明確標註了每項技術的來源及修改方式,並強調Hy4 preview形成了獨特風格。
姚順雨的自進化理念與智譜、DeepSeek均有不同。智譜的自進化發生在訓練階段,通過“AI研究員”與“AI判卷員”流水線生成訓練資料,提升模型智慧;DeepSeek的自進化發生在執行階段,通過DSH實現“一切皆外掛”的自我修改。而騰訊Hy4 preview的自進化發生在研發流程本身,模型參與定義自己的訓練方法、資料策略和評估體系,即“先定義自己是什麼,再朝目標發展”。這種全鏈路自進化要求組織統一,而姚順雨正是這一整合的關鍵推動者。
姚順雨對工程化的重視在Hy4 preview中體現明顯,混元是三家之中唯一將底層運算元最佳化和推理吞吐量提升納入自進化列表的團隊。他入職後重建了基礎設施,強調“把Infrastructure重建了,無論是預訓練還是強化學習”。在算力緊張的背景下,姚順雨通過Co-design方法論,邊訓邊用,讓產品反饋倒逼模型迭代,Hy3時期主要發生在模型與產品之間,而Hy4 preview則將範圍擴大至整個研發流程。
姚順雨是語言Agent研究的開創者之一,其代表作ReAct(2022年10月釋出,ICLR 2023發表,引用超萬次)已成為當前Agent工作的基礎範式,Claude Code、Codex等底層迴圈均為其變體。另一代表作Tree of Thoughts(ToT)則通過多路徑探索與評估增強推理深度。從Hy3到Hy4 preview,模型從“單路徑執行”升級為“多路徑探索+深度驗證”,Hy4 preview在推理深度上明顯加強,但官方也承認其複雜任務上可能思考時間過長、存在過度自我驗證傾向。
訓練資料方面,Hy4 preview強調與騰訊內部軟體工程師、遊戲開發者、金融分析師、安全專家共建資料,並結合CodeBuddy、WorkBuddy等真實產品共同設計,確保模型進步錨定在真實生產力上。這種“結果導向”與“過程導向”結合的資料策略,正是支撐ReAct與ToT迴圈的關鍵。
總體而言,Hy4 preview不僅是模型升級,更是姚順雨從學術到工程的一次“轉正”。它標誌著騰訊混元在組織整合後,將姚順雨的方法論完整物質化,其開源效能與自進化路線或將對開源大模型格局產生深遠影響。