腾讯混元于8月28日发布新一代大模型Hy4 preview,凭借开源第一的基准成绩迅速引发关注。该模型总参数770B、激活参数49B、上下文长度1M,在Terminal Bench 2.1上得分85.4,SWE-bench Multilingual得分82.9,两项均为开源第一。发布当天,API排队用户即超过5000人,腾讯WorkBuddy随后对推理集群进行紧急扩容,并宣布将Hy3限免延长至2026年9月30日,以缓解高峰时段的排队压力。
Hy4 preview是腾讯基础模型部成立后推出的首款新模型,也是姚顺雨理念的集中体现。姚顺雨于今年7月统管合并后的基础模型部,首次打通了训练、数据、评估、推理的全链路。此前,腾讯的大语言模型部和多模态模型部分属不同体系,各自拥有独立的数据与技术框架,而合并后,姚顺雨得以将自进化机制贯穿模型研发的四个环节:训练方法、数据策略、评估体系和底层算子。
在技术层面,Hy4 preview的注意力模块采用DeepSeek的Gated机制与MTP层做投机解码,配以智谱的IndexCache实现跨层稀疏索引复用,残差通路则使用字节的iHC(identity Hyper-Connections)。尽管借鉴了多方技术,混元团队在技术报告中明确标注了每项技术的来源及修改方式,并强调Hy4 preview形成了独特风格。
姚顺雨的自进化理念与智谱、DeepSeek均有不同。智谱的自进化发生在训练阶段,通过“AI研究员”与“AI判卷员”流水线生成训练数据,提升模型智能;DeepSeek的自进化发生在运行阶段,通过DSH实现“一切皆插件”的自我修改。而腾讯Hy4 preview的自进化发生在研发流程本身,模型参与定义自己的训练方法、数据策略和评估体系,即“先定义自己是什么,再朝目标发展”。这种全链路自进化要求组织统一,而姚顺雨正是这一整合的关键推动者。
姚顺雨对工程化的重视在Hy4 preview中体现明显,混元是三家之中唯一将底层算子优化和推理吞吐量提升纳入自进化列表的团队。他入职后重建了基础设施,强调“把Infrastructure重建了,无论是预训练还是强化学习”。在算力紧张的背景下,姚顺雨通过Co-design方法论,边训边用,让产品反馈倒逼模型迭代,Hy3时期主要发生在模型与产品之间,而Hy4 preview则将范围扩大至整个研发流程。
姚顺雨是语言Agent研究的开创者之一,其代表作ReAct(2022年10月发布,ICLR 2023发表,引用超万次)已成为当前Agent工作的基础范式,Claude Code、Codex等底层循环均为其变体。另一代表作Tree of Thoughts(ToT)则通过多路径探索与评估增强推理深度。从Hy3到Hy4 preview,模型从“单路径执行”升级为“多路径探索+深度验证”,Hy4 preview在推理深度上明显加强,但官方也承认其复杂任务上可能思考时间过长、存在过度自我验证倾向。
训练数据方面,Hy4 preview强调与腾讯内部软件工程师、游戏开发者、金融分析师、安全专家共建数据,并结合CodeBuddy、WorkBuddy等真实产品共同设计,确保模型进步锚定在真实生产力上。这种“结果导向”与“过程导向”结合的数据策略,正是支撑ReAct与ToT循环的关键。
总体而言,Hy4 preview不仅是模型升级,更是姚顺雨从学术到工程的一次“转正”。它标志着腾讯混元在组织整合后,将姚顺雨的方法论完整物质化,其开源性能与自进化路线或将对开源大模型格局产生深远影响。