8月28日,腾讯混元发布并开源了新一代大模型Hy4 preview,这是自今年2月腾讯重建预训练与强化学习基建以来,混元系列在约127天内推出的又一重要版本。Hy4 preview总参数达到770B,是上一代Hy3的2.6倍;激活参数从21B提升至49B,上下文长度从256K扩展到1M。在多项基准测试中,Hy4 preview表现亮眼:软件工程实战基准DeepSWE上得分64.3,超过DeepSeek V4 Pro的62.7;Terminal-Bench 2.1上得分85.4,与Claude Opus 5持平。相比之下,7月初发布的Hy3在DeepSWE上仅得28.0分,而同期Claude Opus 4.8为58.0。混元团队表示,Hy4 preview的发布旨在通过尽快获得广泛真实反馈,以显著提升正式版质量。
混元的迭代速度显著加快,大版本周期已压缩至约两个月,接近Anthropic、OpenAI、智谱等头部厂商的更新频率。值得注意的是,腾讯是在重建地基的同时实现这一速度的。自Hy3 preview以来,混元在多项主流benchmark上均呈现显著上升曲线,尤其在长上下文任务、代码库重构、专业科学推理等接近真实生产力的领域,追赶势头明显。
混元的加速逻辑核心在于“实战驱动”。Hy4 preview发布当天,腾讯同步开启WorkBuddy和CodeBuddy两周免费体验,延续了Hy3 preview的“preview-first”策略。这一机制借鉴了OpenAI的“迭代式部署”理念:让模型在真实世界中受控使用,再根据反馈修正。混元团队将Hy3 preview视为“从读万卷书到行万里路的开端”,其正式版在50多个业务中获得广泛反馈,幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮对话问题率从17.4%降至7.9%。
实战反馈如何转化为模型能力?混元团队强调,Hy4 preview的能力提升来自与腾讯内部软件工程、游戏、金融、安全等领域专家的高质量数据共建。这体现了“Co-Design”方法:用户提供问题分布,专家提供质量标准,产品提供任务环境,模型团队将三者整合进后训练和评测体系。混元内部建立了50多套评测,不再将外部排名作为唯一标准。
腾讯的Agent产品矩阵成为混元的“训练场”。WorkBuddy界面集成了混元、DeepSeek、GLM、Kimi、MiniMax等多款模型,用户可自由切换,这为混元提供了直接的对照反馈。自Hy3正式版上线WorkBuddy以来,主动选择Hy3 preview的用户数量增长了6倍;接入正式版后,WorkBuddy内部测评的任务成功率从72%提升至90%,平均耗时缩短34%。混元已接入腾讯内部百余个业务场景,包括元宝、CodeBuddy、ima、腾讯会议等,不同产品提供多样化的任务环境,使模型习得的能力可迁移。
Hy4 preview更进一步,将实战闭环搬进模型研发内部。它首次参与优化自己的推理系统,通过分析瓶颈、提出算子融合和通信优化方案,使端到端吞吐相对基线提升31.8%。在一个小模型后训练任务中,Hy4 preview作为researcher协调多个Codex Session,8项评测全部优于Codex独立探索。这标志着行业正从“AI for Coding”走向“AI for AI”,模型开始参与改进承载自己的基础设施。
回顾这127天,混元的加速度并非仅靠更大规模的预训练,而是通过“发布-实战-反馈-再训练”的闭环,将产品、用户、专家和模型组织进同一条反馈链。腾讯的意义在于,它开始将模型、Agent产品、真实任务、数据反馈和推理基建整合为一个持续运转的系统。大模型竞争正从算力、参数和文本数据转向另一组能力:谁能找到真正有价值的问题,构造足够真实的环境,并让反馈链转得更快。模型仍然重要,但决定下一次迭代速度的,还有围绕模型运转的整个系统。