9月1日中午,腾讯发布了其最新一代旗舰模型预览版本Hy4 preview的轻量版,将模型权重从1.5TB压缩至214GB,压缩幅度达86%。据腾讯混元团队的测试,压缩后的模型在长文理解、多轮长上下文检索等任务上与原始版基本处于同一水平,数学能力有小幅回落,但整体性能损失不大。该轻量版模型可覆盖日常编程辅助、工具调用、长文档处理和常规问答等场景,为开发者提供了更易部署的选项。

此前,腾讯于8月28日发布并开源了Hy4 preview。根据腾讯公开的基准测试结果,Hy4 preview在多个编程、智能体和科研基准测试中得分超过DeepSeek V4 Pro 0824等模型,排名位居开源模型第一梯队。此次轻量版的推出,进一步降低了该模型的使用门槛。

在技术实现上,腾讯混元团队采用了自研的Sherry稀疏三值量化算法和MIX-STQ1_0混合精度策略。Sherry算法将每四个权重为一组,量化为{-1、0、+1},并强制每组恰好一个为0,从而以平均1.25比特的精度表示权重,实际文件开销约1.31bpw。基于该算法,团队在llama.cpp中实现了STQ1_0推理内核,在比特数最低的同时,速度与IQ1_M基本持平,比IQ1_S更快。

MIX-STQ1_0混合精度策略则根据模型各层对压缩的敏感度逐层分配比特数:敏感层保留更高的精度(如IQ2_XXS,2.06bpw),不敏感层使用更强的压缩(STQ1_0,1.31bpw)。这种逐层分档的方式在不增加平均比特预算的前提下,降低了整体量化误差。最终,MIX-STQ1_0的路由专家权重不仅评测表现更好,还比社区主流的UD-IQ1_M方案少占用超过5GiB的存储空间。

此外,腾讯混元团队还验证了在异构设备上运行该轻量版模型的可能性。他们基于分布式集群推理框架prima.cpp,在一台配备4090显卡的笔记本和一台四卡A4000服务器上进行了测试。两端显存合计80GB、内存合计64GB,分处两个局域网,通过prima.cpp的异构调度将MoE层拆开分配,使计算和权重读取重叠,最终将214GB的模型协同运行至1.02 token/s的速度,比笔记本单机offload快了约6倍。这一结果意味着,开发者无需整套同构硬件,仅用手边现有的异构设备拼接,也能跑通旗舰大模型。

长期以来,MoE(混合专家)模型凭借专家混合架构获得更强能力,但庞大的权重带来了较高的显存门槛,许多高性能开源模型只能运行在高端集群上,普通开发者与中小企业难以本地部署。腾讯混元此次针对MoE模型专家层参数分布特点进行定制化压缩,不再简单地对全模型统一降比特,而是按各层敏感度差异化分配精度,将模型压缩带来的性能损耗降到最低。这一思路或为超大MoE模型的轻量化落地提供了新的参考路径,有望推动更多开发者将高性能模型应用于实际业务中。