9月1日中午,騰訊釋出了其最新一代旗艦模型預覽版本Hy4 preview的輕量版,將模型權重從1.5TB壓縮至214GB,壓縮幅度達86%。據騰訊混元團隊的測試,壓縮後的模型在長文理解、多輪長上下文檢索等任務上與原始版基本處於同一水平,數學能力有小幅回落,但整體效能損失不大。該輕量版模型可覆蓋日常程式設計輔助、工具呼叫、長文件處理和常規問答等場景,為開發者提供了更易部署的選項。
此前,騰訊於8月28日釋出並開源了Hy4 preview。根據騰訊公開的基準測試結果,Hy4 preview在多個程式設計、智慧體和科研基準測試中得分超過DeepSeek V4 Pro 0824等模型,排名位居開源模型第一梯隊。此次輕量版的推出,進一步降低了該模型的使用門檻。
在技術實現上,騰訊混元團隊採用了自研的Sherry稀疏三值量化演算法和MIX-STQ1_0混合精度策略。Sherry演算法將每四個權重為一組,量化為{-1、0、+1},並強制每組恰好一個為0,從而以平均1.25位元的精度表示權重,實際檔案開銷約1.31bpw。基於該演算法,團隊在llama.cpp中實現了STQ1_0推理核心,在位元數最低的同時,速度與IQ1_M基本持平,比IQ1_S更快。
MIX-STQ1_0混合精度策略則根據模型各層對壓縮的敏感度逐層分配位元數:敏感層保留更高的精度(如IQ2_XXS,2.06bpw),不敏感層使用更強的壓縮(STQ1_0,1.31bpw)。這種逐層分檔的方式在不增加平均位元預算的前提下,降低了整體量化誤差。最終,MIX-STQ1_0的路由專家權重不僅評測表現更好,還比社群主流的UD-IQ1_M方案少佔用超過5GiB的儲存空間。
此外,騰訊混元團隊還驗證了在異構裝置上執行該輕量版模型的可能性。他們基於分散式叢集推理框架prima.cpp,在一台配備4090顯示卡的筆記本和一台四卡A4000伺服器上進行了測試。兩端視訊記憶體合計80GB、記憶體合計64GB,分處兩個區域網,通過prima.cpp的異構排程將MoE層拆開分配,使計算和權重讀取重疊,最終將214GB的模型協同執行至1.02 token/s的速度,比筆記本單機offload快了約6倍。這一結果意味著,開發者無需整套同構硬體,僅用手邊現有的異構裝置拼接,也能跑通旗艦大模型。
長期以來,MoE(混合專家)模型憑藉專家混合架構獲得更強能力,但龐大的權重帶來了較高的視訊記憶體門檻,許多高效能開源模型只能執行在高階叢集上,普通開發者與中小企業難以本地部署。騰訊混元此次針對MoE模型專家層引數分佈特點進行定製化壓縮,不再簡單地對全模型統一降位元,而是按各層敏感度差異化分配精度,將模型壓縮帶來的效能損耗降到最低。這一思路或為超大MoE模型的輕量化落地提供了新的參考路徑,有望推動更多開發者將高效能模型應用於實際業務中。