騰訊混元團隊在Hugging Face平台正式開源了HiLS-Attention-7B模型。該模型的核心創新在於其採用的HiLS-Attention(分層稀疏注意力)機制,這是一種分塊稀疏注意力方法,能夠在大語言模型訓練損失下端到端地學習如何選擇重要的文本塊,從而實現原生的稀疏訓練,為高效長上下文建模提供了新思路。
HiLS-Attention-7B基於Allen AI的OLMo3-7B架構,引數量約7B。與傳統的塊稀疏注意力需要計算所有查詢-鍵(QK)得分來選取top-k塊不同,HiLS-Attention通過使用壓縮後的塊鍵來估算塊重要性,並將注意力分解為塊間和塊內兩個softmax步驟,從而避免了全量QK計算,大幅降低了計算開銷。
根據模型釋出資訊,該模型僅經過50B token的繼續訓練,就繼承了全注意力的能力,並帶來了兩個關鍵優勢:一是強大的超長上下文外推能力,能夠超越通過YaRN方法擴充套件的4倍長度限制;二是長序列下的推理速度更快。同時,在原始訓練長度和YaRN外推範圍內,它在短文本和中文本任務上保持了與全注意力相當的效能。
在評估方面,HiLS-Attention-7B在多個基準上進行了測試,包括用於長上下文問答的LongBench v1(支援高達64K輸入)、用於合成探測的RULER(在8K/16K/32K/128K長度下測試),以及涵蓋MMLU、GPQA、GSM8K等11個基準的OpenCompass短上下文評測。訓練方法為在OLMo3-7B骨幹網路上進行原生稀疏注意力(HiLS-Attention)的繼續預訓練,位置編碼採用HoPE並結合YaRN進行長度外推。
需要注意的是,該模型是一個預訓練基座模型,未經過指令微調或安全對齊,輸出可能存在不準確或偏見,不適合直接用於安全關鍵場景。使用者需評估其適用性。騰訊混元已在GitHub上開源了相關程式碼和評估指令碼,並計劃未來支援SGLang推理後端,以進一步提升長上下文服務的效率。這一開源動作,為AI社群在長文本建模和高效注意力機制的研究上提供了寶貴的實踐資源。