腾讯混元团队在Hugging Face平台正式开源了HiLS-Attention-7B模型。该模型的核心创新在于其采用的HiLS-Attention(分层稀疏注意力)机制,这是一种分块稀疏注意力方法,能够在大语言模型训练损失下端到端地学习如何选择重要的文本块,从而实现原生的稀疏训练,为高效长上下文建模提供了新思路。
HiLS-Attention-7B基于Allen AI的OLMo3-7B架构,参数量约7B。与传统的块稀疏注意力需要计算所有查询-键(QK)得分来选取top-k块不同,HiLS-Attention通过使用压缩后的块键来估算块重要性,并将注意力分解为块间和块内两个softmax步骤,从而避免了全量QK计算,大幅降低了计算开销。
根据模型发布信息,该模型仅经过50B token的继续训练,就继承了全注意力的能力,并带来了两个关键优势:一是强大的超长上下文外推能力,能够超越通过YaRN方法扩展的4倍长度限制;二是长序列下的推理速度更快。同时,在原始训练长度和YaRN外推范围内,它在短文本和中文本任务上保持了与全注意力相当的性能。
在评估方面,HiLS-Attention-7B在多个基准上进行了测试,包括用于长上下文问答的LongBench v1(支持高达64K输入)、用于合成探测的RULER(在8K/16K/32K/128K长度下测试),以及涵盖MMLU、GPQA、GSM8K等11个基准的OpenCompass短上下文评测。训练方法为在OLMo3-7B骨干网络上进行原生稀疏注意力(HiLS-Attention)的继续预训练,位置编码采用HoPE并结合YaRN进行长度外推。
需要注意的是,该模型是一个预训练基座模型,未经过指令微调或安全对齐,输出可能存在不准确或偏见,不适合直接用于安全关键场景。用户需评估其适用性。腾讯混元已在GitHub上开源了相关代码和评估脚本,并计划未来支持SGLang推理后端,以进一步提升长上下文服务的效率。这一开源动作,为AI社区在长文本建模和高效注意力机制的研究上提供了宝贵的实践资源。