腾讯近日在 Hugging Face 上发布了新一代视觉文档检索模型 EVIE-4.5B,并同步开源全部权重、训练流程、令牌压缩算法(HAC)及评测套件。该模型基于 Qwen3.5-4B 构建,参数规模约 4.61B,在视觉文档检索基准 ViDoRe V3 上取得 66.02 的 nDCG@10 分数,仅次于同系列旗舰模型 EVIE-8B(66.75),在同类轻量级模型中表现领先。
EVIE 采用晚期交互(late-interaction)多向量检索范式,与传统的稠密单向量检索不同,它通过令牌级表示保留高分辨率文档页面中的细节信息,如复杂表格、布局结构、图表和小字号文字,并使用 MaxSim 匹配计算查询与文档的相关性。这种设计使得模型在处理视觉信息密集的文档时更具优势。
EVIE-4.5B 的一大技术亮点是引入了单投影 Prefix-MRL(弹性多向量表示)。模型使用一个 2048 维的线性投影头,在推理时无需维护多个模型即可将向量维度自由截断至 64、128、256、512、1024 或 2048 维。根据官方数据,即使在 64 维的低维前缀下,模型在 ViDoRe V3 上仍能保持 64.51 的分数,而完整 2048 维时为 66.02,显示了良好的弹性与性能权衡。
在模型压缩方面,EVIE 集成了 HAC(层次凝聚聚类)令牌压缩算法,这是一种无需训练的即插即用方法,可在联合特征-空间域将视觉补丁令牌聚合为 32 或 64 个语义质心。原始晚期交互表示每页约保留 750 个视觉补丁向量,存储开销较大;应用 HAC 后,每页仅需 32 个向量,将索引存储压缩至每百万页 3.81 GiB,大幅降低了大规模文档检索的存储成本。
EVIE-4.5B 通过 ARD(锚点保持、容量感知的关系蒸馏)从 8B 参数的教师模型 EVIE-8B 蒸馏而来。该蒸馏方法结合令牌关系拓扑几何、难负样本边界校准和锚点保持对齐,使得学生模型即使在低维前缀下也能保持较高的检索精度。官方在 ViDoRe V1、V2、V3 及 JinaVDR 等基准上进行了全面评估,覆盖 138 个多语言任务,涉及 nDCG、Recall、MAP、MRR 等指标族。
在 ViDoRe 排行榜上,EVIE-4.5B 以 66.02 的 V3 分数位列第二,仅次于 EVIE-8B(66.75),并超越了多个 8B 级模型,如 webAI-ColVec1.1-8b(65.32)和 nemotron-colembed-vl-8b-v2(63.54)。从细分领域看,EVIE-4.5B 在计算机科学(81.72)、能源(72.32)等领域表现突出,但在物理(51.69)等专业领域仍有提升空间。
腾讯此次将 EVIE 系列完全开源,包括模型权重、训练流程、HAC 算法和评测套件,技术细节和正式研究论文将在后续更新中发布。这一举措为视觉文档检索领域提供了新的开源选择,尤其适合需要处理复杂文档的检索增强生成(RAG)应用场景,可能对 AI 基础设施层中的文档理解与检索环节产生积极影响。