腾讯近日在Hugging Face上发布了EVIE-Preview-4.5B,这是一款面向多语言视觉文档检索(VDR)的高性能模型,基于Qwen3.5-4B构建,采用ColBERT风格的后期交互机制,并原生支持128维token嵌入,参数量为4.54B(BF16精度)。该模型在多个基准测试中表现突出,尤其在ViDoRe V3上平均nDCG@10达到64.40,在8个公共领域中的7个领域领先,超越了包括nemotron-colembed-vl-8b-v2在内的更大规模模型。
EVIE-Preview-4.5B的核心创新在于其超紧凑的128维索引。与当前主流多向量模型动辄使用2560D至4096D的高维表示不同,EVIE通过原生128维多向量表示,大幅降低了下游存储和索引延迟,同时保持了检索精度。这一设计使其在存储效率和检索性能之间取得了更好的平衡,对于处理大规模文档库的企业级应用尤为重要。
在ViDoRe V1+V2基准上,EVIE-Preview-4.5B的平均nDCG@5达到85.9,在14个任务中表现优异,尤其在SynAI(100.0)、SynEnergy(99.0)和SynGov(98.9)等合成数据集上接近满分。相比之下,Ops-Colqwen3-4B的平均分为84.9,而nemotron-colembed-vl-8b-v2为84.8,显示EVIE在同等或更小参数量下具备竞争力。
该模型还展现了强大的多语言与多格式泛化能力。在ViDoRe V3的评估中,查询覆盖了英语、法语、德语、意大利语、葡萄牙语和西班牙语六种语言,EVIE在金融(法语)等跨语言场景中表现稳定,同时能处理图表、表格、科学报告和财务文件等多种视觉格式。这种零样本泛化能力使其在全球化部署中具有实际价值。
EVIE-Preview-4.5B的另一个亮点是即插即用的集成性。它无缝兼容colpali-engine生态系统和标准的后期交互评分流程,开发者可以轻松将其嵌入现有检索管道。模型提供了完整的快速入门指南、推理脚本和复现工具,包括自动下载22个ViDoRe数据集(约55GB)的脚本,降低了使用门槛。
从产业角度看,EVIE的发布反映了视觉文档检索领域向高效嵌入发展的趋势。传统高维嵌入虽然精度高,但存储和计算成本高昂,而EVIE通过压缩嵌入维度,在不牺牲精度的前提下提升了效率,这对于需要处理海量文档的金融、医疗、法律等行业尤为关键。腾讯选择基于Qwen3.5-4B构建,也体现了开源模型生态的协同效应。
值得注意的是,EVIE-Preview-4.5B目前是预览版本,官方表示下一代EVIE迭代即将发布。这意味着当前版本可能仍存在优化空间,但已足以展示腾讯在多模态检索领域的技术积累。对于AI基础设施层的参与者而言,这类高效检索模型有望降低RAG(检索增强生成)系统的部署成本,并推动更广泛的应用落地。