騰訊近日在 Hugging Face 上釋出了新一代視覺文件檢索模型 EVIE-4.5B,並同步開源全部權重、訓練流程、令牌壓縮演算法(HAC)及評測套件。該模型基於 Qwen3.5-4B 構建,引數規模約 4.61B,在視覺文件檢索基準 ViDoRe V3 上取得 66.02 的 nDCG@10 分數,僅次於同系列旗艦模型 EVIE-8B(66.75),在同類輕量級模型中表現領先。

EVIE 採用晚期互動(late-interaction)多向量檢索範式,與傳統的稠密單向量檢索不同,它通過令牌級表示保留高解析度文件頁面中的細節資訊,如複雜表格、佈局結構、圖表和小字號文字,並使用 MaxSim 匹配計算查詢與文件的相關性。這種設計使得模型在處理視覺資訊密集的文件時更具優勢。

EVIE-4.5B 的一大技術亮點是引入了單投影 Prefix-MRL(彈性多向量表示)。模型使用一個 2048 維的線性投影頭,在推理時無需維護多個模型即可將向量維度自由截斷至 64、128、256、512、1024 或 2048 維。根據官方資料,即使在 64 維的低維字首下,模型在 ViDoRe V3 上仍能保持 64.51 的分數,而完整 2048 維時為 66.02,顯示了良好的彈性與效能權衡。

在模型壓縮方面,EVIE 集成了 HAC(層次凝聚聚類)令牌壓縮演算法,這是一種無需訓練的即插即用方法,可在聯合特徵-空間域將視覺補丁令牌聚合為 32 或 64 個語義質心。原始晚期互動表示每頁約保留 750 個視覺補丁向量,儲存開銷較大;應用 HAC 後,每頁僅需 32 個向量,將索引儲存壓縮至每百萬頁 3.81 GiB,大幅降低了大規模文件檢索的儲存成本。

EVIE-4.5B 通過 ARD(錨點保持、容量感知的關係蒸餾)從 8B 引數的教師模型 EVIE-8B 蒸餾而來。該蒸餾方法結合令牌關係拓撲幾何、難負樣本邊界校準和錨點保持對齊,使得學生模型即使在低維字首下也能保持較高的檢索精度。官方在 ViDoRe V1、V2、V3 及 JinaVDR 等基準上進行了全面評估,覆蓋 138 個多語言任務,涉及 nDCG、Recall、MAP、MRR 等指標族。

在 ViDoRe 排行榜上,EVIE-4.5B 以 66.02 的 V3 分數位列第二,僅次於 EVIE-8B(66.75),並超越了多個 8B 級模型,如 webAI-ColVec1.1-8b(65.32)和 nemotron-colembed-vl-8b-v2(63.54)。從細分領域看,EVIE-4.5B 在電腦科學(81.72)、能源(72.32)等領域表現突出,但在物理(51.69)等專業領域仍有提升空間。

騰訊此次將 EVIE 系列完全開源,包括模型權重、訓練流程、HAC 演算法和評測套件,技術細節和正式研究論文將在後續更新中釋出。這一舉措為視覺文件檢索領域提供了新的開源選擇,尤其適合需要處理複雜文件的檢索增強生成(RAG)應用場景,可能對 AI 基礎設施層中的文件理解與檢索環節產生積極影響。