騰訊近日在Hugging Face上釋出了EVIE-Preview-4.5B,這是一款面向多語言視覺文件檢索(VDR)的高效能模型,基於Qwen3.5-4B構建,採用ColBERT風格的後期互動機制,並原生支援128維token嵌入,引數量為4.54B(BF16精度)。該模型在多個基準測試中表現突出,尤其在ViDoRe V3上平均nDCG@10達到64.40,在8個公共領域中的7個領域領先,超越了包括nemotron-colembed-vl-8b-v2在內的更大規模模型。

EVIE-Preview-4.5B的核心創新在於其超緊湊的128維索引。與當前主流多向量模型動輒使用2560D至4096D的高維表示不同,EVIE通過原生128維多向量表示,大幅降低了下游儲存和索引延遲,同時保持了檢索精度。這一設計使其在儲存效率和檢索效能之間取得了更好的平衡,對於處理大規模文件庫的企業級應用尤為重要。

在ViDoRe V1+V2基準上,EVIE-Preview-4.5B的平均nDCG@5達到85.9,在14個任務中表現優異,尤其在SynAI(100.0)、SynEnergy(99.0)和SynGov(98.9)等合成數據集上接近滿分。相比之下,Ops-Colqwen3-4B的平均分為84.9,而nemotron-colembed-vl-8b-v2為84.8,顯示EVIE在同等或更小引數量下具備競爭力。

該模型還展現了強大的多語言與多格式泛化能力。在ViDoRe V3的評估中,查詢覆蓋了英語、法語、德語、義大利語、葡萄牙語和西班牙語六種語言,EVIE在金融(法語)等跨語言場景中表現穩定,同時能處理圖表、表格、科學報告和財務檔案等多種視覺格式。這種零樣本泛化能力使其在全球化部署中具有實際價值。

EVIE-Preview-4.5B的另一個亮點是即插即用的整合性。它無縫相容colpali-engine生態系統和標準的後期互動評分流程,開發者可以輕鬆將其嵌入現有檢索管道。模型提供了完整的快速入門指南、推理指令碼和復現工具,包括自動下載22個ViDoRe資料集(約55GB)的指令碼,降低了使用門檻。

從產業角度看,EVIE的釋出反映了視覺文件檢索領域向高效嵌入發展的趨勢。傳統高維嵌入雖然精度高,但儲存和計算成本高昂,而EVIE通過壓縮嵌入維度,在不犧牲精度的前提下提升了效率,這對於需要處理海量文件的金融、醫療、法律等行業尤為關鍵。騰訊選擇基於Qwen3.5-4B構建,也體現了開源模型生態的協同效應。

值得注意的是,EVIE-Preview-4.5B目前是預覽版本,官方表示下一代EVIE迭代即將釋出。這意味著當前版本可能仍存在最佳化空間,但已足以展示騰訊在多模態檢索領域的技術積累。對於AI基礎設施層的參與者而言,這類高效檢索模型有望降低RAG(檢索增強生成)系統的部署成本,並推動更廣泛的應用落地。