螞蟻集團旗下百靈團隊於Hugging Face釋出了ArmorOCR-GGUF,這是其對抗性OCR框架ArmorOCR的GGUF量化版本,旨在通過更輕量的部署方式,強化模型在對抗性場景下的文字識別能力。該模型基於Qwen3-VL-8B-Instruct構建,採用兩階段框架,專注於接地對抗性OCR感知,並提供Q8_0和Q4_K_M兩種量化級別,分別針對主模型和視覺投影器,方便使用者通過llama.cpp進行本地服務部署。
ArmorOCR-GGUF的釋出,使得原本依賴完整模型的計算資源需求得以降低,讓更多開發者和企業能夠在邊緣裝置或資源受限的環境中執行先進的OCR功能。模型支援中英文,採用Apache 2.0許可,同時遵循基座模型Qwen3-VL-8B-Instruct的使用政策。使用者可以通過構建帶CUDA支援的llama.cpp,並使用llama-server配合--mmproj引數來啟動OpenAI相容的本地伺服器,進而通過API呼叫進行推理。
在AdvSpot基準上的評估顯示,量化後的模型在多項對抗性OCR任務中保持了與原版相近的準確率。具體而言,Q8_0版本的平均準確率達到56.9%,略高於原版ArmorOCR的55.7%,而Q4_K_M版本的平均準確率為54.2%。在平均IoU(交併比)上,量化版本略有下降,Q8_0為58.6%,Q4_K_M為57.2%,原版為63.3%,這符合量化視覺編碼器/投影器帶來的精度損失預期。
從細分任務看,量化模型在部分類別上表現優於原版,例如在旋轉文本(Q8_0達60.0%)、微小文本(Q8_0和Q4_K_M均達63.3%)、後處理(Q4_K_M達66.7%)以及AIGC融合(Q8_0達77.5%)等任務上均有提升。而在風格化文本、手寫文本等類別上,量化模型略遜於原版,但整體差距不大。
ArmorOCR的提出,旨在應對真實世界中常見的對抗性OCR挑戰,如旋轉、映象、微小文字、風格化字型、成像退化、低對比度、AIGC融合以及符號編碼等。通過兩階段框架和觀察轉移自蒸餾技術,模型能夠更準確地定位並識別影像中的文字。此次GGUF量化版本的釋出,進一步推動了該技術的可及性,使得對抗性OCR能力能夠更廣泛地應用於文件解析、自動駕駛、內容稽核等AI應用場景。
對於AI產業而言,這一發布體現了大模型生態中模型輕量化與高效部署的趨勢。量化技術使得高效能視覺語言模型能夠在更廣泛的硬體上執行,降低了算力門檻,有助於加速AI應用在各行各業的落地。同時,這也反映了開源社群與產業界在推動AI技術普惠方面的持續努力。