蚂蚁集团旗下百灵团队于Hugging Face发布了ArmorOCR-GGUF,这是其对抗性OCR框架ArmorOCR的GGUF量化版本,旨在通过更轻量的部署方式,强化模型在对抗性场景下的文字识别能力。该模型基于Qwen3-VL-8B-Instruct构建,采用两阶段框架,专注于接地对抗性OCR感知,并提供Q8_0和Q4_K_M两种量化级别,分别针对主模型和视觉投影器,方便用户通过llama.cpp进行本地服务部署。
ArmorOCR-GGUF的发布,使得原本依赖完整模型的计算资源需求得以降低,让更多开发者和企业能够在边缘设备或资源受限的环境中运行先进的OCR功能。模型支持中英文,采用Apache 2.0许可,同时遵循基座模型Qwen3-VL-8B-Instruct的使用政策。用户可以通过构建带CUDA支持的llama.cpp,并使用llama-server配合--mmproj参数来启动OpenAI兼容的本地服务器,进而通过API调用进行推理。
在AdvSpot基准上的评估显示,量化后的模型在多项对抗性OCR任务中保持了与原版相近的准确率。具体而言,Q8_0版本的平均准确率达到56.9%,略高于原版ArmorOCR的55.7%,而Q4_K_M版本的平均准确率为54.2%。在平均IoU(交并比)上,量化版本略有下降,Q8_0为58.6%,Q4_K_M为57.2%,原版为63.3%,这符合量化视觉编码器/投影器带来的精度损失预期。
从细分任务看,量化模型在部分类别上表现优于原版,例如在旋转文本(Q8_0达60.0%)、微小文本(Q8_0和Q4_K_M均达63.3%)、后处理(Q4_K_M达66.7%)以及AIGC融合(Q8_0达77.5%)等任务上均有提升。而在风格化文本、手写文本等类别上,量化模型略逊于原版,但整体差距不大。
ArmorOCR的提出,旨在应对真实世界中常见的对抗性OCR挑战,如旋转、镜像、微小文字、风格化字体、成像退化、低对比度、AIGC融合以及符号编码等。通过两阶段框架和观察转移自蒸馏技术,模型能够更准确地定位并识别图像中的文字。此次GGUF量化版本的发布,进一步推动了该技术的可及性,使得对抗性OCR能力能够更广泛地应用于文档解析、自动驾驶、内容审核等AI应用场景。
对于AI产业而言,这一发布体现了大模型生态中模型轻量化与高效部署的趋势。量化技术使得高性能视觉语言模型能够在更广泛的硬件上运行,降低了算力门槛,有助于加速AI应用在各行各业的落地。同时,这也反映了开源社区与产业界在推动AI技术普惠方面的持续努力。