智谱(zai-org)在 Hugging Face 上线了多模态 OCR 模型 GLM-OCR,定位为面向复杂文档理解的光学字符识别模型,模型卡标注参数量为 1B 级别、采用 MIT 许可,并同步提供技术报告、SDK 与 API 入口。
从架构看,GLM-OCR 建立在 GLM-V 编码器—解码器框架之上,训练环节引入 多 Token 预测(MTP)损失与稳定的全任务强化学习,官方称其目标是同时提升训练效率、识别准确率与泛化能力。模型内部由三部分组成:在大规模图文数据上预训练的 CogViT 视觉编码器、带高效 token 下采样的轻量跨模态连接器,以及 GLM-0.5B 语言解码器。在文档解析流程上,它采用基于 PP-DocLayout-V3 的两阶段流水线——先做版面分析、再并行识别,以适配多样化的文档版式。
性能方面,模型卡给出的核心数字是:在 OmniDocBench V1.5 上取得 94.62 分、总榜排名第一,并在公式识别、表格识别、信息抽取等主要文档理解基准上达到领先水平。官方强调该模型针对真实业务场景做了优化,在复杂表格、代码密集文档、印章等难度较高的版式上保持稳健表现。
效率是这条发布里另一个值得关注的维度。GLM-OCR 的推理参数量为 0.9B,支持通过 vLLM、SGLang、Ollama 部署,官方称可显著降低推理延迟与算力成本,适合高并发服务与边缘部署。在单副本、单并发的相同硬件与测试条件下,官方对比了不同 OCR 方法的解析与 Markdown 导出速度,结果显示 GLM-OCR 对 PDF 文档的吞吐为 1.86 页/秒、对图片为 0.67 张/秒,明显优于同类模型。
使用方式上,官方对文档解析任务推荐使用其 SDK:相比纯模型推理,SDK 集成了 PP-DocLayoutV3,提供从版面分析到结构化输出的完整流水线,可减少搭建端到端文档智能系统的工程开销;不过 SDK 目前仅面向文档解析,信息抽取任务需直接调用模型。模型当前支持两类提示场景:文档解析(文本识别、公式识别、表格识别)与信息抽取,后者要求输出严格遵循给定的 JSON schema,以保证下游处理兼容。
许可与生态方面,GLM-OCR 模型本体以 MIT 许可发布,而完整 OCR 流水线集成的 PP-DocLayoutV3 采用 Apache 2.0 许可,使用者需同时遵守两项许可。项目致谢中列出了 PP-DocLayout-V3、PaddleOCR、MinerU 等开源工作。
把这条发布放到产业视角看,文档理解长期是 OCR 落地最分散、也最依赖工程拼装的环节:版面分析、表格还原、公式识别往往由不同模型或规则模块拼接,部署成本高。GLM-OCR 的思路是把视觉编码、跨模态对齐与语言解码压缩进不到 1B 参数的模型,再用开源 SDK 把版面分析与结构化输出打包,等于把「模型能力」和「工程流水线」一起交付。对关注 AI 产业的读者而言,这类小参数、高吞吐、可本地部署的模型,影响的不只是 OCR 工具链本身,也会牵动文档密集型行业(金融、法律、政务、医疗等)的自动化改造节奏,以及边缘与高并发场景下对算力配置的选择。
需要说明的是,上述基准得分与吞吐数字均来自官方模型卡与技术报告,属于发布方自述口径,实际表现仍取决于具体文档类型、硬件环境与提示设计。