智譜(zai-org)在 Hugging Face 上線了多模態 OCR 模型 GLM-OCR,定位為面向複雜文件理解的光學字元識別模型,模型卡標註引數量為 1B 級別、採用 MIT 許可,並同步提供技術報告、SDK 與 API 入口。
從架構看,GLM-OCR 建立在 GLM-V 編碼器—解碼器框架之上,訓練環節引入 多 Token 預測(MTP)損失與穩定的全任務強化學習,官方稱其目標是同時提升訓練效率、識別準確率與泛化能力。模型內部由三部分組成:在大規模圖文資料上預訓練的 CogViT 視覺編碼器、帶高效 token 下采樣的輕量跨模態聯結器,以及 GLM-0.5B 語言解碼器。在文件解析流程上,它採用基於 PP-DocLayout-V3 的兩階段流水線——先做版面分析、再並行識別,以適配多樣化的文件版式。
效能方面,模型卡給出的核心數字是:在 OmniDocBench V1.5 上取得 94.62 分、總榜排名第一,並在公式識別、表格識別、資訊抽取等主要文件理解基準上達到領先水平。官方強調該模型針對真實業務場景做了最佳化,在複雜表格、程式碼密集文件、印章等難度較高的版式上保持穩健表現。
效率是這條釋出裡另一個值得關注的維度。GLM-OCR 的推理引數量為 0.9B,支援通過 vLLM、SGLang、Ollama 部署,官方稱可顯著降低推理延遲與算力成本,適合高併發服務與邊緣部署。在單副本、單併發的相同硬體與測試條件下,官方對比了不同 OCR 方法的解析與 Markdown 匯出速度,結果顯示 GLM-OCR 對 PDF 文件的吞吐為 1.86 頁/秒、對圖片為 0.67 張/秒,明顯優於同類模型。
使用方式上,官方對文件解析任務推薦使用其 SDK:相比純模型推理,SDK 集成了 PP-DocLayoutV3,提供從版面分析到結構化輸出的完整流水線,可減少搭建端到端文件智慧系統的工程開銷;不過 SDK 目前僅面向文件解析,資訊抽取任務需直接呼叫模型。模型當前支援兩類提示場景:文件解析(文本識別、公式識別、表格識別)與資訊抽取,後者要求輸出嚴格遵循給定的 JSON schema,以保證下游處理相容。
許可與生態方面,GLM-OCR 模型本體以 MIT 許可釋出,而完整 OCR 流水線整合的 PP-DocLayoutV3 採用 Apache 2.0 許可,使用者需同時遵守兩項許可。專案致謝中列出了 PP-DocLayout-V3、PaddleOCR、MinerU 等開源工作。
把這條釋出放到產業視角看,文件理解長期是 OCR 落地最分散、也最依賴工程拼裝的環節:版面分析、表格還原、公式識別往往由不同模型或規則模組拼接,部署成本高。GLM-OCR 的思路是把視覺編碼、跨模態對齊與語言解碼壓縮排不到 1B 引數的模型,再用開源 SDK 把版面分析與結構化輸出打包,等於把「模型能力」和「工程流水線」一起交付。對關注 AI 產業的讀者而言,這類小引數、高吞吐、可本地部署的模型,影響的不只是 OCR 工具鏈本身,也會牽動文件密集型行業(金融、法律、政務、醫療等)的自動化改造節奏,以及邊緣與高併發場景下對算力配置的選擇。
需要說明的是,上述基準得分與吞吐數字均來自官方模型卡與技術報告,屬於釋出方自述口徑,實際表現仍取決於具體文件型別、硬體環境與提示設計。