7月27日晚,月之暗面正式開源 Kimi K3 完整模型權重,釋出後幾十分鐘內迅速登頂國際開源AI模型社群 Hugging Face 總趨勢榜第一。緊隨其後的是此前多日位列榜首的 百度 開源模型 Unlimited OCR,兩者包攬了Hugging Face榜單前二,被開發者社群稱為中國模型的“開源雙子星”。
Unlimited OCR 的表現更為罕見。該模型首發即登頂 GitHub Daily Trending 總榜和Python榜,同時在Hugging Face實現全球模型總趨勢榜和多模態模型趨勢榜四榜第一。釋出一個月後,其熱度再次攀升,獲得圖靈獎得主、AI科學家楊立昆轉發,一舉重回Hugging Face全球模型總趨勢榜第一。截至目前,Unlimited OCR 在 GitHub Star 已突破 1.97萬,Hugging Face 下載量達到 265萬。
Unlimited OCR 受到開發者持續關注,核心在於它解決了長文件解析領域長期存在的技術痛點。過去,OCR模型面對書籍、論文、報告等長文件時,通常需要採用“逐頁解析+結果拼接”的工程方案。隨著輸出內容增長,解碼階段的 KV Cache 持續膨脹,導致推理速度和視訊記憶體成本隨之增加。
針對這一行業難題,百度提出了 Reference Sliding Window Attention(R-SWA) 機制。該機制借鑑人類閱讀和抄錄長文件時的工作方式——始終保持對原始文件內容的關注,同時僅保留最近一段生成內容作為“工作記憶”,而非無限累積全部歷史資訊。基於這一設計,模型能夠在一次前向推理中連續完成數十頁文件解析,實現從第一頁到最後一頁的連貫輸出,同時將解碼階段的 KV Cache 控制在恆定規模,使計算成本和視訊記憶體佔用不隨輸出長度持續增長。
業內人士指出,這一突破不僅讓OCR解析更快、更準,更重要的是為大模型長程推理和記憶管理提供了新思路。相較於依賴不斷擴充套件上下文視窗來提升能力,R-SWA機制探索了以更高效的注意力機制實現長期任務處理的新路徑。
在開源社群,專案釋出初期登上趨勢榜並不罕見,但在熱度回落後,僅憑開發者持續使用與口碑傳播再次上榜的案例並不多見。此前,DeepSeek-R1 曾在模型釋出、API開放等多個節點多次進入趨勢榜;而 Unlimited OCR 僅憑全球開發者持續下載、部署、使用和推薦,時隔一個月再次登頂 Hugging Face 全球模型總趨勢榜。這表明,Unlimited OCR 的影響力已從釋出熱度延伸至持續的開發者採用和社群傳播,也折射出中國AI開源正從“釋出即關注”邁向“持續被採用”,國際影響力進一步沉澱為全球開發者生態影響力。
百度在開源領域的佈局由來已久。除了模型,百度此前已將 PaddlePaddle 深度學習框架、Apollo 自動駕駛平台等AI基礎設施底座開源,並將 ECharts、bRPC、Doris、HugeGraph 等成熟通用工程專案捐給國際開源基金會 Apache,積極融入全球開源體系。
近年來,中國人工智慧企業圍繞推理、多模態、長文本、文件智慧等關鍵方向持續實現原創突破,逐步形成多點開花、協同創新的發展格局。從 DeepSeek、Kimi,再到百度 Unlimited OCR,中國AI輸出的不僅是具有國際競爭力的模型,更是不斷貢獻原創技術、開源生態和創新範式。