面壁智慧(OpenBMB)於 5 月 17 日在 Hugging Face 平台釋出了 MiniCPM-V 4.6 Thinking 的 AWQ 量化版本(模型 ID:openbmb/MiniCPM-V-4.6-Thinking-AWQ)。該模型採用 W4A16 量化方案(基於 AutoAWQ 工具),引數規模約 1B,並沿用 Apache 2.0 開源許可,開發者可自由用於商業與研究。
MiniCPM-V 4.6 Thinking 是 MiniCPM-V 4.6 的長思維鏈推理變體,在生成最終答案前會先輸出顯式的推理過程,從而在複雜多模態推理、數學和 OCR 密集型任務上顯著提升表現。其架構保持端側友好:採用 SigLIP2-400M 視覺編碼器 與 Qwen3.5-0.8B 語言模型 的組合,並支援 4x/16x 混合視覺 token 壓縮,在保持效率的同時兼顧細節。
此次釋出的 AWQ 量化版進一步壓縮了模型體積,使其更適合在手機等資源受限的裝置上執行。據模型卡介紹,MiniCPM-V 4.6 可部署於 iOS、Android 和鴻蒙(HarmonyOS) 三大主流端側平台,官方展示了在 iPhone 17 Pro Max、Redmi K70 和華為 nova 14 上的實機執行錄屏,涵蓋影像與影片理解場景。
在推理方面,模型支援通過 Transformers 庫載入,並推薦使用 Flash Attention 2 加速和節省視訊記憶體,尤其在多圖和影片場景下效果更佳。針對影片處理,模型提供了 `max_num_frames` 引數,可動態控制時序上下文長度:短影片預設按 1 FPS 取樣,長影片則自動切換為均勻取樣,避免視訊記憶體溢位。此外,使用者可通過 `downsample_mode` 引數在“16x”(效率優先)和“4x”(細節優先)之間切換視覺 token 壓縮策略。
值得注意的是,面壁智慧在 5 月 17 日同步宣佈開放 MiniCPM-V 4.6 的 API 服務,並提供免費公共 API 金鑰,方便開發者快速體驗。這一舉措與量化版模型的釋出相輔相成,既降低了端側部署門檻,也為雲端呼叫提供了便捷通道。
從產業視角看,MiniCPM-V 4.6 Thinking 的 AWQ 量化版體現了多模態模型向端側下沉的趨勢。對於 AI 應用開發者而言,1B 級量化模型意味著可以在手機等裝置上實現本地化的影像與影片理解,減少對雲端的依賴,降低延遲和頻寬成本。對於終端廠商,此類輕量模型有助於在裝置端整合更智慧的視覺互動功能,而無需大幅增加硬體成本。
不過,量化通常會在精度上有所取捨,AWQ 量化版在複雜推理任務上的表現相比 BF16 原版可能略有下降,具體差異需開發者根據實際場景評估。總體而言,這一發布為端側多模態 AI 的落地提供了更輕量的選項,值得關注其在移動應用、智慧硬體等領域的實際應用效果。