面壁智慧(OpenBMB)於 2 月 6 日宣佈開源 MiniCPM-o 4.5 的 GPTQ 量化版本(W4A16),該版本基於 9B 引數模型,採用 GPTQModel 工具量化,旨在降低模型部署門檻,尤其適合在本地裝置上執行。原始 BF16 權重與完整模型卡仍可在 openbmb/MiniCPM-o-4_5 倉庫獲取。
MiniCPM-o 4.5 是 MiniCPM-o 系列的最新最強模型,採用端到端架構,集成了 SigLip2、Whisper-medium、CosyVoice2 與 Qwen3-8B,總引數達 9B。該模型在視覺、語音與全雙工多模態即時互動方面均有顯著提升。在 OpenCompass 綜合評測(涵蓋 8 個主流基準)中,MiniCPM-o 4.5 平均得分 77.6,超越 GPT-4o 與 Gemini 2.0 Pro,接近 Gemini 2.5 Flash 的水平。模型支援指令與思考兩種模式,兼顧不同場景下的效率與效能需求。
語音能力方面,MiniCPM-o 4.5 支援中英雙語即時語音對話,可配置多種音色,語音更自然、表達更豐富、穩定性更強。模型還支援通過簡單參考音訊進行語音克隆與角色扮演,其克隆效果優於 CosyVoice2 等強 TTS 工具。
新引入的全雙工與主動多模態直播能力是本次升級的亮點。模型能夠同時處理即時連續的影片與音訊輸入流,並同步生成文本與語音輸出流,互不阻塞,實現“邊看、邊聽、邊說”的流暢即時對話體驗。此外,模型還能基於對即時場景的持續理解,主動發起提醒或評論,實現主動互動。
在 OCR 與效率方面,MiniCPM-o 4.5 支援高達 180 萬畫素的高解析度影像與最高 10fps 的高幀率影片處理,支援任意寬高比。在 OmniDocBench 端到端英文文件解析評測中,模型取得最優效能,超越 Gemini-3 Flash、GPT-5 以及 DeepSeek-OCR 2 等專用工具。模型在 MMHal-Bench 上的可信行為表現與 Gemini 2.5 Flash 相當,並支援超過 30 種語言。
部署方面,MiniCPM-o 4.5 提供多種使用方式:推薦使用 PyTorch 在 Nvidia GPU 上進行推理;支援 llama.cpp 與 Ollama 實現本地 CPU 高效推理;提供 int4 與 GGUF 格式的 16 種量化模型;支援 vLLM 與 SGLang 進行高吞吐、低記憶體推理;還支援 FlagOS 統一多晶片後端外掛。官方同時開源了可在本地裝置(如 GPU、PC、MacBook)上體驗全雙工多模態直播的 Web 演示。
模型架構採用端到端全模態設計,模態編碼器/解碼器與 LLM 通過隱藏狀態密集連線,促進資訊流與控制,並充分利用多模態知識。全雙工機制將離線模態轉換器線上化,語音 token 解碼器交錯建模文本與語音 token,支援全雙工語音生成,並實現毫秒級時間線同步。主動互動機制中,LLM 以 1Hz 頻率持續監控輸入流並決定是否發言,高決策頻率與全雙工特性共同支撐主動互動能力。語音建模設計繼承了 MiniCPM-o 2.6 的多模態系統提示,支援推理時克隆新聲音與角色扮演。
此次 GPTQ 量化版的釋出,進一步降低了 MiniCPM-o 4.5 的部署門檻,使得全雙工多模態互動能力更易在端側裝置上落地,對 AI 應用層與端側推理生態具有積極意義。