面壁智能(OpenBMB)于 2 月 6 日宣布开源 MiniCPM-o 4.5 的 GPTQ 量化版本(W4A16),该版本基于 9B 参数模型,采用 GPTQModel 工具量化,旨在降低模型部署门槛,尤其适合在本地设备上运行。原始 BF16 权重与完整模型卡仍可在 openbmb/MiniCPM-o-4_5 仓库获取。
MiniCPM-o 4.5 是 MiniCPM-o 系列的最新最强模型,采用端到端架构,集成了 SigLip2、Whisper-medium、CosyVoice2 与 Qwen3-8B,总参数达 9B。该模型在视觉、语音与全双工多模态实时交互方面均有显著提升。在 OpenCompass 综合评测(涵盖 8 个主流基准)中,MiniCPM-o 4.5 平均得分 77.6,超越 GPT-4o 与 Gemini 2.0 Pro,接近 Gemini 2.5 Flash 的水平。模型支持指令与思考两种模式,兼顾不同场景下的效率与性能需求。
语音能力方面,MiniCPM-o 4.5 支持中英双语实时语音对话,可配置多种音色,语音更自然、表达更丰富、稳定性更强。模型还支持通过简单参考音频进行语音克隆与角色扮演,其克隆效果优于 CosyVoice2 等强 TTS 工具。
新引入的全双工与主动多模态直播能力是本次升级的亮点。模型能够同时处理实时连续的视频与音频输入流,并同步生成文本与语音输出流,互不阻塞,实现“边看、边听、边说”的流畅实时对话体验。此外,模型还能基于对实时场景的持续理解,主动发起提醒或评论,实现主动交互。
在 OCR 与效率方面,MiniCPM-o 4.5 支持高达 180 万像素的高分辨率图像与最高 10fps 的高帧率视频处理,支持任意宽高比。在 OmniDocBench 端到端英文文档解析评测中,模型取得最优性能,超越 Gemini-3 Flash、GPT-5 以及 DeepSeek-OCR 2 等专用工具。模型在 MMHal-Bench 上的可信行为表现与 Gemini 2.5 Flash 相当,并支持超过 30 种语言。
部署方面,MiniCPM-o 4.5 提供多种使用方式:推荐使用 PyTorch 在 Nvidia GPU 上进行推理;支持 llama.cpp 与 Ollama 实现本地 CPU 高效推理;提供 int4 与 GGUF 格式的 16 种量化模型;支持 vLLM 与 SGLang 进行高吞吐、低内存推理;还支持 FlagOS 统一多芯片后端插件。官方同时开源了可在本地设备(如 GPU、PC、MacBook)上体验全双工多模态直播的 Web 演示。
模型架构采用端到端全模态设计,模态编码器/解码器与 LLM 通过隐藏状态密集连接,促进信息流与控制,并充分利用多模态知识。全双工机制将离线模态转换器在线化,语音 token 解码器交错建模文本与语音 token,支持全双工语音生成,并实现毫秒级时间线同步。主动交互机制中,LLM 以 1Hz 频率持续监控输入流并决定是否发言,高决策频率与全双工特性共同支撑主动交互能力。语音建模设计继承了 MiniCPM-o 2.6 的多模态系统提示,支持推理时克隆新声音与角色扮演。
此次 GPTQ 量化版的发布,进一步降低了 MiniCPM-o 4.5 的部署门槛,使得全双工多模态交互能力更易在端侧设备上落地,对 AI 应用层与端侧推理生态具有积极意义。