面壁智能(OpenBMB)于 5 月 17 日在 Hugging Face 平台发布了 MiniCPM-V 4.6 Thinking 的 AWQ 量化版本(模型 ID:openbmb/MiniCPM-V-4.6-Thinking-AWQ)。该模型采用 W4A16 量化方案(基于 AutoAWQ 工具),参数规模约 1B,并沿用 Apache 2.0 开源许可,开发者可自由用于商业与研究。
MiniCPM-V 4.6 Thinking 是 MiniCPM-V 4.6 的长思维链推理变体,在生成最终答案前会先输出显式的推理过程,从而在复杂多模态推理、数学和 OCR 密集型任务上显著提升表现。其架构保持端侧友好:采用 SigLIP2-400M 视觉编码器 与 Qwen3.5-0.8B 语言模型 的组合,并支持 4x/16x 混合视觉 token 压缩,在保持效率的同时兼顾细节。
此次发布的 AWQ 量化版进一步压缩了模型体积,使其更适合在手机等资源受限的设备上运行。据模型卡介绍,MiniCPM-V 4.6 可部署于 iOS、Android 和鸿蒙(HarmonyOS) 三大主流端侧平台,官方展示了在 iPhone 17 Pro Max、Redmi K70 和华为 nova 14 上的实机运行录屏,涵盖图像与视频理解场景。
在推理方面,模型支持通过 Transformers 库加载,并推荐使用 Flash Attention 2 加速和节省显存,尤其在多图和视频场景下效果更佳。针对视频处理,模型提供了 `max_num_frames` 参数,可动态控制时序上下文长度:短视频默认按 1 FPS 采样,长视频则自动切换为均匀采样,避免显存溢出。此外,用户可通过 `downsample_mode` 参数在“16x”(效率优先)和“4x”(细节优先)之间切换视觉 token 压缩策略。
值得注意的是,面壁智能在 5 月 17 日同步宣布开放 MiniCPM-V 4.6 的 API 服务,并提供免费公共 API 密钥,方便开发者快速体验。这一举措与量化版模型的发布相辅相成,既降低了端侧部署门槛,也为云端调用提供了便捷通道。
从产业视角看,MiniCPM-V 4.6 Thinking 的 AWQ 量化版体现了多模态模型向端侧下沉的趋势。对于 AI 应用开发者而言,1B 级量化模型意味着可以在手机等设备上实现本地化的图像与视频理解,减少对云端的依赖,降低延迟和带宽成本。对于终端厂商,此类轻量模型有助于在设备端集成更智能的视觉交互功能,而无需大幅增加硬件成本。
不过,量化通常会在精度上有所取舍,AWQ 量化版在复杂推理任务上的表现相比 BF16 原版可能略有下降,具体差异需开发者根据实际场景评估。总体而言,这一发布为端侧多模态 AI 的落地提供了更轻量的选项,值得关注其在移动应用、智能硬件等领域的实际应用效果。