Cohere 与 Cohere Labs 于今日发布 Command A+W4A4 量化版(模型 ID:CohereLabs/command-a-plus-05-2026-w4a4),该版本在保持模型质量的同时,将硬件需求大幅压缩——单块 B200两块 H100 即可运行,而全精度 BF16 版本需要 4 块 B200 或 8 块 H100。这一量化版基于 Command A+ 基础模型,采用 Apache 2.0 开源许可,支持文本与图像输入,上下文长度达 128K,面向智能体、多语言及推理密集型任务,尤其强调企业级性能。

Command A+ 本身是一个稀疏混合专家(MoE)Transformer 模型,总参数 218B,但每次推理仅激活 25B 参数。其架构包含 128 个专家,每个 token 激活其中 8 个,并有一个共享专家始终参与。模型在 48 种语言上训练,覆盖英语、中文、阿拉伯语、印地语等主要语种。此次发布的 W4A4 量化版,是 Cohere 提供的三种量化档位之一,另两种为 BF16(16 位)和 FP8(8 位)。官方称,三种量化在基准测试中的质量差异可忽略不计,而 W4A4 在速度、延迟和硬件占用上更具优势,因此被推荐为大多数场景的首选。

量化方法上,Cohere 采用了选择性量化与蒸馏结合的策略。由于推理模型在低比特下容易累积误差,尤其长解码轨迹会放大逐 token 错误,因此团队仅对 MoE 专家层应用 NVFP4 W4A4 量化(4 位权重和激活,带两级缩放),而注意力路径(Q/K/V/O 投影、KV 缓存及注意力计算)保持全精度。MoE 专家占据模型大部分参数,将其压缩至 4 位后,模型可装入单块 B200 的内存预算,同时加速了短中上下文解码中的专家矩阵乘法瓶颈。此外,团队在训练后阶段使用量化感知蒸馏(QAD),让量化学生模型模仿全精度教师模型的输出分布,以缩小质量差距。

部署方面,W4A4 版本对软件环境有特定要求:需使用 vLLM 0.25.0 版本,并安装 Cohere 的 melody 库(0.9.0)。官方提供了 vLLM 服务启动示例,并推荐采样参数为 temperature=0.9、top_p=0.95、repetition_penalty=1.04。对于开发者,可通过 Hugging Face Transformers 库加载模型,支持对话模板与推理。

此次发布对 AI 产业的影响在于降低了高端多模态模型的部署门槛。此前运行 Command A+ 全精度版本需要 4 块 B200 或 8 块 H100,而 W4A4 版本将需求减半以上,使得更多企业能够在现有硬件上运行该模型,或减少云 GPU 租赁成本。这有助于推动企业级 AI 应用的普及,尤其在智能体、多语言客服、文档理解等场景。同时,量化技术的进步也反映了行业对推理效率的持续追求,与英伟达等硬件厂商的路线图相辅相成。

不过,量化版对软件栈的依赖(如特定 vLLM 版本)可能带来一定的部署复杂性,且 W4A4 在长上下文或极端推理任务上的表现仍需实际验证。总体而言,Cohere 通过开源与量化策略,正在扩大其模型在产业界的可用性,为 AI 应用层提供更灵活的算力选择。