Cohere 與 Cohere Labs 於今日釋出 Command A+W4A4 量化版(模型 ID:CohereLabs/command-a-plus-05-2026-w4a4),該版本在保持模型質量的同時,將硬體需求大幅壓縮——單塊 B200兩塊 H100 即可執行,而全精度 BF16 版本需要 4 塊 B200 或 8 塊 H100。這一量化版基於 Command A+ 基礎模型,採用 Apache 2.0 開源許可,支援文本與影像輸入,上下文長度達 128K,面向智慧體、多語言及推理密集型任務,尤其強調企業級效能。

Command A+ 本身是一個稀疏混合專家(MoE)Transformer 模型,總引數 218B,但每次推理僅啟用 25B 引數。其架構包含 128 個專家,每個 token 啟用其中 8 個,並有一個共享專家始終參與。模型在 48 種語言上訓練,覆蓋英語、中文、阿拉伯語、印地語等主要語種。此次釋出的 W4A4 量化版,是 Cohere 提供的三種量化檔位之一,另兩種為 BF16(16 位)和 FP8(8 位)。官方稱,三種量化在基準測試中的質量差異可忽略不計,而 W4A4 在速度、延遲和硬體佔用上更具優勢,因此被推薦為大多數場景的首選。

量化方法上,Cohere 採用了選擇性量化與蒸餾結合的策略。由於推理模型在低位元下容易累積誤差,尤其長解碼軌跡會放大逐 token 錯誤,因此團隊僅對 MoE 專家層應用 NVFP4 W4A4 量化(4 位權重和啟用,帶兩級縮放),而注意力路徑(Q/K/V/O 投影、KV 快取及注意力計算)保持全精度。MoE 專家佔據模型大部分引數,將其壓縮至 4 位後,模型可裝入單塊 B200 的記憶體預算,同時加速了短中上下文解碼中的專家矩陣乘法瓶頸。此外,團隊在訓練後階段使用量化感知蒸餾(QAD),讓量化學生模型模仿全精度教師模型的輸出分佈,以縮小質量差距。

部署方面,W4A4 版本對軟體環境有特定要求:需使用 vLLM 0.25.0 版本,並安裝 Cohere 的 melody 庫(0.9.0)。官方提供了 vLLM 服務啟動示例,並推薦取樣引數為 temperature=0.9、top_p=0.95、repetition_penalty=1.04。對於開發者,可通過 Hugging Face Transformers 庫載入模型,支援對話模板與推理。

此次釋出對 AI 產業的影響在於降低了高階多模態模型的部署門檻。此前執行 Command A+ 全精度版本需要 4 塊 B200 或 8 塊 H100,而 W4A4 版本將需求減半以上,使得更多企業能夠在現有硬體上執行該模型,或減少雲 GPU 租賃成本。這有助於推動企業級 AI 應用的普及,尤其在智慧體、多語言客服、文件理解等場景。同時,量化技術的進步也反映了行業對推理效率的持續追求,與輝達等硬體廠商的路線圖相輔相成。

不過,量化版對軟體棧的依賴(如特定 vLLM 版本)可能帶來一定的部署複雜性,且 W4A4 在長上下文或極端推理任務上的表現仍需實際驗證。總體而言,Cohere 通過開源與量化策略,正在擴大其模型在產業界的可用性,為 AI 應用層提供更靈活的算力選擇。