IBM 於 2026 年 8 月 25 日釋出了 Granite-4.2 系列語言模型,其中 Granite-4.2-3B 作為該系列的緊湊型推理模型,憑藉原生思維鏈(chain-of-thought)能力,在數學、程式設計、多步邏輯和智慧體工具呼叫等任務上表現出色。模型基於 Granite-4.1-3B-Base 進行後訓練,採用 Apache 2.0 許可,允許商業和研究用途的無限制使用。
Granite-4.2-3B 的架構為僅解碼器的密集 Transformer,引數量為 3B,上下文視窗原生支援 128K,並可擴充套件至 512K,適合處理長文件、多輪對話和複雜的智慧體工作流。模型支援靈活思考模式,使用者可在完整思考(預設)、非思考與低努力模式間切換,以平衡推理深度與響應延遲。此外,模型具備推理增強的工具呼叫能力,能先思考再決定呼叫哪些工具,從而提高函式呼叫的準確性。
在訓練方法上,Granite-4.2-3B 經歷了三階段流水線:首先基於 Granite-4.1-3B-Base 的預訓練權重,該基座模型已在大型英語和多語言語料上預訓練;隨後進行監督微調(SFT),使用指令遵循、思維鏈和推理資料,以及內部生成的合成數據、智慧體軌跡和人工撰寫資料;最後採用多階段、多環境的強化學習,使用 GRPO(Group Relative Policy Optimization)演算法,在數學、程式碼、科學、指令遵循、工具使用、通用聊天和結構化輸出等環境中訓練,並通過生成式獎勵模型對開放式提示評分。訓練過程非同步進行,生成與策略更新使用獨立 GPU 池,並在偏好對齊(RLHF)階段最佳化有用性、對話質量和安全性。
基礎設施方面,IBM 使用 NVIDIA GB200 NVL72 叢集(由 CoreWeave 託管)進行訓練,機架內通過 72-GPU NVLink 域通訊。該叢集的算力支援了 3B、8B 和 30B 三個尺寸模型的訓練,其中 30B 模型額外進行了第二輪 SFT,上取樣智慧體資料並保留少量通用回放資料。
Granite 系列是 IBM 面向企業和研究用途開發的開源大語言模型家族,覆蓋從邊緣部署的緊湊模型到大規模推理系統。Granite-4.2 系列引入原生推理能力,使模型在生成最終答案前能進行逐步推理,從而提升複雜任務的表現。此次釋出的 3B 模型特別適合資源受限的環境,同時保持較高的推理效能。模型支援 12 種語言,包括英語、德語、西班牙語、法語、日語、葡萄牙語、阿拉伯語、捷克語、義大利語、韓語、荷蘭語和中文,但其他語言可能也能工作,只是未經全面測試。
對於 AI 產業觀察者而言,Granite-4.2-3B 的釋出體現了開源模型在推理能力上的持續進步,尤其是在小引數規模下實現高效推理與工具呼叫,這可能降低企業採用 AI 的門檻,並推動邊緣計算和本地化部署場景的發展。同時,訓練基礎設施對 NVIDIA GB200 叢集的依賴也凸顯了高效能算力在模型研發中的核心作用。