輝達開發者部落格於 2026 年 8 月 17 日釋出技術文章,介紹如何利用 NVIDIA Model Optimizer 與量化感知蒸餾(QAD)技術,開發出 Nemotron 3.5 Lightning 的 NVFP4 量化版本。該版本將模型從 66 GB 壓縮至 22 GB,並實現高達 4 倍的吞吐提升,同時保持接近 BF16 基線的精度。這一成果為在記憶體和計算資源受限的環境中部署大型語言模型提供了新思路。
QAD 是一種兩階段訓練方法。第一階段,對全精度模型(教師模型)執行訓練後量化(PTQ),生成低精度的學生模型。第二階段,通過 KL 散度損失,將凍結的 BF16 教師模型蒸餾到學生模型中,同時讓學生模型在每次前向傳播時經歷模擬量化,以適應推理時的量化噪聲。這種雙重訓練訊號使學生模型不僅學習預測下一個 token,還學習復現教師模型的完整行為,從而在激進量化下保持高質量。
在 Nemotron 3.5 Lightning 的具體實現中,開發者發現將 Mamba 線性層量化為更激進的 W4A16(而非 FP8)能解鎖更高吞吐,且精度下降不大。純 PTQ 通常追求中位精度恢復率超過 99%,而結合 QAD 後,可將目標設為 95-99%,因為 QAD 會在下一階段恢復更多精度。實驗結果顯示,QAD 在多個 Lightning 檢查點上始終優於純 PTQ,在中位精度恢復以及智慧體與編碼基準上表現更佳,並支援更激進的量化設定,而純 PTQ 在這些設定下會出現不可接受的效能退化。
輝達提供了 NVIDIA Model Optimizer 和 Megatron-Bridge 的端到端工作流,幫助開發者復現 QAD 流程,包括配方選擇(動態或凍結縮放)、訓練配置和檢查點匯出。這有助於推動記憶體和計算高效的大語言模型部署的廣泛採用。
對於 AI 產業而言,QAD 技術意味著在保持模型質量的同時,可以顯著降低推理時的記憶體佔用和延遲,從而降低部署成本、提升服務吞吐。這尤其對需要高併發、低延遲的智慧體應用和編碼助手等場景具有吸引力。隨著模型規模不斷增大,如何在有限硬體上高效執行成為關鍵,QAD 提供了一種實用的最佳化路徑。