英伟达开发者博客于 2026 年 8 月 17 日发布技术文章,介绍如何利用 NVIDIA Model Optimizer 与量化感知蒸馏(QAD)技术,开发出 Nemotron 3.5 Lightning 的 NVFP4 量化版本。该版本将模型从 66 GB 压缩至 22 GB,并实现高达 4 倍的吞吐提升,同时保持接近 BF16 基线的精度。这一成果为在内存和计算资源受限的环境中部署大型语言模型提供了新思路。

QAD 是一种两阶段训练方法。第一阶段,对全精度模型(教师模型)执行训练后量化(PTQ),生成低精度的学生模型。第二阶段,通过 KL 散度损失,将冻结的 BF16 教师模型蒸馏到学生模型中,同时让学生模型在每次前向传播时经历模拟量化,以适应推理时的量化噪声。这种双重训练信号使学生模型不仅学习预测下一个 token,还学习复现教师模型的完整行为,从而在激进量化下保持高质量。

在 Nemotron 3.5 Lightning 的具体实现中,开发者发现将 Mamba 线性层量化为更激进的 W4A16(而非 FP8)能解锁更高吞吐,且精度下降不大。纯 PTQ 通常追求中位精度恢复率超过 99%,而结合 QAD 后,可将目标设为 95-99%,因为 QAD 会在下一阶段恢复更多精度。实验结果显示,QAD 在多个 Lightning 检查点上始终优于纯 PTQ,在中位精度恢复以及智能体与编码基准上表现更佳,并支持更激进的量化设置,而纯 PTQ 在这些设置下会出现不可接受的性能退化。

英伟达提供了 NVIDIA Model Optimizer 和 Megatron-Bridge 的端到端工作流,帮助开发者复现 QAD 流程,包括配方选择(动态或冻结缩放)、训练配置和检查点导出。这有助于推动内存和计算高效的大语言模型部署的广泛采用。

对于 AI 产业而言,QAD 技术意味着在保持模型质量的同时,可以显著降低推理时的内存占用和延迟,从而降低部署成本、提升服务吞吐。这尤其对需要高并发、低延迟的智能体应用和编码助手等场景具有吸引力。随着模型规模不断增大,如何在有限硬件上高效运行成为关键,QAD 提供了一种实用的优化路径。