是什么

模型量化(Quantization)是一种模型压缩技术:把模型权重(以及有时连同激活值)从高精度数字格式——通常是 16 位或 32 位浮点——转换成更低精度的格式,例如 8 位或 4 位整数。数字「分辨率」降低了,但模型的整体结构不变,于是体积更小、读写与计算更快。

为什么重要

大模型的瓶颈往往不是算力而是显存与内存带宽:权重越大,越难塞进显存、越拖慢推理。量化能把一个原本需要多张高端显卡的模型压到单卡、甚至消费级硬件上运行,是「让大模型跑得起、跑得便宜」最直接的手段之一,也是开源模型能在本地广泛部署的前提。

2026 年的最新进展

2026 年最大的变化,是量化从推理阶段的压缩手段推进到预训练阶段的数值格式:NVIDIA 2026 年 6 月 8 日的技术博客报告,在 Blackwell 上用 NVFP4 做 4 位混合精度预训练比 FP8 基线快 1.31~1.73 倍,训练损失在收敛区与 FP8 只差 0.026 nats。同月 29 日 NVIDIA Research 的文章解释了原因:NVFP4 用 FP8-E4M3 的细粒度缩放配合两级缩放来吸收离群值。端侧同步受益:截至 2026 年 9 月,Unsloth 的 NVFP4 量化版把 Qwen3.6-27B 压进 24 GB 显存、Gemma 4-12B 压进 11 GB,但需要 Blackwell 架构显卡。

在 AI 产业链中的位置

量化是模型层的技术,却直接作用在芯片与基础设施层:它降低对显存容量与高带宽内存(HBM)的需求,把同样的模型塞进更少、更便宜的硬件。向上,它让应用层能以更低成本、更低延迟提供 AI 功能,并把模型推到端侧设备。

在大模型库查

可下载量化部署的主要是开源权重系列,见开源大模型切片;各模型的上下文窗口与 API 价格见大模型库总表。