是什么
知识蒸馏(Knowledge Distillation)是一种模型压缩技术:先有一个能力强但体量大的「教师」(teacher)模型,再训练一个体量小得多的「学生」(student)模型去模仿教师的输出——不只是最终答案,还包括概率分布等「软标签」,从而把教师的知识「浓缩」进学生模型。
为什么重要
旗舰大模型效果好却昂贵、难以在本地或边缘设备运行。蒸馏让厂商可以发布一个小很多、跑得起、却保留大部分能力的版本,是「把模型做小做便宜」的核心手段之一。近年不少开源系列都会同时放出旗舰版与蒸馏版,正是为了覆盖从云端到本地的不同算力场景。
2026 年的最新进展
2026 年 6 月,NVIDIA 在 Nemotron 3 Ultra 技术报告里提出「多教师在线策略蒸馏」(MOPD):先训练十余个分别专精软件工程、检索、STEM、竞赛编程等领域的教师模型,再把它们在每个 token 位置上的概率分布蒸馏进同一个学生模型。值得注意的是这里的学生就是旗舰本身——5500 亿总参数、550 亿激活的 Nemotron 3 Ultra——说明到 2026 年,蒸馏已不只是把大模型压小,也是把多个专精能力合并进一个通用模型的手段。同年 4 月的 Nemotron 3 Super 则走另一条常见路线:请 GPT-OSS-120B、Qwen3-235B、DeepSeek-V3 等外部模型生成与筛选训练样本,而非蒸馏权重分布。
在 AI 产业链中的位置
蒸馏是模型层的技术,但它的意义在于改写芯片与基础设施层的账单——更小的学生模型意味着更少的显存占用与推理算力。向上,它让应用层能用更低的延迟与成本部署 AI 功能,甚至放进手机等终端设备。