是什麼
知識蒸餾(Knowledge Distillation)是一種模型壓縮技術:先有一個能力強但體量大的「教師」(teacher)模型,再訓練一個體量小得多的「學生」(student)模型去模仿教師的輸出——不只是最終答案,還包括機率分佈等「軟標籤」,從而把教師的知識「濃縮」進學生模型。
為什麼重要
旗艦大模型效果好卻昂貴、難以在本地或邊緣裝置執行。蒸餾讓廠商可以釋出一個小很多、跑得起、卻保留大部分能力的版本,是「把模型做小做便宜」的核心手段之一。近年不少開源系列都會同時放出旗艦版與蒸餾版,正是為了覆蓋從雲端到本地的不同算力場景。
2026 年的最新進展
2026 年 6 月,NVIDIA 在 Nemotron 3 Ultra 技術報告裡提出「多教師線上策略蒸餾」(MOPD):先訓練十餘個分別專精軟體工程、檢索、STEM、競賽程式設計等領域的教師模型,再把它們在每個 token 位置上的機率分佈蒸餾進同一個學生模型。值得注意的是這裡的學生就是旗艦本身——5500 億總引數、550 億啟用的 Nemotron 3 Ultra——說明到 2026 年,蒸餾已不只是把大模型壓小,也是把多個專精能力合併進一個通用模型的手段。同年 4 月的 Nemotron 3 Super 則走另一條常見路線:請 GPT-OSS-120B、Qwen3-235B、DeepSeek-V3 等外部模型生成與篩選訓練樣本,而非蒸餾權重分佈。
在 AI 產業鏈中的位置
蒸餾是模型層的技術,但它的意義在於改寫晶片與基礎設施層的賬單——更小的學生模型意味著更少的視訊記憶體佔用與推理算力。向上,它讓應用層能用更低的延遲與成本部署 AI 功能,甚至放進手機等終端裝置。