美國前沿AI公司與政府正對所謂「蒸餾攻擊」的效果愈發警惕。據彭博報道,這類攻擊指通過提取西方前沿模型的輸出,訓練出能力相近但成本與算力需求低得多的替代模型,可能正幫助中國和俄羅斯縮小差距。中國公開否認相關指控,但表示若美國以這些說法為藉口「遏制」中國AI發展,將採取反制措施。
蒸餾本身是一種常見訓練方法:用更先進模型對提示的回覆來訓練更小的語言模型,使其模仿前者的能力與回答風格,而無需以同樣方式從頭訓練。據推測,中國AI開發者正是藉助蒸餾,在2025年的DeepSeek與2026年的Kimi K3上取得大幅躍升——它們未必達到Anthropic與OpenAI前沿模型的水平,但能以更快、更便宜的方式提供相近的智慧水平。
爭議在於用途。企業用蒸餾訓練內部小模型,或獨立開發者據此打造更輕量的本地模型,通常被視為正當;但拿別家模型來訓練,則被指為惡意,理由是這等於無償取用他人鉅額投入的成果。不過也有觀點指出,OpenAI與Anthropic等公司的模型同樣曾基於盜版書籍、抓取網頁文章等材料訓練。南華早報稱,Thinking Machines的Inkling AI模型曾使用包括Moonshot的Kimi K2.5在內的其他模型生成早期訓練資料。
這場爭論也折射出中美AI開發路徑的分野。Anthropic、OpenAI、谷歌等美國頭部公司多將模型保持專有、設計不透明;而許多中國旗艦替代品是開放權重模型,底層權重可被自由讀取,只要硬體夠強就能執行。美國模型更明確以盈利為目標,在AI開發與算力上投入了數千億美元,自然不願中國實驗室從中提取價值並公開供人使用,這會直接衝擊前沿AI企業的商業模式。
美方還將其框定為國家安全議題,類似此前推動全球大規模投資AI的敘事,並希望美國政府協助阻止蒸餾。美中領導人定於9月24日會面,AI發展乃至這類蒸餾攻擊可能被提上議程。
但真正阻止蒸餾並不容易。檢測取決於攻擊方式,有時可行;一旦攻擊者刻意繞過防護,徹底杜絕可能本身就無法實現。Anthropic在2026年9月一份關於反制惡意AI使用的詳盡報告中,列舉了過去一年多種蒸餾攻擊及檢測與反制方式。常見手法包括用精心設計的提示詞誘導Claude輸出內部推理,例如偽裝成除錯會話要求逐字輸出推理軌跡;也有攻擊者用前沿模型評估其他模型的回覆、推測其推理系統,或用自家使用者的提示與回覆同Claude等模型的回答做對比。Anthropic封禁了相關賬號、遮蔽特定組織與實體的IP,並在檢測到進行中的蒸餾時攔截提示與請求;它還讓模型在回答前先總結推理過程,增加資料被用於訓練的難度。
即便如此,完全阻止仍困難。模型開發者可從第三方服務購買使用西方前沿模型的聊天記錄來訓練,而這些本是合法使用者,難以防範;灰色市場的「中轉站」也有助於繞過地域限制。立法層面雖有針對惡意蒸餾企業實施制裁的嘗試,但截至報道時尚未有正式方案落地。美國網路安全和基礎設施安全域性(CISA)已列出一份建議清單,幫助西方AI開發者檢測相關行為。