美国前沿AI公司与政府正对所谓「蒸馏攻击」的效果愈发警惕。据彭博报道,这类攻击指通过提取西方前沿模型的输出,训练出能力相近但成本与算力需求低得多的替代模型,可能正帮助中国和俄罗斯缩小差距。中国公开否认相关指控,但表示若美国以这些说法为借口「遏制」中国AI发展,将采取反制措施。

蒸馏本身是一种常见训练方法:用更先进模型对提示的回复来训练更小的语言模型,使其模仿前者的能力与回答风格,而无需以同样方式从头训练。据推测,中国AI开发者正是借助蒸馏,在2025年DeepSeek2026年Kimi K3上取得大幅跃升——它们未必达到Anthropic与OpenAI前沿模型的水平,但能以更快、更便宜的方式提供相近的智能水平。

争议在于用途。企业用蒸馏训练内部小模型,或独立开发者据此打造更轻量的本地模型,通常被视为正当;但拿别家模型来训练,则被指为恶意,理由是这等于无偿取用他人巨额投入的成果。不过也有观点指出,OpenAI与Anthropic等公司的模型同样曾基于盗版书籍、抓取网页文章等材料训练。南华早报称,Thinking Machines的Inkling AI模型曾使用包括Moonshot的Kimi K2.5在内的其他模型生成早期训练数据。

这场争论也折射出中美AI开发路径的分野。Anthropic、OpenAI、谷歌等美国头部公司多将模型保持专有、设计不透明;而许多中国旗舰替代品是开放权重模型,底层权重可被自由读取,只要硬件够强就能运行。美国模型更明确以盈利为目标,在AI开发与算力上投入了数千亿美元,自然不愿中国实验室从中提取价值并公开供人使用,这会直接冲击前沿AI企业的商业模式。

美方还将其框定为国家安全议题,类似此前推动全球大规模投资AI的叙事,并希望美国政府协助阻止蒸馏。美中领导人定于9月24日会面,AI发展乃至这类蒸馏攻击可能被提上议程。

但真正阻止蒸馏并不容易。检测取决于攻击方式,有时可行;一旦攻击者刻意绕过防护,彻底杜绝可能本身就无法实现。Anthropic在2026年9月一份关于反制恶意AI使用的详尽报告中,列举了过去一年多种蒸馏攻击及检测与反制方式。常见手法包括用精心设计的提示词诱导Claude输出内部推理,例如伪装成调试会话要求逐字输出推理轨迹;也有攻击者用前沿模型评估其他模型的回复、推测其推理系统,或用自家用户的提示与回复同Claude等模型的回答做对比。Anthropic封禁了相关账号、屏蔽特定组织与实体的IP,并在检测到进行中的蒸馏时拦截提示与请求;它还让模型在回答前先总结推理过程,增加数据被用于训练的难度。

即便如此,完全阻止仍困难。模型开发者可从第三方服务购买使用西方前沿模型的聊天记录来训练,而这些本是合法用户,难以防范;灰色市场的「中转站」也有助于绕过地域限制。立法层面虽有针对恶意蒸馏企业实施制裁的尝试,但截至报道时尚未有正式方案落地。美国网络安全和基础设施安全局(CISA)已列出一份建议清单,帮助西方AI开发者检测相关行为。