是什么

深度伪造(Deepfake)是「深度学习」与「伪造」的合成词,指用神经网络生成、替换或驱动人脸、声音与肢体动作,做出看似真实、实则并未发生的影像与音频。技术上它并不神秘:早期靠自编码器把两张脸的特征互换,后来生成对抗网络提升了细节真实度,如今扩散模型与语音合成模型让「几秒钟样本克隆一个人的音色」成为消费级能力。

在中国法规里,对应的正式表述是「深度合成」。《互联网信息服务深度合成管理规定》把它界定为利用深度学习、虚拟现实等生成合成类算法制作文本、图像、音频、视频、虚拟场景的技术,并点名了人脸生成、人脸替换、合成人声、智能对话等具体形态。

需要分清的是,这项技术本身中性:影视换脸补拍、有声书配音、数字人主播、跨语言口型对齐都在用同一套方法。问题出在同一能力被拿去冒充真人。

为什么重要

深度伪造把「眼见为实」这一条社会共识拆掉了。过去电信诈骗的软肋是声音不像、视频对不上,现在这两道门槛都被技术抹平。已经出现的典型手法有两类:

第一类是视频会议或视频通话换脸。骗子先从公开渠道收集目标高管或亲属的照片与视频,合成出多个可实时驱动的人像,再拉起一场「除受害者外全是伪造影像」的会议,由「领导」当场下达转账指令。2024 年香港警方披露的一起案件里,一家跨国工程公司的香港分部员工正是这样被分多笔骗走约 2 亿港元,成为被广泛引用的样本。

第二类是纯声音克隆。只需几十秒的公开音频就能复刻音色,配合来电号码伪装,冒充子女、同事或客服,通话时长短、成本极低,规模化投放更方便。

对企业而言,真正的防线不在「看出破绽」,而在流程:大额付款必须回拨已知号码复核、必须走原有审批链、对「保密加急」的指令一律降级处理。对个人,家庭内部约定一个不在网上出现过的暗语,比任何画面识别技巧都管用。

在 AI 产业链中的位置

深度伪造属于横切层:它由模型层的生成能力(图像、视频、语音合成)直接派生,落在应用层,又反过来推动治理与检测环节的投入。产业链上因此长出三个相邻环节——面向内容平台的伪造检测与真伪核验、面向金融与政务的活体检测与身份核验、以及面向全行业的内容标识与溯源基础设施,后者正是AI 生成内容标识AI 生成内容检测两条路线要解决的问题。

中国的监管框架

两份文件叠在一起构成当前的基本要求。

《互联网信息服务深度合成管理规定》由国家网信办、工信部、公安部联合发布,自 2023 年 1 月 10 日起施行。它要求深度合成服务提供者对生成或编辑的内容添加不影响使用的标识;对智能对话、合成人声、人脸生成、人脸替换等可能导致公众混淆或误认的服务,还应在合理位置作显著标识;并明确任何组织和个人不得用技术手段删除、篡改、隐匿这些标识。

《人工智能生成合成内容标识办法》由国家网信办、工信部、公安部、国家广播电视总局于 2025 年 3 月 14 日联合发布,自 2025 年 9 月 1 日起施行,把标识拆成用户可感知的「显式标识」与写入文件数据的「隐式标识」两套,并配套了同日实施的强制性国家标准《网络安全技术 人工智能生成合成内容标识方法》。

识别要点与局限

可用的线索包括:面部与颈部、发际线交界处的边缘异常;戴眼镜时镜片反光与头部转动不同步;快速遮挡或大角度侧脸时的贴合错位;语音过于平稳、缺少呼吸与环境噪声。但必须强调,这些线索会随模型迭代持续失效,把安全寄托在肉眼识别上并不可靠——流程校验与多信道回拨,才是能长期站得住的做法。