是什麼

深度偽造(Deepfake)是「深度學習」與「偽造」的合成詞,指用神經網路生成、替換或驅動人臉、聲音與肢體動作,做出看似真實、實則並未發生的影像與音訊。技術上它並不神秘:早期靠自編碼器把兩張臉的特徵互換,後來生成對抗網路提升了細節真實度,如今擴散模型與語音合成模型讓「幾秒鐘樣本克隆一個人的音色」成為消費級能力。

在中國法規裡,對應的正式表述是「深度合成」。《網際網路資訊服務深度合成管理規定》把它界定為利用深度學習、虛擬現實等生成合成類算法制作文本、影像、音訊、影片、虛擬場景的技術,並點名了人臉生成、人臉替換、合成人聲、智慧對話等具體形態。

需要分清的是,這項技術本身中性:影視換臉補拍、有聲書配音、數字人主播、跨語言口型對齊都在用同一套方法。問題出在同一能力被拿去冒充真人。

為什麼重要

深度偽造把「眼見為實」這一條社會共識拆掉了。過去電信詐騙的軟肋是聲音不像、影片對不上,現在這兩道門檻都被技術抹平。已經出現的典型手法有兩類:

第一類是視訊會議或視訊通話換臉。騙子先從公開渠道收集目標高管或親屬的照片與影片,合成出多個可即時驅動的人像,再拉起一場「除受害者外全是偽造影像」的會議,由「領導」當場下達轉賬指令。2024 年香港警方披露的一起案件裡,一家跨國工程公司的香港分部員工正是這樣被分多筆騙走約 2 億港元,成為被廣泛引用的樣本。

第二類是純聲音克隆。只需幾十秒的公開音訊就能復刻音色,配合來電號碼偽裝,冒充子女、同事或客服,通話時長短、成本極低,規模化投放更方便。

對企業而言,真正的防線不在「看出破綻」,而在流程:大額付款必須回撥已知號碼複核、必須走原有審批鏈、對「保密加急」的指令一律降級處理。對個人,家庭內部約定一個不在網上出現過的暗語,比任何畫面識別技巧都管用。

在 AI 產業鏈中的位置

深度偽造屬於橫切層:它由模型層的生成能力(影像、影片、語音合成)直接派生,落在應用層,又反過來推動治理與檢測環節的投入。產業鏈上因此長出三個相鄰環節——面向內容平台的偽造檢測與真偽核驗、面向金融與政務的活體檢測與身份核驗、以及面向全行業的內容標識與溯源基礎設施,後者正是AI 生成內容標識AI 生成內容檢測兩條路線要解決的問題。

中國的監管框架

兩份檔案疊在一起構成當前的基本要求。

《網際網路資訊服務深度合成管理規定》由國家網信辦、工信部、公安部聯合釋出,自 2023 年 1 月 10 日起施行。它要求深度合成服務提供者對生成或編輯的內容新增不影響使用的標識;對智慧對話、合成人聲、人臉生成、人臉替換等可能導致公眾混淆或誤認的服務,還應在合理位置作顯著標識;並明確任何組織和個人不得用技術手段刪除、篡改、隱匿這些標識。

《人工智慧生成合成內容標識辦法》由國家網信辦、工信部、公安部、國家廣播電視總局於 2025 年 3 月 14 日聯合釋出,自 2025 年 9 月 1 日起施行,把標識拆成使用者可感知的「顯式標識」與寫入檔案資料的「隱式標識」兩套,並配套了同日實施的強制性國家標準《網路安全技術 人工智慧生成合成內容標識方法》。

識別要點與侷限

可用的線索包括:面部與頸部、髮際線交界處的邊緣異常;戴眼鏡時鏡片反光與頭部轉動不同步;快速遮擋或大角度側臉時的貼合錯位;語音過於平穩、缺少呼吸與環境噪聲。但必須強調,這些線索會隨模型迭代持續失效,把安全寄託在肉眼識別上並不可靠——流程校驗與多通道回撥,才是能長期站得住的做法。