是什麼
AI 生成內容檢測,中文語境裡常被簡稱為「查 AI 率」,指用技術手段判斷一段文本(有時也包括影像、音訊)是否由大模型生成。它不是一項單一技術,而是三條路線的合稱。
第一條是統計特徵法。大模型逐詞生成時傾向於挑選機率較高的詞,結果是文本的「困惑度」偏低、句子長度與結構的起伏(常被稱為突發度)偏小。檢測器用一個參照模型算出這兩個指標,再和人類寫作的分佈比較。
第二條是水印。模型在取樣時按金鑰把詞表切成兩半,系統性地偏向其中一半,人讀不出差別,但持有金鑰的一方能統計出這種偏向。它是唯一在原理上不靠猜的路線,缺點是隻能檢出願意配合埋水印的模型。
第三條是分類器。直接拿人類文本和 AI 文本訓練一個判別模型輸出機率。它效果依賴訓練分佈,換一代模型、換一種語言就容易失靈——OpenAI 早年推出的 AI 文本分類器就因準確率不足而被下線。
為什麼重要
因為這個分數正在被當成證據用。高校用它判定作業是否違規,媒體用它篩稿,招聘方用它看求職信,而它的可靠性遠沒有達到「可作定論」的水平。
幾組公開資料可以說明問題的規模。2023 年 Weber-Wulff 等人對 14 款主流檢測工具的評估中,所有工具的準確率都低於 80%,僅 5 款高於 70%。2023 年 7 月斯坦福團隊發表於《Patterns》的研究發現,非英語母語者所寫的託福作文平均誤判率達 61.3%——檢測器實際上在懲罰「詞彙量有限、句式規整」這一類寫作風格。2024 年 9 月 Common Sense Media 的報告則指出,檢測工具對不同族裔學生的誤判率存在明顯差異。工具廠商的自報數字(如「誤判率低於 1%」)與第三方複測結果差距很大。
結論並不是「檢測毫無用處」,而是:它適合當作觸發人工複核的線索,不適合當作處分依據;任何把百分比數字直接等同於事實認定的流程,都在把統計誤差轉嫁給被檢測的人。
在 AI 產業鏈中的位置
檢測位於應用層偏治理側,是 AI 內容生態的「下游淨化」環節,與上游的AI 生成內容標識構成互補關係。標識是生成方主動宣告,檢測是接收方被動推斷;標識準但需要全行業配合且可被剝離,檢測覆蓋面廣但容易出錯。中國《人工智慧生成合成內容標識辦法》自 2025 年 9 月 1 日施行後,把重心放在前者——要求服務提供者新增顯式與隱式標識,內容傳播平台在內容上線時核驗,對未標識但疑似生成的內容新增提示,正是在承認「事後檢測靠不住」的前提下,給出的制度化替代方案。
為什麼結果會互相打架
同一篇文章在不同工具上分數迥異,原因是這些工具壓根沒在測同一件事:參照模型不同(用 GPT-2 還是某個開源模型算困惑度,結論就不同)、訓練語料不同、閾值不同、切片粒度不同(整篇打分還是逐句打分)。加上模型本身在迭代,去年訓練的檢測器面對今年的模型,分佈早已偏移。
因此幾條務實的提醒:不要用單一工具的分數下結論;保留寫作過程材料(草稿、版本歷史、筆記)比事後自證更有效;如果分數被用於處分,要求對方說明使用的工具、版本與閾值,是合理的程式性要求。