是什么

AI 生成内容检测,中文语境里常被简称为「查 AI 率」,指用技术手段判断一段文本(有时也包括图像、音频)是否由大模型生成。它不是一项单一技术,而是三条路线的合称。

第一条是统计特征法。大模型逐词生成时倾向于挑选概率较高的词,结果是文本的「困惑度」偏低、句子长度与结构的起伏(常被称为突发度)偏小。检测器用一个参照模型算出这两个指标,再和人类写作的分布比较。

第二条是水印。模型在采样时按密钥把词表切成两半,系统性地偏向其中一半,人读不出差别,但持有密钥的一方能统计出这种偏向。它是唯一在原理上不靠猜的路线,缺点是只能检出愿意配合埋水印的模型。

第三条是分类器。直接拿人类文本和 AI 文本训练一个判别模型输出概率。它效果依赖训练分布,换一代模型、换一种语言就容易失灵——OpenAI 早年推出的 AI 文本分类器就因准确率不足而被下线。

为什么重要

因为这个分数正在被当成证据用。高校用它判定作业是否违规,媒体用它筛稿,招聘方用它看求职信,而它的可靠性远没有达到「可作定论」的水平。

几组公开数据可以说明问题的规模。2023 年 Weber-Wulff 等人对 14 款主流检测工具的评估中,所有工具的准确率都低于 80%,仅 5 款高于 70%。2023 年 7 月斯坦福团队发表于《Patterns》的研究发现,非英语母语者所写的托福作文平均误判率达 61.3%——检测器实际上在惩罚「词汇量有限、句式规整」这一类写作风格。2024 年 9 月 Common Sense Media 的报告则指出,检测工具对不同族裔学生的误判率存在明显差异。工具厂商的自报数字(如「误判率低于 1%」)与第三方复测结果差距很大。

结论并不是「检测毫无用处」,而是:它适合当作触发人工复核的线索,不适合当作处分依据;任何把百分比数字直接等同于事实认定的流程,都在把统计误差转嫁给被检测的人。

在 AI 产业链中的位置

检测位于应用层偏治理侧,是 AI 内容生态的「下游净化」环节,与上游的AI 生成内容标识构成互补关系。标识是生成方主动声明,检测是接收方被动推断;标识准但需要全行业配合且可被剥离,检测覆盖面广但容易出错。中国《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日施行后,把重心放在前者——要求服务提供者添加显式与隐式标识,内容传播平台在内容上线时核验,对未标识但疑似生成的内容添加提示,正是在承认「事后检测靠不住」的前提下,给出的制度化替代方案。

为什么结果会互相打架

同一篇文章在不同工具上分数迥异,原因是这些工具压根没在测同一件事:参照模型不同(用 GPT-2 还是某个开源模型算困惑度,结论就不同)、训练语料不同、阈值不同、切片粒度不同(整篇打分还是逐句打分)。加上模型本身在迭代,去年训练的检测器面对今年的模型,分布早已偏移。

因此几条务实的提醒:不要用单一工具的分数下结论;保留写作过程材料(草稿、版本历史、笔记)比事后自证更有效;如果分数被用于处分,要求对方说明使用的工具、版本与阈值,是合理的程序性要求。