62%→94%,“AI率”不降反升?央视详解毕业论文AI检测原理
62%→94%,“AI率”不降反升?央视详解毕业论文AI检测原理
当前毕业生论文“AI味”过浓,高校引入AIGC检测作为新关卡。然而,有学生在尝试用大模型改写论文后,AI率反而从62%飙升至94%。央视新闻近日介绍了AI检测原理,指出其本质是基于概率的分类而非确定性判断,且存在技术瓶颈与语言歧义难题。文章呼吁建立“人机共判”模式,而非简单划定AI率红线。
现象:AI率“越改越高”
又到一年毕业季,毕业论文的“AI味”成为高校面临的新难题。除了传统的查重、盲审、答辩,今年的毕业生还要经历一道新关卡 —— AIGC检测,即人工智能生成内容检测。
假设你提交的论文AI率为62%,而学校规定的红线是15%;你尝试用大模型指令“帮我把这篇论文改得像人写的”进行修改,结果再次检测时AI率反而飙升至94%。这不是个例,过去一段时间,许多毕业生都遇到了类似情况。
检测原理:基于概率,而非证据
首都师范大学教育学院副院长蔡海龙在接受央视采访时解释了AI检测与传统查重的本质区别:
- 查重:将论文与语料库进行语句逐条对比,通过判断重复性得出确定性结论。
- AI检测:运用AI系统检测人类文本,在语义和语言表达风格上判断与AI写作是否存在重叠。它本质上是基于概率的分类,而非基于证据的确定性判断。
技术瓶颈:用AI查AI的困境
当前AI检测的核心瓶颈在于,我们是在用AI去检测AI。这导致系统无法明确判定某段文字到底是人类作者所写还是AI生成,也无法对此做出清晰、可解释的说明。这正是技术受限的关键所在。
中文表达的额外挑战
除了技术瓶颈,中文语言本身也增加了检测难度。中文语义极为丰富,句式表达方式多样,AI系统在检测人类写作的语句时容易产生大量歧义,准确率大幅下降,进而造成误判。这是当前检测失准的一个重要原因。
未来方向:人机共判
由于AI率检测尚无法做到十分精准,老师们普遍认为,论文审核应建立透明可回溯的AI使用标注制度,而不宜简单划定AI率红线。在判定机制上,应确立以人工评议为主、AI检测为辅的“人机共判”模式。
目前,多数主流高校采用知网、维普、万方等系统的AIGC检测模块。央视记者就“AI大模型如何检测一篇文章有多少内容由AI生成”这一问题询问多个大模型,得到的共识是:主要通过困惑度与突发性等特征来判断。简单来说,AI文本通常更“平滑”,而人类文本则波动更大。
- 困惑度:衡量文本的“可预测性”。越充满人类特有的、意外的、跳出常规的表达,越像人类所作。
- 突发性:反映文本节奏的波动。人类写作如心电图般起伏,AI输出则如直线般平稳。
那么,这样的判断准确吗?专家指出,除了困惑度、突发性等指标,AI文本生成的底层原理是通过预测下一个最可能出现的词来逐步生成文本,本质上是基于概率统计。因此,目前所有AI生成内容检测的准确性都无法达到100%,误判时有发生。
关键要点
- AI检测本质是基于概率的分类,而非确定性判断,因此无法保证100%准确。
- 用AI改写AI生成的内容,可能因平滑性叠加而进一步提高AI率,导致“越改越高”的悖论。
- 中文语义和句式的丰富性增加了AI检测的歧义和误判风险。
- 高校应建立透明、可回溯的AI使用标注制度,推行“人工评议为主、AI检测为辅”的“人机共判”模式。