Articles
iThenticate报告里的AI检测分数准不准,非母语作者会被误判吗
你用iThenticate查了一次投稿前的稿件。相似度 OK, 但 AI 检测那一栏显示了一个让你意外的数字——比如 40% 或者更高。你很清楚这篇论文是你花了大半年一个字一个字写出来的——没有用 ChatGPT 生成过任何一段完整的文...
正文
你用iThenticate查了一次投稿前的稿件。相似度 OK, 但 AI 检测那一栏显示了一个让你意外的数字——比如 40% 或者更高。你很清楚这篇论文是你花了大半年一个字一个字写出来的——没有用 ChatGPT 生成过任何一段完整的文字,最多在写作过程中用过翻译工具把几个思路从中文翻成英文。但报告上的数字仍然标红了。你开始怀疑——iThenticate 的 AI 检测到底有没有把"非母语研究者努力写出来的规范学术英语"跟"AI 生成的规范英语"混淆?
这个问题在 2025 年 iThenticate 升级 AI 检测灵敏度之后变得比以前更突出了。在回答这个问题之前,先明确一件事——iThenticate 的 AI 检测不是为了"抓住作弊者"而设计的,它是为了给编辑和研究者提供一个关于文本生成来源的额外参考。它的角色跟相似度检测一样——给你一个数字,你需要根据自己的写作过程去解读这个数字的含义。
AI 检测的误判机制跟前几篇文章里详细聊过的非母语写作特征有深刻的关系。非母语学术写作者在统计特征上吃亏的几个维度,在 iThenticate 的 AI 检测里同样适用。词汇集中度——非母语写作者倾向于反复使用自己确定正确的有限词汇来表达同一类概念,而 AI 生成的文本在词汇多样性上也呈现出类似的模式——不是因为 AI 的词汇量小,而是因为 AI 在生成学术文本时也倾向于选择最常规、最安全的词汇。句式重复——非母语写作者学会了几个稳妥的学术句型之后会高频率复用它们,这种句式级别的规律性在统计上容易被识别为"模式化写作",而模式化恰恰是 AI 检测用来区分人类和 AI 写作的一个核心指标。语法准确性——你越努力把语法写对,你的文本就越缺少人类写作中自然存在的那些小瑕疵(偶尔的语法不规则、不完美的时态一致性、别扭的从句嵌套),而这些小瑕疵恰好是检测算法判断"这是人写的"的重要信号。
但非母语作者不应该因为这些统计上的不利因素就去错误地改变写作方式——"为了让 AI 检测分数低一点,我故意在论文里加几个语法错误"——这样做是本末倒置了。你应该做的是在你正常的学术写作流程里,有意识地增加语言的自然度。用长句跟短句交叉的节奏。在被标记为 AI 生成的段落里检查你的句子长度是不是过于均匀——如果一段话里五个句子全都是 20 到 25 词的长度,这种均匀性是 AI 生成文本的一个很强特征。把其中一个句子拆成两个很短的句子,把另一个句子扩写成稍微长一点的复合句——句子长度分布乱了,这段文字的统计特征就从"完美均匀"变成了"不够均匀",检测分数就会降。
还要看看你被标记的是哪些段落。如果 AI 标记集中在你论文的文献综述部分——那些高度模版化的表达如"It has been widely acknowledged that…""Previous studies have demonstrated that…"——这类标记的误判概率本身就比较高,因为全球学者使用的学术套话在统计上确实趋近于 AI 在同样任务下会生成的文本。你不用花太多精力去逐句改这些套话——把它们看作是 iThenticate 对"学术文体高度标准化"的一个附带标记。ithenticate查重的 AI 检测给你的提示是——"这段话在统计特征上看起来是模式化的"——"模式化"不一定意味着"AI 生成的",它可以仅仅意味着"这段话在规范上跟成千上万篇学术论文里的同类表达在统计上是雷同的"。
如果你确定你的论文是自己写的、没有大面积使用 AI 生成文本,而 iThenticate 的 AI 分数偏高——你可以把这份自己写作的实际情况连同你的写作过程记录(版本历史、笔记等)一并保留。在极少数情况下如果投稿编辑对你的 AI 分数提出了疑问,你的回应方式跟前面申诉信那篇里讲的类似——不是说"你们的检测不准",而是说"我的写作过程是完全可以记录和解释的,我在写作中使用了翻译辅助和语法检查工具,但稿件的核心内容和表述是我的独立创作"。ithenticate中文网站上对 AI 检测误判问题有更多详细的分析。ithenticate资讯网也在持续跟踪 iThenticate AI 检测的准确性和学术界的反馈。