
英文稿的 AIGC 检测分数只能在同一段稿子 同一个系统的口径里比较跨工具比较基本没有意义——有高校做过实测100% 由 AI 写成的英文稿在 Turnitin 上能拿到 0%而 ZeroGPT 在一份千篇基准里把 18.4% 的人类文本判成了 AI。这篇写给正在写全英文课程论文的同学、要给中文学位论文配英文摘要的研究生以及准备投国际期刊的作者文中数据有的来自公开评测有的来自我们自己 2026 年英文校准批次的一手实测全部可回溯。1. 从一份 0% 的报告说起事情要从两类真实的稿件说起。一位商科同学的英文课程论文被系统标了高度疑似接近一半的段落飘红可里面的数据表是他自己熬夜跑出来的另一位同学拿着 Turnitin 报告上的 0% 来问这份稿子是不是可以放心交了——那份稿子是 AI 全文生成的。2025 年 9 月有高校做过实测同样 100% AI 写的英文稿就在 Turnitin 上拿到了 0%。两件事放在一起看结论自己就浮出来了分数高不一定是 AI分数低也不一定安全英文稿的 AIGC 分数比中文稿更不能只看一个数。这位商科同学后来的处理方式值得单独讲他只改了开篇三段的套话In recent years, … has attracted increasing attention. 这种年年中招的开头再把 Related Work 里整段同句式的转述改成条目式分数就回到了可交区间。稿子的骨头——数据、方法、结果——一个字没动。这个案例后面还会用到。2. 六个主流工具摆在同一张桌上写这一节之前我先把六家工具的官方口径抄在一张纸上抄完发现根本没法横比——各家用的数据集不同、阈值不同连准确率的定义都不一样。想看它们在同一场测试里的表现只能去找公开的第三方评测而这样的东西市面上并不多。工具技术路线公开口径公开准确率已知问题TurnitinTransformer 分类器为主 滑动窗口句级加权最低约 300 词官方口径 92%声称 AI 占比 20% 的文稿误报 1%另一份评测里 AI 检出只有 29%有高校 2025-09 实测100% AI 写的稿能拿到 0%官方承认非母语写作者更易被误判ZeroGPT免费在线检测同一基准 88.2%同一基准里人类误报率 18.4%GPTZero困惑度 burstiness 模型层同基准 98.7%人类误报 2.2%Sapling分类器同基准 88.6%人类误报 19.4%Originality.ai自研 Transformer ELECTRA 式判别器官方 98%另有评测 AI 检出 83%人类正确 96%Copyleaks分类器77%—把六个工具放在一张表里最扎眼的不是谁第一名而是公开准确率和已知问题两列之间的落差官方口径都在 90% 上下落到独立评测里Turnitin 的 AI 检出率有一份评测只给出 29%ZeroGPT 和 Sapling 的人类误报都在 18% 往上——近两成真人写的稿子要平白多跑一遍解释流程。表中带同一基准字样的数字出自 2026 年一份商业方组织的英文基准1,000 篇英文样本同时喂给各家商业方出的测试免不了带立场这些数字只拿来看趋势就好。3. 为什么同一篇稿数字差这么多原因不玄一句话概括每家检测器吃的数据和想保护的对象不一样口味就不同。原因说明技术路线不同统计信号困惑度 / burstiness· 判别模型序列分类器· 两者融合校准取向相反Turnitin 保守优先压误报Originality 激进追高召回改写会集体失效paraphrase 之后几乎所有工具准确率明显下降非母语文本高发句式与词汇变化少与机器特征重叠展开说两点。其一统计信号这一路看的是困惑度和突发性——机器写的文本用词分布更平人类写作则长长短短、起起伏伏分类器这一路是拿海量样本训出来的判别模型喂过什么数据就对什么口味敏感。其二校准取向决定了性格Turnitin 面对的是高校申诉场景宁可漏判也要压误报Originality 面对的是内容审核场景宁可错杀也要追召回。同一篇稿子交给性格相反的两个系统数字自然对不上。非母语写作者是最容易被误伤的一群——句式和词汇变化天然偏少恰好和机器特征重叠这一点 Turnitin 官方自己都承认。4. 我们自己跑的一次长文实测别人的评测终归隔着一层轮到自己上手才知道深浅。做英文校准批次的时候我特意留了一组标尺稿把 10 篇中文论文逐段机译成英文学术稿同一段字同时喂给我方两个英文检测分支——PCPASS en 分类器和统计信号分支。选机译稿是故意的机翻的痕迹重而且稳定标尺不容易晃。学科词数PCPASS en 分类器统计信号分支材料13,11795.79%81.58%生态9,02597.84%64.83%机械9,77092.44%51.75%金融9,01994.76%88.12%护理6,15097.47%21.56%教育6,98896.63%84.77%文学11,38895.42%76.85%真正的意外出现在护理那篇6,150 词的稿子分类器给出 97.47%统计信号分支只有 21.56%差了 75 个百分点。我们的第一反应是哪一边算错了把输入、切分、阈值挨个核了一遍——都没错它就是一篇让两种检测技术给出完全不同答案的稿子。这也把第 3 节的结论变成了我们自己的体感检测器之间不可互换连自家两个分支都不行。需要交代的是这批稿子的 Turnitin AI% 要人工上传后回填截至成稿还没回填完所以我们不引用 Turnitin 的实测数字——没有核对过的数一个都不写。5. 一条 447 字符的冒烟测试长文之外我们还拿一条 447 字符的英中混排短稿做了冒烟测试优化前 AI 占比 54.14%一轮优化之后 0.0%。丑话要说在前面——短样本的分数波动本来就大这是功能测试不是效果承诺。拿一次短稿的 0% 当护身符和拿 Turnitin 的 0% 当护身符是同一种冒险。6. 451 个段落样本里的抛硬币时刻整篇的分数还只是粗颗粒段落层面更接近抛硬币。校准批次里攒下的 451 个英文段落级样本中我挑出 6 个脱敏片段只截首句让四个检测器盲测——自己家的统计分支也在被测之列一样拿数字说话。片段实际来源PCPASS 统计外部分类器 1外部分类器 2外部分类器 31人类0.010.020.160.73判 AI2人类0.030.020.78判 AI0.153AI0.050.020.03漏0.00漏4AI0.020.020.610.105AI0.020.020.840.146AI0.020.460.320.04盯着第 2 行和第 3 行看就够了人类写的那句被外部分类器 2 判成 0.78判 AIAI 写的那句在另外两个检测器上是 0.03 和 0.00全漏。同一段文字在不同系统眼里一个天上一个地下。这就是我们在站内文章里反复写同一句话的原因单看一个工具的段落级数字约等于抛硬币。7. 真要动手改先少做三件事说完检测说改写。英文稿的降 AI比中文稿更容易走偏下面三件事是我们见过最多的弯路少做为什么整篇丢进中文大模型再译回英文痕迹往往更重只换同义词utilize→use 连环换对检测帮助有限还可能改坏术语删光所有被动句理工科方法描述需要被动要去的是空泛评价不是语法三条弯路背后是同一个道理检测器看的是统计特征不是语法对错。整篇丢进中文模型再译回英文等于把稿子又机翻了一遍痕迹只会更重连环换同义词对统计特征影响有限还可能把术语改坏被动语态是学术英语的正当语法理工科方法章该用就用——要清理的是 a novel framework that… 这类空壳评价不是语法结构。更稳的方向是短句、具体动词、保留数据与术语。开头那位商科同学就是这么改的动套话不动骨头。8. 和查重的关系两本账别混着算最后提醒一个最容易忽略的点英文库和中文库是两本账重复率过了不等于 AI 过了反过来也一样。课程要求双指标的时候分开报告、分开改别把查重的修改经验直接搬到 AIGC 上——最后用学校或期刊指定的那一个系统终测它说多少才是多少。交稿前的自查清单步骤动作1抄清指定系统名、测全文还是摘要、红线比例2用指定口径自测看高疑似段分布不只盯总分3高度疑似段按动套话、不动数据改写4改完用同一口径复测中途别换工具5终检以学校或期刊指定系统为准任何分数都不构成承诺利益声明本文出自 pcpass123.com提供 AIGC 检测等功能。