换一个平台,数字就可能完全变了
同一段文字、同一个版本,在一个平台可能接近 100%,换到另一个平台却可能是 0%。跨平台百分比采用不同的计算标准,需要按平台分别解读。
跨平台实测 · 13 段文本 · 10 个检测平台
这项实验使用 13 段 AI 生成的学术文本,涉及 10 个检测平台。把同一段文字提交到多个平台后,一个平台可能给出接近 100% 的结果,另一个平台却可能给出 0%。
判断修改效果,需要在学校最终采用的平台上进行前后复测。
AIGC 检测平台使用不同的模型、判断阈值和文本切分方法。各平台都会给出百分比,但计算标准和数值含义有所区别。
研究将同一段文字提交到多个平台,比较结果是否接近。实验显示,跨平台一致性较低,第三方检测结果与知网、维普等指定平台之间缺少稳定的对应关系。
在第三方平台从 80% 降到 20%,只能说明该平台上的结果发生变化。知网或维普的变化需要在对应平台上重新测量。
研究使用 13 段完全由 AI 生成的学术文本,包括 10 段中文和 3 段英文。把相同文本提交到多个检测平台,记录各平台给出的 AIGC 检测率,再比较同一文本的结果差异。
报告附录中,知网、维普和 Turnitin 的部分样本标记为未测试。因此,“13 段文本、10 个平台”表示整个实验的覆盖范围,完整测试数量以报告附录中的实际记录为准。
10 段中文、3 段英文,均为 AI 生成的学术文本
实验整体涉及 10 个检测平台
观察各平台输出比例的方向和差距
报告列出的四个极端案例中,同一段文本在不同平台上的最低值与最高值均相差 100 个百分点。
图中连接的是同一文本在不同平台上的最低值与最高值,用于呈现跨平台分歧。
对实际使用者而言,可靠的前后比较需要固定检测平台、版本和文本范围。
同一段文字、同一个版本,在一个平台可能接近 100%,换到另一个平台却可能是 0%。跨平台百分比采用不同的计算标准,需要按平台分别解读。
先在第三方平台检测并修改,再去知网或维普检测,前后数字的变化既可能来自文本修改,也可能只是两个平台的判断标准不同。
更有意义的做法是:修改前后使用同一平台、同一版本和同一段文本,再结合报告标出的具体段落判断变化。
Test 9 的原文保持不变,并分别提交给 QuillBot、维普和知网。三个平台给出的结果依次为 100%、95% 和 0%。同一文本仅更换检测平台,结果便覆盖了“几乎全部为 AI 生成”到“未检出”的完整区间。
同文、同版本,数据取自完整研究报告
三个数字均来自同一段未经修改的原文,差异来自检测平台的变化。
检测结果应按平台分别解读,并结合报告标出的具体段落判断问题和安排修改。
这里比较的是 AIGC 检测率。判断修改效果时,修改前后应在同一平台、同一版本下检测相同的文本范围。第三方平台适合快速查看表达特征,最终结果则以学校采用的平台为准。
确认学校、期刊或机构实际要求的是知网、维普还是其他平台,并把它作为最终复测口径。
修改前后使用同一平台、同一版本和相同文本范围复测,让数字变化能够对应到文本修改。
总比例提供整体概览,具体修改应回到标记段落,核对事实、术语、引用和表达结构。