我们标定了 100 段语料:最「好猜」的文字,是真人写的
把五组带出处的语料逐段喂给一个 GPT-2 系探针小模型,数每段里有多少词落在它预测的前 10 名:真人网文中位 68.6%,反套话纪律下打磨的 AI 小说 59.7%,五家大模型直出续写只有 56.8%。「太好猜 = AI 写的」这条 2019 年传下来的判据,2026 年抓到的主要是人。这篇是完整的标定记录:五组语料、口径、倒挂的原因,以及这台「X 光机」剩下的正经用途。

先把结果摆在桌上。我们把 100 段带出处的语料逐段喂给一个 GPT-2 系探针小模型,数每段里有多少词落在它预测的前 10 名。真人写的套路网文,中位 68.6%;我们在反套话纪律下打磨出来的 AI 小说成品,59.7%;五家大模型的直出续写, 56.8%。
越是人写的,越好猜。越是机器直出的,越猜不中。这个顺序把市面上大半「AI 检测」工具的立身假设踩了个对穿。
「太好猜就是 AI」这条判据是怎么来的
2019 年,哈佛 NLP 和 MIT-IBM Watson 实验室发布了 GLTR:用 GPT-2 给一段文字逐词打分,实际出现的词落在模型预测的前 10 名就标红,1000 名开外标青。那个年代这招真管用:机器文本是模型从自己的概率分布里采样出来的,天然大面积飘红; 人类写作充满模型没料到的选词,青色斑驳。后来 GPTZero 把同族思路做成了商业检测器,核心信号就是困惑度加波动度: 文字太「顺」、太可预测,就判 AI。教师后台里那个「AI 率 92%」的百分比,多数就是这么算出来的。
判据的成立依赖一个前提:机器写的比人写的好猜。这个前提在 2019 年是事实。我们想知道它在 2026 年还剩多少。
实测怎么设的
五组语料,每组 20 段、每段中文 300–500 字(英文 1100–1600 字符),全部带出处:
| 组 | 来源 | 性质 |
|---|---|---|
| 中文 · 真人网文 | 五本真人写的类型网文全本(含《后宫甄嬛传》),各取 4 段 | 人写,套路成熟 |
| 中文 · AI 小说成品 | 我们的官方 AI 小说 5 本(《这条守则有死味》等),反套话纪律下写成 | AI 写,人工把关 |
| 中文 · 大模型直出 | DeepSeek v4 两档、Gemini 3.1 Pro、GLM 5.2、Claude Opus 4.8 对同一部玄幻的续写原始产物 | AI 写,零修饰 |
| 英文 · 公版经典 | 《傲慢与偏见》《福尔摩斯》《野性的呼唤》《德古拉》《盖茨比》 | 人写,1813–1925 |
| 英文 · AI 小说成品 | 我们的英文官方小说 5 本 | AI 写,人工把关 |
探针是文字 X 光浏览器里跑的同一份权重:中文轨是 6 层蒸馏版中文 GPT-2(q8 量化,73MB),英文轨是 DistilGPT-2(81MB)。离线标定和浏览器版同一运行时家族,2026 年 7 月 25 日跑完。两个读数: top-10 命中率(实际的词落在模型预测前 10 名的比例)和困惑度。段与段独立打分,给分位数,不做任何加权。
倒挂
| 组 | top-10 命中率(中位) | 困惑度(中位) |
|---|---|---|
| 中文 · 真人网文 | 68.6% | 26.3 |
| 中文 · AI 小说成品 | 59.7% | 52.9 |
| 中文 · 大模型直出 | 56.8% | 66.5 |
| 英文 · 公版经典 | 60.1% | 58.6 |
| 英文 · AI 小说成品 | 50.7% | 147.4 |
两种语言方向一致:人写的比 AI 写的好猜。中文侧三组的排序尤其扎眼——真人网文不光中位最高, 整条 p10–p90 区间(64.1%–70.9%)都压在大模型直出(51.7%–60.6%)上方。困惑度同样倒挂:按老判据, 困惑度 26.3 的真人网文该被判成机器,147.4 的英文 AI 小说该被判成莎士比亚再世。
两句诚实话。第一,区间有重叠:真人组里最难猜的一段(《后宫甄嬛传》的一段,57.8%)比 AI 成品组里最好猜的一段(66.2%)低了 8 个多百分点,所以拿单独一段文字问「这是谁写的」,这把量尺给不出答案:组级统计才有形状, 单段没有。第二,英文公版经典的「好猜」有背书效应:这五本书大概率就在探针模型的训练语料里,它不是在猜,是在背。 中文侧没有这层干扰,倒挂反而更干净。
量尺没坏,量错了东西
探针模型量的从来就是一件事:这段文字离它 2019 年前后的训练分布有多远。变化发生在量尺两头。
一头是模型变了。今天的大模型经过指令微调和偏好训练,输出分布早就漂离了 2019 年的网络文本,而我们取的直出续写又是零修饰的原始产物, 在旧量尺下自然处处「意外」。另一头更有意思:真人套路网文,恰恰是旧分布最浓的那部分。中文探针的训练语料就是中文互联网文本, 起点番茄式的句式是它的母语。工具里有个现成的演示:把「嘴角勾起一抹」贴进去,悬停在「抹」字上,弹层显示模型的第一押注是「丝」, 概率 65.6%——它押的不是这位作者的用词,是整个网文语料库的肌肉记忆。「勾起一抹」和「勾起一丝」,两句套话在互相竞争。

所以「好猜」翻译过来是「像 2019 年的互联网」,从头到尾都和「谁写的」没有必然关系。2019 年两者恰好相关,判据搭了顺风车; 2026 年相关性翻了面,顺风车翻了。这也解释了为什么 OpenAI 自家的 AI 文本分类器 2023 年 7 月就因准确率过低下线,也解释了误伤为什么总是砸向同几类人:写类型文的、文笔顺的、把某种文体练进肌肉的。
他们的共同点是离某个语料分布近。仅此而已。
剩下的用处,反而更实在
判决权收回之后,这台 X 光机还剩三件事,件件比「判 AI」实在。照模板腔:我们手写了一段把套话浓缩到极限的演示文本, 工具里扫出 71.4% 一猜就中、困惑度 17.3,比真人网文组的九成段落都「好猜」。套话和复读逃不出这面镜子, 这也是它对写作者的真实价值:满屏红的段落,就是你顺拐的段落。换贴《这条守则有死味》的第一章开头,57.0%, 落回 AI 成品的标定带内。同一把尺子,量出来的是模板密度,与作者身份无关。
再就是看个新鲜:悬停任何一个词,你能看到一个语言模型在那个位置押的前 5 名和各自概率。「下一个词的概率分布」这个被说烂的概念, 第一次变成肉眼可见的东西。三条标定区间直接画在结果卡里,你的文字落在哪条带上,自己看。
工具在 /labs/text-xray,全程浏览器本地跑:点扫描后下载一次 73–81MB 的量化模型进浏览器缓存,之后逐词打分在你的设备上完成,文字不上传,断网也能扫。300–500 字的段落,扫描本身不到一秒。
最后交代量尺的边界:标定语料一共 100 段,探针只有一个,这是一份口径公开的量尺,不是真理。谁用别的语料、 别的探针复测出相反的顺序,欢迎来打我们的脸——口径都写在这篇里了,工具是现成的。
常见问题
GPTZero 这类 AI 检测器还能信吗?
依赖困惑度这一路信号的部分,不能单独定罪。我们的标定里,在探针模型量尺下最「好猜」的一组是真人写的套路网文(中位 68.6%),比大模型直出(56.8%)高出近 12 个百分点。按「太好猜就是 AI」的老判据,最先被冤枉的恰恰是文笔顺、写类型文的真人。OpenAI 自家的 AI 文本分类器早在 2023 年 7 月就因为准确率过低下线了。多信号综合的检测器不在此列,但任何单靠「AI 率」百分比下的结论,都值得多问一句它量的是什么。
为什么用 2019 年的小模型当探针,不用最新的大模型?
两个原因。第一,「困惑度判 AI」这条判据的原始形态(GLTR,2019)用的就是 GPT-2 系模型,我们要复核的正是这条判据本身;第二,工具要在浏览器本地跑、零上传,73–81MB 的量化小模型是体积上限。换更新的探针也改变不了机理问题:检测方的代理模型永远滞后于被检测的生成模型,量尺和被量对象不在一个年代,这正是这类检测天然的裂缝。
top-10 命中率和困惑度是什么关系?
同一件事的两种读数。模型在每个位置都会给全词表排一个概率序:实际出现的词排名越靠前、概率越大,困惑度就越低。top-10 命中率数的是「实际的词落在预测前 10 名」的比例,直观、可逐词着色(前 10 名红、前 100 橙、前 1000 沙色、1000 名开外青色);困惑度是全段概率的几何平均换算,对个别极端词更敏感。我们的标定两个口径都给,方向一致。
那 2026 年到底还能怎么识别 AI 文本?
诚实的回答:没有单指标银弹。我们自己走的是多条路互相补:规则层用套话词表加句式配额(对模板腔有效,但旗舰模型单发已经能绕开词表);评审层试过让大模型当裁判,结果校准实验里评委把真人文字判成 AI 的比例高达 88%,一致率高不等于判得对;最后兜底的还是人读。困惑度透镜在这套组合里的位置是「看纹理」,长于自查、短于指控。