最简单的 AI 检测法:别读字,先看分段
一条 5 秒钟就能用的判据:真人中文网文段落平均 25–59 字、九成段落不超过两句、对话一律独段;模型写纯叙述默认焊出 108–538 字的大段,厚 4 到 19 倍。更有意思的是,我们十二轮盲评里所有 AI 评委对这条集体失明——它们读语义不读版面,人类先看排版再读字。附三步操作、真实数字,以及这条判据什么时候会失效的诚实声明。

2026 年 7 月的一轮人机盲测里,测试者给出答案的速度快得反常。事后问判据,回答是一句话: 「机器的就是只有 3 段,真人的就有十几段。」
没读完,甚至可能没细读。先看的是版面。
这句话把我们支使去做了一件本该更早做的事:把两边的分段习惯量出来。取六个真书抽样窗口 (《全职高手》《捞尸人》《大奉打更人》这类连载网文),再取我们实验里 27 篇模型稿件,只看纯叙述章节:
| 指标 | 真人连载网文 | 模型默认输出 |
|---|---|---|
| 段落平均字数 | 25–59 字 | 108–538 字 |
| 段均句数 | 1.06–2.11 句 | 四五句起步 |
| 不超过两句的段落占比 | 76%–100% | 低到没有统计意义 |
| 对话是否独段 | 一律独段 | 常与叙述焊在一起 |
差距是 4 到 19 倍。这不是文笔差异,是排版本能的差异:中文网文的碎分段是移动端阅读磨出来的, 手机屏幕一行 20 来个字,按章付费,追更节奏快,一两句一换行读着才不累。连载作者的手指头 已经把这件事自动化了。模型读过海量网文,但它落笔时执行的是「文章」的默认排版:一个意思一段, 段内把话说完。
更有意思的发现:AI 评委看不见版面
这条判据真正值得写一篇的原因在后头。我们的对抗实验前后跑了十二轮盲评,评委包括 GPT-5、Gemini 3.1 Pro、DeepSeek、GLM-5 和两代 Claude——没有任何一份判词提到过分段。 机器稿的大段焊在那里,一轮又一轮,所有模型评委集体视而不见。
原因想通了很简单:模型逐 token 读语义,换行符对它只是又一个符号,不构成「观感」。 人类相反,排版是进入文字之前的第一印象。于是出现了一个罕见的局面: 这条判据上,普通读者稳赢所有 AI 检测器。你不需要工具,不需要词表,数一段字数就行。
顺手一提:角色卡的标尺更碎
我们后来把同一把尺子伸进了 AI 角色扮演社区的热门角色卡。真人写的热门卡,开场白段落平均 21 到 39 字,比小说还碎,「???」单独成段、「算了。」单独成段是常规操作。 如果你在玩角色卡,看到一张卡的开场白是三大块每块一百多字的工整段落,基本可以断定 叙事部分是模型起草的。玩家嘴里的「一股 GPT 味」,有相当一部分就是这个视觉印象在起作用。
它什么时候失效
诚实的部分来了:这条判据我们自己已经攻破了。把「按网文习惯分段,段均 30 字上下,段落不超过两句」 写进任务书之后,模型一轮就把输出压进了真书的分段带。人类测试者看了新一批稿子,确认版面上 分不出来了。整个攻破过程花了不到一天。
所以它的适用范围要说清楚:对「知道这条纪律」的生成方无效,对故意伪装的文本无效; 对市面上绝大多数没做过分段调教的 AI 文本,它仍然一测一个准。把它当第一道粗筛用,快、免费、 不用任何工具;筛完存疑的,再上碎句、情绪、执行质量这些更深的判据。 完整的六条判据在这篇长文里; 想拿真题练手,盲测页的 8 段文本里就藏着 4 段机器稿—— 提醒一句,那里面的机器段是调教过分段的,光看版面赢不了。
常见问题
为什么模型写中文小说不会分段?
模型按「文章」的默认排版走:一个意思一段,段内四五句起步。而中文网文的碎分段是移动端阅读进化出来的排版本能——手机屏幕窄、按章付费、追更节奏快,一两句就换行读起来才不累。我们实测 27 篇模型稿件,纯叙述章节的段落平均 108 到 538 字;同题材真书的段落平均 25 到 59 字,差 4 到 19 倍。
AI 检测工具为什么不用这条判据?
我们十二轮盲评里,所有参与的大模型评委对分段密度集体失明——没有一份判词提到过版面。它们逐 token 读语义,段落边界只是又一个符号;人类恰恰相反,先看到排版再读进文字。这可能是少数「人类稳赢机器评委」的判据,也是它值得写下来的原因。
这条判据会失效吗?
会,而且我们亲手让它失效过。把「按网文习惯分段」写进任务书后,模型一轮就把段落压进了真书的 27–53 字带,人类测试者随即表示这条判据不再好使。所以它对「知道这条纪律」的生成方无效;但对市面上绝大多数默认输出的 AI 文本,它仍然一测一个准,而且只要 5 秒钟。