Labs · AI 还是真人?
8 段网文,4 段出自真人连载。
你能挑出机器写的另外 4 段吗?
真人段是已出版网文的原文短引(每段不超过 60 字,标注书名);机器段来自我们十六轮 「写→盲评→归因→改规程」的仿写实验——十个主流 AI 评委在同类盲池里识破率 0%, 还把真书原文批成 AI。答完逐段讲判据。
免费 · 零账号 · 8 段 2 分钟 · 答完才揭晓
祝老太听见东边石板路上有脚步声,不是镇上人的脚步,镇上人穿布鞋走石板是闷的,这个脚步带着点拖,像穿了双不合脚的鞋。
只凭读感判断。全部选完才揭晓——每一段都会告诉你:它暴露了哪条判据,或者它为什么骗过了 AI 评委。
这个工具怎么来的
两侧语料:真人段 = 四本已出版中文网文(《那年花开1981》《全职高手》《捞尸人》《此间的男神》)的原文短引,逐字保留、每段不超过 60 字并标注出处——评论与研究目的的适当引用。机器段 = 我们 2026 年 7 月文风仿写实验(十六轮迭代、三十多篇稿、上百组盲测段落)的自有产物,取自 GLM-5.2 与 Claude Opus 5 在第 12–14 轮的稿件,包含守门员置信 55 的最难判段。
一句坦白:因为真人段有 60 字引用红线,机器段(40–74 字)整体比真人段(30–51 字)略长。如果你按「长的是机器」来猜,恭喜你找到了本页自己的排版指纹——但那是本页的制作约束,不是 AI 文风判据,判完请对照逐段讲解看你用的判据对不对。
判据出处:六条判据全部来自实验中五次人类盲测的原话归纳,经与写手同代的 Claude 思考型守门员归因和真书取证固定。对照锚「十个 AI 评委识破率 0%」来自终局两轮测试——三个从未参与迭代的模型评委面对十机十真的混合池,一段机器稿都没挑出来,配对题全错。
它做不到什么
8 段是短窗口:「段落焊成大块」「一批文本全是同一个腔」这两条要看整章、看一批才成立的判据,放不进本页——完整六条去读判据长文。
短窗口内有真判不动的段:第 5 段在我们内部守门员那里置信只有 55(50=掷硬币)。答错不丢人,这正是「执行质量过好」这条判据治不了的证据。
这不是检测器,我们也不发证书:情绪判据已经被机器学走(第 7 段就是证据),单条判据都会过期。真正稳定的信号是批量层面的整体纹理,那需要比 8 段多得多的样本。
常见问题
「真人段」是哪来的?版权怎么处理?
四段真人文本分别出自《那年花开1981》《全职高手》《捞尸人》《此间的男神》四本已出版的中文网文,每段不超过 60 字、逐字保留原文并标注书名与作者——这是以评论和研究为目的的适当引用,用来说明「真人文字长什么样」这一个问题。机器段全部是我们自己实验的产物,不涉及第三方版权。
为什么说 AI 评委在同类盲测里识破率是 0%?
2026 年 7 月我们的仿写实验终局测试:把守纪律的机器段混进真书原文段做成盲池,交给十个主流模型评委(GPT-5、Gemini 3.1 Pro、Qwen、DeepSeek 各档、豆包、GLM-5 等)。两轮下来没有一段机器稿被挑出来,十五组配对题全错——而且方向是反的:它们把机器稿夸成「烟火气」「老作者手笔」,把《斗破苍穹》这类真书原文批成「套路化、说明书腔」。唯一的例外是与写手同代的 Claude 思考型模型,判据和人类一致。
判断「AI 还是真人」的六条判据是什么?
来自五次人类盲测的归纳:一、一批文本全是同一个腔;二、句子剁得太碎、每句都绷着「在写作」的劲;三、执行质量过好,挑不出一处失手;四、段落焊成大块,不按网文习惯分段;五、停下来品鉴质感的「X 是 Y 的」鉴赏句;六、闲笔里没有情绪——人闲着,情绪不闲。本页每段揭晓时会标出它对应哪条。前两条能修,第三条治不了:给模型下任何修复指令,它都会执行得太到位,而「太到位」本身就是新指纹。
有的机器段是不是几乎判不出来?
是,我们如实放了进来。第 5 段(收钱那段)在我们内部是全实验最难判的机器文本之一——与写手同代的 Claude 思考型守门员对它的置信只有 55,50 就是纯掷硬币。第 7 段则是机器学会「情绪挂载」之后的产物,专门用来打「有情绪就是真人」这条经验。答错这两段不说明眼力差,说明单条判据都有失效窗口。