九家模型冒充真人写手,只有一家骗过了守门员

九家大模型拿同一份任务书写中文网文短章,混进真书段落做盲测,看谁能不被识破。排位和续写榜完全不同:续写双冠军 DeepSeek v4-flash 在这张考卷上垫底,Opus 5 靠「零收益的时间戳和不均匀的口癖」拿下全场唯一漏网。前三名的胜因全是「省事的错」:真错字、真口癖,装不出来。附十万字长跑的模型档案:Sonnet 5 套话失控 101 次,Grok 4.5 两跑两种崩法。

暖纸底插画:一排钢笔在公堂前列队应试,系着红绸的那支笔画出一道歪斜带墨渍的线,其余的笔画出完全均匀的直线

先报一个反直觉的数字。DeepSeek v4-flash 在我们九模型续写横评里拿过两种文体的双冠军; 换一张考卷,让它从零冒充真人写手写网文短章,九家垫底,被守门员一抓一个准, 置信 85,全场最高。

同一家模型,两个极端。原因不复杂:接笔和冒充是两种能力。续写有原文文气当拐杖, 贴得越紧分越高;冒充没有拐杖,模型自己的底色全部露出来。 这篇讲的就是「冒充」这张考卷:九家大模型,谁写的中文网文最难被认出是机器?

考场规则

每家写手拿到同一份任务书,逐字相同:一段真人网文锚文(学它的声口)、 一套反 AI 味写作纪律、三种叙事声音类型各写一篇短章。写手之间互相隔离。 产出混进同书的真人段落做成盲池,由守门员逐段判「人还是机器」并给出置信和理由。

守门员为什么不用 GPT 或 Gemini?因为我们先测了评委本身: 十个主流模型判「像不像真人」方向是反的,会把守纪律的机器稿当真人夸、把真书原文当 AI 批。 唯一与人类判定同构的机器评委是与写手同代的 Claude 思考型模型,它连续七轮 100% 识破、 零误伤,判词还给得出可复核的证据。所以这张考卷的裁判是它, 另配一名副裁交叉复核,遇到自家模型的稿子由对方主判。

九家过堂,成绩单如下,越靠前越难被识破。

排位写手战绩一句话归因
1Opus 5全场唯一让主裁判真(置信 72)零收益时间戳、口癖扎堆不均匀,像日记
2DeepSeek v4-pro一段漏网真错字「那到未必」被引为活人证据
3Gemini 3.1 Pro一段漏网,但有连抄前科同音别字像手打连载,抄袭风险另计
4-5GLM-5.2 / GLM-5一段骗过副裁,主裁全抓口语调料撒得太均匀
6Sonnet 5全被抓句子形状最像真人,整体执行质量出卖它
7Fable 5全被抓执行力太强,连装错都装得对称
8-9Gemini 3.6 Flash / DeepSeek v4-flash全被抓且置信最高说明书腔、设定自打架

逐家档案

Opus 5:赢在「写了没用的东西」

全场唯一一段让主裁真心判「人」的机器稿出自它。守门员事后归因,赢点是 「零收益的时间戳」和「口癖扎堆且分布不均匀」:一篇里转折连词清一色用同一个字, 换了段落又忘了这个习惯。这种不均匀装不出来,像真人日记的毛边。 在另一场十万字长篇对照里,它也是四个模型中唯一有「限量」意识的: 把最浓的文笔交给一个角色的台词,旁白保持克制。特征性弱点是越写越长, 章节长度到末段膨胀了四成。

DeepSeek v4-pro:一个真错字值千金

它的漏网段靠的是「那到未必」,一个真实的错别字。守门员的判词把它引为 「错别字懒得改」的活人证据。这不是工序的功劳,是这家模型中文输出里天然带一点毛边, 恰好落在机器最难伪造的位置上。注意和 v4-flash 区分:同一家的两个档位, pro 冒充次强,flash 冒充垫底,档位差在这张考卷上比想象中大。

Gemini 3.1 Pro:毛边加分,抄袭扣分

同音别字「量地」「逢了」帮它漏网一段,判词是「手打连载的真毛边,机器几乎不犯」。 但它有全场唯一的严重事故:换一种调用形态跑同一任务时, 它把任务书里的参考锚段逐字抄了三十多个字进正文,连原书名都写了出来。 同任务书、同模型、走另一条接口的版本没抄。用它做仿写, 防抄袭滑窗检查必须设为硬闸。

GLM 系:均匀是原罪

GLM-5.2 有一段骗过了副裁,主裁没放行。败因很典型:口语调料撒得太均匀, 一段里三个「嘛」,每段都俏皮,每段俏皮得一样多。真人的口语是一阵一阵的。

Sonnet 5:统计上最像,整体上露馅

句长、碎句这些形状指标,它是九家里唯一全线落在真人区间的,我们复核时反复确认过这一点。 照样全被抓,判词落在术语错位和「每段收尾都要总结点题」。它还有一份十万字长跑的旧账: 写到后半程,「带着一丝」写了 101 次,密度比前半恶化 4.8 倍, 章节长度从两千六百字衰减到一千一,是我们测过的模型里最陡的断崖。 形状对了,密度和耐力不对。

Fable 5:败给自己的执行力

我们内部产线用得最多的写手,也是这场实验的起点。它的问题一句话:任何写作指令都执行得十全十美, 而「十全十美」本身就是指纹。让它装个错字,它会顺手在下文把错字自纠了,纠得还很对称。 十几轮里它没有漏网过一次。

Grok 4.5:短跑选手,长跑事故

短章考卷上它平平无奇地被抓。真正值得记录的是十万字长篇对照里的表现:第一跑直接梗概化坍缩, 三十章只写出两万七千字,章均九百字;加了每章字数硬性条款重跑,坍缩转化成填充, 同一个「捋思绪」模板段落写了 18 处,还有整段文字逐字重复三遍的事故。 评委的判词很扎心:「前两章的语言是我这一轮读到的最好的一档,前二章我愿意签,全书我不敢签。」 它败在长程自我管理,不败在笔力。角色卡开场白这类短件,不必禁用它。

DeepSeek v4-flash:续写冠军的另一面

说明书腔,设定自打架,被抓置信全场最高。它和 v4-pro 的档位差、 它自己在续写榜和冒充榜上的座次反转,是这场实验最有用的提醒: 看到「某模型写小说第一名」的榜单,先问一句测的是什么任务。

贯穿九家的规律:胜因买不来

排进前三的段落,胜因没有一个来自写作工序,全部来自「真实能力缺陷产生的省事的错」: 真错字、真别字、真口癖。九家拿的任务书逐字相同,工序完全一致, 差距全在模型自己的底色上。

我们反向验证过:给不犯错的强执行模型下指令,让它主动写「省事的错」, 产出的错会整整齐齐落在最安全的位置,守门员当场判「做旧」。 错误的真实性无法用指令移植。想要像真人的产出,选型就是工序的一部分, 而且是排在最前面的那道。

给不同任务的选型建议

你的任务首选避开备注
从零写「像真人」的正文Opus 5,其次 DeepSeek v4-proDeepSeek v4-flash、Gemini 3.6 Flash选型比堆提示词有效
接着已有文气续写DeepSeek 系见续写横评,与本榜任务不同
十万字级长篇Opus 5Sonnet 5、Grok 4.5盯后半程:套话密度和章长衰减都是越写越重
短件(开场白、短章)Opus 5 / Grok 4.5 均可Grok 败在长程不败在笔力
用 Gemini 系仿写可用但设硬闸对参考语料跑 15 字滑窗查重,命中即重写

长篇另送三个便宜的机器预警器,都是这次实验里和人评结论完全一致的信号: 套话密度超过每万字 1.5 次要警惕;「一丝」这类高危词单独计数, 正常稿十万字十几次,失控稿能写到 149 次;末五章平均长度低于首五章的七成, 基本就是密度衰减的开始。

这张榜单的边界

三条诚实声明。第一,每家每种声音只写了一篇,被抓置信是上界不是精确值: 九家同题竞写给了守门员「多段撞车」的聚类线索,单篇混进真书实战里会更难判。 第二,GPT 系因为账号配额问题全程缺席,这张榜对它无话可说, 「GPT 味」这个词的本尊没进考场。第三,榜单测的是中文网文语域的短章冒充, 换语域换文体,座次会动。我们把它当方向性信号用,不当终榜供着。

实验收口那天,产线的写手配置改了一行:以假乱真场景的默认写手从 Fable 5 换成 Opus 5。 不是因为 Fable 写得差,是因为它写得太好了。

常见问题

写中文小说到底选哪个模型?

分场景。要「读起来像真人写的」短章或长篇正文,首选 Opus 5,DeepSeek v4-pro 次之。要接着已有的文气续写,DeepSeek 系反而是我们续写横评的冠军。要十万字级长篇,避开 Sonnet 5(套话密度后半恶化 4.8 倍)和 Grok 4.5(长程工艺崩坏),但 Grok 写短件不必禁用,它败在自我管理不败在笔力。

为什么续写强的模型,冒充真人反而垫底?

接笔和冒充是两种能力。续写时有原文文气可以贴着走,DeepSeek v4-flash 贴得最紧;从零冒充真人写手时没有拐杖,它的说明书腔和设定自打架就全暴露了。我们九家同题实测里它被守门员抓得最狠,置信 85,全场最高。选模型前先想清楚你的任务是哪一种。

「省事的错」是什么意思?为什么它是胜因?

排进前三的模型赢在真实能力缺陷产生的自然错误:DeepSeek v4-pro 写出真错字「那到未必」,守门员把它引为「错别字懒得改」的活人证据;Opus 5 的转折连词扎堆复用,像真人口癖。这些错装不出来。我们试过给不犯错的模型下指令让它写错字,它会错得很整齐,当场被判「做旧」。

AI 把参考语料整句抄进正文怎么防?

拿产出对参考语料跑连续 15 字的滑动窗口重合检查,命中即打回重写。这不是理论风险:我们实测里 Gemini 3.1 Pro 发生过逐字连抄任务书内参考段落 30 多字、连原书名都写出来的事故。用 Gemini 系做仿写任务,这道检查必须是硬闸,不能只做抽查。

哪个大模型写中文网文最像真人?九家写手同题过堂实录 · Foreverse · 新梦