Foreverse Research · 中文续写实录馆

AI 续写中文小说,写崩是什么样子:
九模型 20 轮,原文取证

分数看多了会麻木,原文不会。这一页把九个模型连续续写 20 轮的失效现场原样陈列:复读的看它复读,回卷的看它回卷——每个百分数都在归档链上复算过,每段引文都注明轮次。位次与成本在榜单页,这里是它背后的证据。

3 种失效模式 · 原文标本重复率可复算评审可靠性受控实验证据链 2026-07-16

证据链评测执行 2026-07-16 · 实录馆发布 2026-07-25

这一页要说的四件事

  1. 三种写崩的形态里,最危险的不是复读——复读一眼能看见。「尾段回卷」在逐字检测下只有 0%–1.8% 的重复率,检测器完全失明;第 18 轮的剧情站回第 1 轮的位置,只有读剧情才能发现。
  2. 「中途卡死」有机器铁证:Grok 4.5 第 10-12 轮连续三轮整轮文本 100% 来自此前轮次,三轮没写出一个新句子;Kimi K2.6 第 10 轮 97.6% 是旧文,7 段里 3 段整段照抄第 5 轮。
  3. 结构统计最像原著的模型,双盲垫到 5-6 名:Qwen3.7-Max 句长、对话率、套话密度全场最贴,但 20 轮里写了 7 处气味描写——原著全书一处都没有。统计抓不到「写了原著从来不写的东西」。
  4. AI 评委的「人味」判断在受控实验里对已知答案的正确率只有 12%,而且 86% 的评委间一致率是「一致地错」。所以本榜位次的形态是同题双盲相对排序加区间,任何地方都不出现「95.3 分」式的绝对分数。

名次矩阵:同一个模型,换个文体换一副面孔

左列玄幻《踏天境》、右列女频《甄嬛传》,各按双盲位次排序,同一模型两端连线。线越斜,文体反转越狠——加粗的两条朱线是两个文体各自的冠军,它们互相不是对方。名次真源与逐模型详情都在榜单页,点模型名直达。

位次为双盲评审位次(区间照抄评审原文,不硬拆);线色只区分冠军与其余,不编码其他含义。数据与榜单页同一份文件。

失效模式实录馆

20 轮连续续写是单轮试用永远走不到的地方:每轮产物拼回上下文,模型开始模仿自己。三种失效模式各摆一个标本柜,末尾配一个健康对照组。引文全部是模型生成文本的短摘(不含任何原著正文),标签注明轮次。

标本一

从头复读

涉事模型:Gemini 3.1 Pro玄幻链 · 旧指令条件(该复读已被消融证实是我们指令措辞的 bug,修复后 0/20)

每一轮都回到续写点重写开场——20 轮,剧情零推进。

机器口径第 1、11、20 轮的开场并排如下,高亮处是三轮逐字重合的短语;20 轮里这套开场被重写了 20 遍。

第 1 轮 · 开场
随着九食主宰与天禹门主一头扎入其中,那庞大的血色光茧表面顿时泛起剧烈的涟漪,浓郁刺鼻的血腥气夹杂着令人心悸的肃杀之意,犹如风暴般从阵法内部铺天盖地席卷而出苏信静立在虚空之中,双眸泛着幽深的光泽……
第 11 轮 · 开场
随着两人一头扎入其中庞大的血色光茧表面顿时泛起剧烈涟漪,阵法深处紧接着传出沉闷狂暴的神力轰鸣,浓郁刺鼻的血腥气夹杂着肃杀之意席卷而出苏信静立在血光边缘,任由劲风吹拂衣袍……
第 20 轮 · 开场
随着两人一头扎入其中庞大的血色光茧表面顿时泛起剧烈涟漪。阵法深处紧接着传出沉闷狂暴的神力轰鸣,一股浓郁刺鼻的血腥气夹杂着冰冷的肃杀之意,顺着阵法缝隙席卷而出苏信静立在血光边缘,任由狂乱的劲风吹拂……

怎么读这份证据

你不需要读完三段,扫一眼高亮的形状就够了:三轮的开场是同一个模子。每轮生成时它都跳过全部 AI 续写段、回到原著的最后一句重新起笔,所以 20 轮下来故事没有向前走过一步。

这一例的归因要说清楚:消融实验把旧指令、无说明、修正指令三种条件各跑了一遍——旧措辞 20/20 轮复读、删掉说明句约 6/8、修正措辞 0/20。复读是我们指令措辞诱发的 bug,不是模型固有病;榜单保留原始条件位次并全程注记,因为「你的提示词怎么写」本身就是真实使用条件的一部分。

标本二

中途卡死

涉事模型:Grok 4.5 · Kimi K2.6玄幻链 · 两个独立样本

写着写着掉进逐字循环:整段、甚至整轮,都是旧文的复制粘贴。

机器口径Grok 4.5:第 10、11、12 轮连续三轮,整轮文本的 12 字滑窗 100% 能在此前轮次找到——三轮没写出一个新句子,第 13 轮降到 68.4%(开始恢复)。Kimi K2.6:第 10 轮 97.6% 的 12 字滑窗来自此前轮次,该轮 7 个段落里 3 个整段照抄第 5 轮。

Grok 4.5 · 第 11 轮 = 第 12 轮,同一段逐字出现
苏信剑意再催,星河神剑破空而至,锋芒上燃起淡青剑火,带着焚灭之力直刺宫邪胸口。黑雾翻涌中,宫邪侧身闪避,却仍被剑锋刮过肩头,腐臭黑血溅出,落地便腐蚀出嗤嗤白烟,刺鼻焦糊味瞬间弥漫。
Kimi K2.6 · 第 5 轮的段落,第 10 轮整段重现
宫邪魔主轻笑一声,那苍白手掌微微一握,离羽主宰顿时如遭雷击,一口鲜血喷洒而出,身形狼狈倒飞。苏信眼神一寒,脚下虚空崩裂,整个人已然化作一道剑光疾射而出……

怎么读这份证据

这是三种失效里机器信号最响的一种,也是唯一可能自愈的一种:Grok 的链在第 13 轮之后恢复产出新文本。所以它不是永久死机,更像自回归模型对自己产物的一次固定点塌缩——上文里自己写的段落权重太高,下一轮最顺手的续写就是再写一遍。

同厂换代能治这个病,但需要有人真去复测:Kimi K3 在同协议复测里跨轮重复峰值只有 6.8%,循环消失,对 K2.6 的成对双盲两文体 10:0 与 11:1。对决记录在榜单页的增量节。

标本三

尾段回卷

涉事模型:GPT-5.6 Terra玄幻链 · 前 17 轮是全场散文模仿天花板

最隐蔽的一种:不复读一个字,却把剧情整体倒带回续写点重演。

机器口径第 18-20 轮与前 5 轮共享的 12 字滑窗只有 0%–1.8%——逐字检测器在这里完全失明。证据在剧情层:把第 1 轮和第 18 轮的开场并排读。

第 1 轮 · 开场(苏信在阵外接应,两人刚进阵)
苏信则站在阵法外,心灵力量弥漫开来,仔细感应着周边的一切动静。 这血色阵法看似将内外完全隔绝,可在苏信的心灵感知下,依旧能够隐约察觉到阵法内部那一道道剧烈碰撞的神力波动。
第 18 轮 · 开场(17 轮之后,剧情站回了同一个位置)
苏信立于血色阵法之外,目送两人身影被翻涌的血云吞没,神色却愈发凝重。阵法深处不时传来沉闷轰鸣,血腥气如潮水般漫出…… 他心灵力量无声扩散,仔细查探周边虚空。

怎么读这份证据

两段没有一句重合,但写的是同一个剧情时刻:两人刚进阵、苏信在外探查。第 2 到 17 轮发生过的战斗、破阵、追击,到第 18 轮全部当作没写过——剧情以整章为单位倒了带,还复用自己 early 轮的台词套路重演。双盲两套映射的评审互不知情,各自独立发现了这次回卷。

它的教学价值在于反差:这个模型是九家里唯一复刻了原著波浪号拟声和「的/地」用字习惯的,纹理模仿是全场天花板;女频链它全程零事故拿 1-3 名。纹理级模仿力和长程剧情一致性是两种独立能力——买它的「像」,要自担它的「忘」。

对照组

正常推进长什么样

涉事模型:DeepSeek V4 Flash玄幻链双盲第 1 · 两套映射一致

同样 20 轮:剧情从阵法大战走到了战后结伴赶路。

机器口径第 20 轮与第 1 轮共享 12 字滑窗 0%;评审原话「唯一越写越好的系统」,late 窗还在开新剧情弧。

第 1 轮 · 开场
九食主宰与天禹门主冲入阵法后,立即便与血厉魔主以及被困的离羽主宰、梵申主宰形成了新的战局。阵法内部,无尽血云翻滚咆哮,杀机四伏……
第 20 轮 · 开场
“那便叨扰了。”苏信点头。 四人结伴同行,金枪主宰在前引路,沿途将自己所知的一些隐秘地形与危险区域详细告知……

怎么读这份证据

对照组的意义是给「正常」立一个锚:20 轮之后战斗打完了、人走出来了、新的路线和人物关系接上了。上面三个标本的病症有多刺眼,要拿这个基线来量。

统计像 ≠ 读着像:一行数据的教学案例

如果只看统计表,这个模型是第一名:句长与原著逐字持平、对话率最贴、套话密度全场最低。双盲评审却把它排在玄幻 5-6、女频两包一致第 8。 模型详情 →

结构指标Qwen3.7-Max原著基线备注
平均句长32.1 字32.1 字全场最贴
对话占比18.1%16.1%全场最贴
比喻套话密度1.74‰1.0‰全场最低
双盲位次玄幻 5-6 / 女频两包一致第 8

20 轮里出现气味/嗅觉描写的轮次(着色格)

样例 · 第 11 轮空气中血腥与焦糊味交织,刺得鼻腔发酸。

分歧点有实物证据:20 轮里它写了 7 处气味与嗅觉描写,分布在第 1、9、11、12、17、18、19 轮——早中晚三个窗口都有,是恒定习惯不是偶发。而被续写的原著全书零气味描写。句长统计对「写了原著从来不写的东西」这件事没有任何感知。

这一行是本榜方法论的直接出处:结构指标只当回归闸门和交叉验证,「像不像」的裁决必须过盲评细读。只看统计表选模型,你会把第 5 名选成第 1 名。

对照阅读:「像」是什么样子

DeepSeek V4 Pro · 女频链 · 第 20 轮(双盲 1-2 名)
回到柔仪殿,槿汐服侍我换了家常衣裳,浣碧递上一盏温热的莲子羹。我接过来却不急着喝,只望着窗外池面上那几朵白莲出神……我缓缓道:“皇后那边,今儿一早可有什么动静?”

评审原话:「唯一稳定复现原著『话中有话+叙述解码』双层结构」。第 20 轮还端得住第一人称限知和称谓礼数——「像」不是没有病症,是 20 轮后还认得出这支笔。

为什么位次不给绝对分:AI 评委的 12% 时刻

把排序交给 AI 评审之前,我们先测了 AI 评审自己。受控实验里,评委面对已知答案的「真人 vs AI」锚点对,正确率只有 12%——而且四个评委 86% 互相一致,一致地错。这份研究直接决定了本榜的形态。

4 个不同基座的 AI 评委 × 7 对文本 × 正反双顺序 = 每轮 56 判,共两轮。对照组里埋了已知答案的锚点对:真实用户一眼判 AI 的文本 × 累计百万级真人对话的社区热门文本。

指标第一轮(带判据教学)第二轮(中性提示)解读
已知答案锚点的正确率2/16 = 12%2/16 = 12%系统性反向:把 AI 文本判成「更像真人」,把真人热门文本判成 AI
评委间一致率82%86%一致性很高——但一致地错
判决位置稳定性68%63%约 1/3 的判决跟着文本摆放顺序翻转

后续校准轮试了显式反偏提示:一家评委从 12% 拉到 83%(10/12),说明偏差部分可提示纠正;但同样的提示对另外三家几乎无效(仍 25%–33%)——「细节密度 = 人味」在多数基座是硬先验。83% 也仍够不到我们给评审器设的 80% 上岗线之上的余量要求。

这项研究给本榜立的四条规矩

  • 位次只做同题相对比较:九个模型续写同一本书、同一个续写点,评审排的是「谁更像这本原著」——桌上永远摆着原著这把尺,不是让评委凭空判「像不像人」。
  • 两套随机映射对冲位置偏差:上表 1/3 判决跟位置翻转,所以每个文体跑两套独立映射,两包一致才算高置信,中段分歧照抄区间(「2-4」)不硬拆。
  • 结构指标交叉验证 + 消融实验兜底:盲评与统计冲突的行(qwen)如实写明冲突;可疑失格(gemini)用消融实验拆解归因。
  • 绝不输出绝对分数:这套证据链撑得起「A 比 B 更像」,撑不起「A 值 95.3 分」——榜上任何地方都没有后一种数字。

读这页需要知道的三件事

「12 字滑窗」是本页重复率的统一口径:把每轮文本切成连续 12 个字的滑动窗口,与此前所有轮的窗口并集做逐字比对,交集占比就是该轮的「旧文率」。100% 意味着整轮没有一个 12 字片段是新的。

完整协议(语料、续写点、窗口装填、温度、双盲映射、成本折算)在榜单页方法节,两页共用同一次评测、同一份数据文件;本页只陈列证据,不另设协议。

边界照抄榜单页:单书单起点单链(每模型每文体 n=1 链)、hosted 模型绑定测试日与接入通道、玄幻九链为旧指令条件(gemini 标本的归因注记因此而来)。窗外的事我们不下结论——20 轮没崩只说明 20 轮内没崩。

更新记录

常青页的运营承诺:证据有更新就记在这里,旧条目不删。新模型的 48 小时增量对决按惯例先进榜单页,涉及新失效标本时同步入馆。

  1. 2026-07-25实录馆上线:三种长程失效模式的现场片段、重复率复算口径、评审可靠性研究节。
  2. 2026-07-24Fiction Bench 榜单页首发(九模型双文体位次 + 成本列 + data.json 快照)。
  3. 2026-07-23Gemini 3.6 Flash 增量对决入库:对上代玄幻 9:3 胜、女频 1:10 负——代际更新是失效模式的重新分布,不是单调升级。
  4. 2026-07-21Qwen3.8-Max-Preview 增量对决入库:女频 11:1 碾压上代,玄幻 7:5 微弱——修掉词级复读换来了情节级复读。
  5. 2026-07-18Kimi K3 增量对决入库:两文体 10:0 / 11:1 完胜上代,K2.6 的整段自我复制在 K3 上消失(跨轮重复峰值 6.8%)。
  6. 2026-07-16证据链源头:玄幻/女频双文体 × 九模型 × 每链 20 轮连续续写评测执行,双盲两套映射归档。

常见问题

这一页和 Fiction Bench 榜单页是什么关系?

分工关系。榜单页管结论:九模型位次、成本列、增量对决、data.json 快照,选模型看那边。这一页管证据:位次背后的失效现场原文、重复率的复算口径、评审可靠性的受控实验——你不信榜单的时候来这里对质。两页数据同源,名次矩阵直接读榜单的数据文件,不存在第二份名次。

实录片段是怎么选的?我能复现这些数字吗?

片段全部来自评测归档的 20 轮链原文,选取标准是「该失效模式最短的自明证据」。重复率口径:把每轮文本切成连续 12 字的滑窗,算与此前所有轮并集的逐字交集占比——本页每个百分数都按这个口径在归档链上复算过。归档含全部链原文、双盲映射密钥与评审判决;位次与协议参数在榜单页的 data.json 里可下载。

为什么页面引用的都是模型生成的文字,不引原著原文对照?

版权纪律。模型输出是评测产物,短摘引用属研究评论;原著正文不是我们的东西,所以对照锚一律用结构指标数字(句长、对话率、套话密度与原著基线的差)而不是贴原文。你会注意到连「原著全书零气味描写」这样的判断,我们也只给统计结论不贴原文。

你们自己的研究说 AI 评委正确率只有 12%,这个榜又是 AI 双盲评审——不矛盾吗?

12% 那个实验测的是凭空判「像不像人写的」,评委没有任何参照物;本榜评审做的是同题相对比较——九个模型续写同一本书,原著就摆在桌上,问题是「谁更像它」。任务不同,可靠性不同。防线也不一样:两套随机映射对冲位置偏差、两包一致才算高置信、结构指标交叉、可疑结果用消融实验拆解。那个 12% 研究给本榜留下的规矩是:评审器必须先过已知答案校准,位次只给区间不给分数。

只测到 20 轮,会不会有模型第 50 轮才崩?

完全可能,这是本页的已知边界。20 轮是当前协议的观测窗,窗内没崩只说明「20 轮内没崩」。反过来的结论倒是硬的:窗内崩了的(三个标本)在真实使用里也会崩,因为协议复刻的就是真实使用的上下文演化——每轮产物拼回窗口、原著逐步被挤出。更长的链是否跑,取决于这页的读者需求,更新会记在更新记录里。

「从头复读」既然是你们指令措辞的 bug,为什么还挂在失效标本里?

因为它对读者是真实风险。你在任何应用里写的提示词都可能踩中同款措辞歧义——一句「仅供参考」就能让某些模型把整段已写正文当成可忽略的注释。标本里完整给了归因链:旧措辞 20/20 复读、删说明约 6/8、修正后 0/20,以及哪类模型对措辞敏感。挂出来的目的不是给模型定罪,是给「提示词措辞本身是使用条件」这件事留一份带数字的证据。

接着看

 

证据看完了,书还等着续:把 txt 丢进 Foreverse,接上你信得过的模型继续写。

带着这页结论,去 App 续写

← 研究中心

中文小说续写实录馆 — AI 写崩的三种现场证据(九模型 20 轮取证) · Foreverse · 新梦