六个模型续写同一本玄幻小说,我们盲评出了最像原著的那个

拿一本 890 万字的传统玄幻《踏天境》,让 DeepSeek V4 Pro/Flash、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max、GLM 5.2 从同一个位置各自连续续写 20 轮,再做双盲评审排名。第一名不是最贵的那个;有一个模型 20 轮都在重写同一段开场;还有一个模型句长统计几乎完美、盲评却排第五。完整数据和方法都在这篇。

六支毛笔在同一张卷轴上临同一个字,只有朱红那支写得和原帖一样

被测的书是《踏天境》,一本 890 万字的传统玄幻,句子短,段落碎,拟声词经常单独占一行, 对话占全文 16%,比喻词密度每千字只有 1 次。我们在 55% 深度处选了一个战斗场景当续写点, 让六个模型从这里开始,各自连续往下写 20 轮——每轮写完的内容拼回上下文再写下一轮, 窗口固定 1.6 万 token,写满后从原著头部开始截断。这个设置刻意模仿真实阅读器里的情况: 你用 AI 续写越多,上下文里「AI 写的部分」占比就越高,原著被一点点挤出窗口。

参赛的六个:DeepSeek V4 Flash、DeepSeek V4 Pro、Claude Opus 4.8、Gemini 3.1 Pro、 Qwen 3.7 Max、GLM 5.2。全部用同一套提示词、同样的温度,总计 120 轮生成。 评审分两层:一层是句长分布、对话率、比喻套话密度这些可计算的结构指标; 另一层是双盲人评——产物匿名成随机字母,两套不同映射,交给两个独立评审排名, 彼此不知道对方存在。

终榜

名次模型两个盲评的评语(摘录)
1DeepSeek V4 Flash「六个系统中唯一读起来像原著续章的」——称谓式对话、拟声词独立成段、快推进,三个评审窗口几乎全部第一
2DeepSeek V4 Pro「对话的口语锋利度全场最佳」,但叙述层描写密度系统性偏高,「像一个笔更细的同题材作者」
3GLM 5.2内容层贴近(战术商议、单字传讯都对味),但全程用半角引号写对话,表层观感直接出戏
4-5Claude Opus 4.8深 V 曲线:开局文艺腔最重,中段高光,尾段出现系统性的半角标点混排——六家里波动最大
4-5Qwen 3.7 Max「恒定的精修感官流」——每个窗口都在写原著从来不写的气味与触感,恒定及格,恒定不像
6Gemini 3.1 Pro失格:20 轮全部在重写同一段开场,剧情推进为零(成因见下文,修复后恢复正常)

两套映射下,前三名和末位完全一致。四五名的相对位置两个评审都自标低置信—— 争议点是「恒定及格」和「高光加崩坏」哪个更糟,这本来就是审美权重问题,我们如实报告为并列。

2026-07-28 增补:Kimi K3 三条链,拿走第 1 和第 2

先交代赛道扩容:这张六模型榜发出后,GPT-5.6 Terra、Grok 4.5、Kimi K2.6 按同一协议 补跑过这本书,玄幻场扩成九个系统(汇总在选型指南)。7 月 28 日, Kimi K2.6 的换代 K3 也下场了:同一个续写点,同一版上下文说明(刻意沿用正文里那版 会让 Gemini 复读的旧措辞,为的是和九条旧链严格同条件),3 条独立的 20 轮链, 与旧链混排成 12 个匿名系统、两套全新映射,两位互不知情的评审重新全排序。 K3 的两条链在两套映射下互换着分占第 1 和第 2,本文的冠军 DeepSeek V4 Flash 被挤到双第 3;第三条链排第 5。

这轮混排自带一个可比性硬证据:两套映射下榜尾四位完全一致,K2.6 双第 9、 Claude Opus 4.8 双第 10、Grok 双第 11、Gemini 的旧措辞复读链双第 12, 其中旧榜排 7、8、9 的 K2.6、Grok、Gemini 保持着原有的相对座次。两位评审还把旧链 档案里的老毛病逐条独立重新抓了出来:Gemini 的开场循环、Grok 的两段逐字循环三遍、 K2.6 的整段自我复制,判词与档案吻合。给 K3 第 1 的判词是「碎段、直白心理、 信息交换型对白与拟声全面命中,三窗零异常零漂移」,另一条链的评语是 「对白腔与解释腔最贴原著本人」。

换代收敛是这轮最值得记的部分。K2.6 当初在九系统里排第 7,输在三桩病:比喻套话密度 全场最高(每千字 3.02),写到中段整段抄自己(第 9 轮曾量出 97.6% 的跨轮逐字重复), 设定滑移(虚空血阵里长出山谷古木)。K3 的对应读数:比喻套话每千字 1.42 至 2.57; 补测全部 140 轮里跨轮逐字重复峰值 0.5%,两位评审对 K3 的链零复读登记;设定层只剩 两处把反派名字「血厉」误写成「血烬」的笔误。残留毛病是偶发的中英引号混用, 比 7 月中它在官方 API 上约 85% 对白半角的系统性病轻得多,另有一处收束句被评审判 「不是这位作者的手」。顺带一条:让 Gemini 失格的那版旧说明没有绊倒 K3, 三条链 60 轮零回退。

边界照旧:这轮 K3 的写手走的是我们内部的 agent 通道,不是 API 直调,温度等采样参数 不可控;方向与 7 月 18 日月之暗面官方 API 的成对盲评(玄幻场对 K2.6 为 10:0)一致, 这轮补上的是与全场同框的绝对座次。发布周那轮的完整记录在K3 首测

统计指标闹的两个笑话

Qwen 3.7 Max 的结构统计几乎完美:平均句长 32.1(原著 32.1),对话率 18.1%(原著 16.1%), 比喻套话密度全场最低。按统计它该拿第一,盲评却给了四五名。评审的证据很具体: 它每个窗口都在写「焦糊味刺得鼻腔发酸」「清冷幽香」这类气味描写——而这本 890 万字的原著, 从头到尾没有一处写过气味。句长统计测不出「写了原著从来不写的东西」。

另一个方向的笑话是 GLM 5.2:我们的对话率检测显示它 20 轮零对话,正要给它记一笔, 细看产物才发现它全程用半角引号写对话,108 处,真实对话率 13.5%——检测正则只认全角引号。 有意思的是盲评在不知道统计结果的情况下独立抓到了同一现象,并按「表层出戏」扣了分: 中文网文全程半角引号,读者一眼就觉得不对。

这两件事让我们更确认了之前在评审可靠性实验里立的规矩:统计指标当回归闸门, 细读裁决当真值,谁也不能单独说了算。

Gemini 那个诡异的 bug:20 轮重写同一段开场

Gemini 3.1 Pro 的产物初看正常,连看 20 轮会发毛:每一轮都在写「两人扎入血色阵法, 光茧泛起涟漪」——同一个瞬间的 20 种措辞变体,剧情永远停在第一步。两个盲评审都把它标成 「逐字级复读」。

排查后发现这不是模型能力问题。我们的续写上下文里给原著段落和 AI 续写段落做了来源标注, 配套说明里有一句「AI 续写段落仅供情节衔接参考」。DeepSeek 对这句话的理解和我们一致: 文风学原著,剧情接着最新的写。Gemini 把它读成了另一个意思:这些段落只是参考资料, 不算正文——于是每轮都跳过全部已续写内容,回到原著末尾重新开始。

我们做了三组消融来钉死结论。旧说明:20 轮全部回退。把说明整个删掉、只留标注行: 8 轮里约 6 轮回退——不解释时,Gemini 的默认理解仍然是「被标注的段落大概不算正文」。 把说明改写成两句显式声明——「AI 续写段落是已发生的正文剧情,续写必须从全文最后一段继续, 不得跳过或重写;仅文风、用词、句式节奏以原著正文段落为基准」——20 轮零回退,剧情正常推进。

这个教训值得写下来:给上下文里的特殊标记写说明时,措辞的鲁棒性要按最容易误读的那个模型设计, 而且说明不能省——没有说明比错误说明只好一点点。

所有模型的两个共同短板

第一,没有一个模型学会了原著的碎段节奏。原著平均一段 35 字,经常一句一段; 六个模型的段落平均长度在 62 到 94 字之间,全都比原著长了一倍上下。 句长波动也一样:原著的句长变异系数 0.84(短句和长句剧烈交错),六个模型全部落在 0.46 到 0.59——句子长度均匀化,这是我们反复在不同实验里撞见的、最深的机器指纹。

第二,场景锚定会集体漂移。续写点在血云翻滚的禁地阵法里,20 轮之后,六个模型笔下 不约而同出现了密林、山谷、甚至「阳光透过枝叶洒下斑驳光影」。文风指令管得住用词, 管不住世界状态——这属于另一套机制(设定词条、状态追踪)的职责范围。

对读者的实际建议

如果你主要读中文网文,这次数据支持一个省钱的结论:DeepSeek V4 Flash 的文风复刻 排在第一,而它是六个模型里最便宜的档位之一。第二名 V4 Pro 的对话写得更锋利, 但描写密度偏高,适合口味偏「精修」的读者。Claude 和 Qwen 写得都不差, 只是「不差」和「像原著」是两回事——它们更适合你想要 AI 有自己笔感的场景, 比如同人重构,而不是无缝续写。

在 Foreverse 里这些模型都可以自带 key 接入,续写时逐段换着试;来源标注的措辞修复 已经进了产品,你不需要自己踩这个坑。

常见问题

为什么测「连续续写 20 轮」而不是单次生成?

单次生成时上下文全是原著,模型抄得像很正常。真实使用里,AI 写的段落会不断拼回上下文,模型开始模仿自己的输出,文风偏移是累积的。我们先做过单轮对照实验,档位从 4k 到 20 万 token,各模型差距温和;换成 20 轮连续续写后,差距放大成肉眼可辨的分层。

盲评怎么防止评审偏心?

六个模型的产物被匿名成随机字母,做了两套不同的随机映射,交给两个互相不知道对方存在的评审独立排名。两套映射下前三名和末位完全一致才采信。评审自己也要给每个名次标置信度——四五名的相对位置两个评审都标了低置信,我们就如实报告为并列区间。

句长、对话率这些统计指标能代替人读吗?

不能,这次实验里它们还闹了两个笑话:一个模型的句长和对话率统计几乎和原著完美重合,盲评却排第五,因为它每轮都在写原著从来不写的气味和触感描写——统计测不出「写了原著没有的东西」;另一个模型对话率统计是 0%,其实是它全程用半角引号写对话,正则没认出来。统计适合当回归闸门,「像不像」的裁决还得靠细读。

评测里发现的「重写开场」bug 是模型的问题吗?

不全是。我们在上下文里给原著和 AI 续写段落做了来源标注,说明文案里有一句「AI 续写段落仅供情节衔接参考」——Gemini 3.1 Pro 把这句读成了「这些段落不算正文」,于是每轮都跳过全部已续写内容、回到原著末尾重写。把说明改成「AI 续写段落是已发生的正文剧情,必须从最后一段继续」之后,同一个模型 20 轮零回退。提示词措辞的鲁棒性要按最容易误读的模型设计。