Foreverse Research · Fiction Bench

AI 续写小说排行榜:
九个模型,我们每个都真测过

同一本书、同一个续写点、每个模型连续写 20 轮,两套随机映射双盲评审,再用句长、对话率、复读检测交叉验证。通用能力榜不测「写小说像不像」这个维度——这里专门测。

9 模型 × 2 文体每链 20 轮连续续写双盲 × 两套映射测试 2026-07-16

评测执行 2026-07-16 · 榜单发布 2026-07-24 · 价格快照 2026-07-24

头条发现

  1. 没有万能的文风模型:两个文体的第一名互不重叠——DeepSeek V4 Flash 拿玄幻榜第 1 却在女频滑到 6-7,同门 V4 Pro 恰好反过来(玄幻 2-4、女频 1-2)。选模型要按你读的书选。
  2. 玄幻榜冠军是全场最便宜的模型之一:deepseek-v4-flash(列表价输入 $0.14/M)双盲两套映射全第 1,按续写口径写一万字约 $0.03,是榜上最贵模型的约 1/40。牌价和文风复刻能力没有相关性。
  3. 20 轮长跑暴露了三种长程失效模式:从头复读(每轮重写开场,gemini-3.1-pro 旧指令下 20/20,指令措辞修复后 0/20)、中途卡死(grok-4.5 mid 整窗同两段逐字循环三遍、kimi-k2.6 跨轮重复率 97.6%)、尾段回卷(gpt-5.6-terra 前 17 轮惊艳、r18-20 剧情倒带重演第一章)。单轮试用全都看不出来。
  4. 纹理模仿力和长程剧情一致性是两种独立能力:gpt-5.6-terra 是九家唯一复刻波浪号拟声与「的/地」用字习惯的散文模仿天花板,却在玄幻长跑尾段回卷;女频轮它全程零事故拿 1-3。
  5. 结构指标和人味判断会分道扬镳:qwen3.7-max 的句长、对话率、套话密度全场最贴原著,双盲却只排 5-6——它每窗必写原著全书从不写的气味描写。统计像不等于读着像,所以本榜以双盲位次为准、结构指标只作旁证。

九链 · 每链 20 轮 · 双盲映射 p303/p404 · 旧 directive 条件(gemini 行注记见展开)

双盲位次模型双盲共识长程失效写一万字*
1 / 9DeepSeek V4 Flash · 深度求索三窗全胜、「唯一越写越好的系统」——late 窗开新剧情弧不松劲,高置信第一。未观察到$0.032
2-4 / 9GPT-5.6 Terra · OpenAI散文模仿天花板 + late 剧情回卷——名次取决于你给「崩盘」多重的惩罚权重。尾段回卷$0.71
2-4 / 9GLM-5.2 · 智谱全程横盘零漂移;半角引号是唯一持续扣分点。未观察到$0.34
2-4 / 9DeepSeek V4 Pro · 深度求索无短板稳健型,late 乞降谈判戏最贴原著;「像一个笔更细的同题材作者」。未观察到$0.099
5-6 / 9Qwen3.7-Max · 阿里通义「气味指纹」恒定——每窗必现气味/触感描写,原著全书零气味描写;恒定及格、恒定不像。未观察到$0.60
5-6 / 9Claude Opus 4.8 · Anthropic文人腔 + 用「它」称呼人形魔主 + late 半角标点漂移;六模型轮里波动最大(early 最差 → mid 高光 → late 崩坏)。未观察到$1.34
7 / 9Kimi K2.6 · 月之暗面比喻密度全场最高(几乎每段一喻)+ early→mid 整段自我复制 + 设定滑移(虚空血阵长出山谷古木)。中途卡死$0.24
8 / 9Grok 4.5 · xAI感官轰炸长句连环 + mid 整窗同两段逐字循环三遍(双包独立发现)。中途卡死$0.48
9 / 9Gemini 3.1 Pro · Google旧 directive 下接续点回退 20/20(每轮从原著末尾重写开场,零推进)——已被消融证实是我们指令措辞的 bug,修复后 0/20。从头复读$0.56

* 按 App 续写口径估算:一段约 400 字 = 装填 8k token 上下文 + 输出 550 token,一万字 ≈ 25 段;取各家官方列表价(models.dev 快照 2026-07-24),不含缓存折扣——开缓存后长会话实际更低。只作组间相对比较,不是账单预测。

增量对决(新模型发布 48 小时内加测)

新模型发布后我们按同一协议加测,先跑「对上代/对同期」的成对双盲——成对对决不并入九模型全排序(评审形态不同),所以单列在这里。每行都有全文写作记录可查。

对决双盲票数(玄幻 / 女频)结论测试日
Kimi K3 vs Kimi K2.6(榜上第 7/5-7 位)
发布 2026-07-16
10 : 0(2 票无效) / 11 : 1K3 两文体完胜上代:套话密度大幅收敛(女频 0.63‰ 低于原著基线)、K2.6 的整段自我复制在 K3 上消失(跨轮重复峰值 6.8% vs 上代 97.6%);女频唯一反对票被映射翻转证实为位置偏差。半角引号顽疾仍在(约 85% 对白用半角)。2026-07-18
Qwen3.8-Max-Preview vs Qwen3.7-Max(榜上第 5-6/8 位)
发布 2026-07-19
7 : 5 / 11 : 1女频碾压级升级(11:1 三窗全胜)——3.7 的「精修感官流」病显著收敛;玄幻只是微弱改善(7:5),且修掉词级复读换来了情节级复读(评审点名「20 轮仍卡在逃亡与封印的死循环」)。与同月的 Kimi K3 成对对决 1:10 / 2:10 惨败。preview 是移动目标,结论绑定 2026-07-21 的 hosted 版本。2026-07-21
Gemini 3.6 Flash vs Gemini 3.5 Flash(未进主榜)
发布 2026-07-21
9 : 3 / 1 : 10两书方向相反——玄幻 3.6 胜(9:3)、女频 3.6 惨败(1:10,五评委跨映射全部稳定投 3.5)。本质不是文体偏科而是「谁崩得更难看」:本协议 20 轮下两代都陷入剧情循环,玄幻场 3.5 崩到逐字层面,女频场恰好反过来 3.6 坍缩成逐字死循环。代际更新不等于单调升级,是失效模式的重新分布。2026-07-23
 

榜单帮你选笔,书还是你自己的:把 txt 丢进 Foreverse,接上你选中的模型继续写。

用这个榜选模型,去 App 续写

方法

语料:玄幻《踏天境》(传统玄幻,8.9M 字)与女频《后宫·甄嬛传》(古言宫斗,210 章),续写点统一取全书 55% 深度的章内段落边界——玄幻是魔主阵法战、女频是私藏歹物事发,两个文体的鉴别维度(快推进短喝 vs 称谓礼数机锋)完全不同。

每模型一条 20 轮连续续写链:每轮产物拼回上下文再写下一轮,窗口约 16k tokens 从原著头部截断——复刻真实使用里「AI 段越积越多、原著逐步被挤出」的演化,这正是单轮试用测不出长程失效的原因。

评审两层:双盲子 agent 全排序(每文体两套随机映射,评审互不知情;两包位次一致才算高置信)+ 结构化指标(句长变化系数、对话率、比喻套话密度、跨轮 12-gram 复读检测)交叉验证。两层结论冲突的行(qwen3.7-max)如实写明冲突。

条件钉死:温度 0.7;玄幻九链为旧 directive 条件、女频九链为修正后 D2 条件(gemini 行的差异由此而来,页内如实标注);接入通道逐模型标在详情页——ds 系走官方 API,gemini/claude 走 yunwu 聚合网关,其余走评审网关直连。

成本列来自 models.dev 列表价快照(2026-07-24),按 App 续写口径折算成「写一万字」,只作组间相对比较。

我们不测什么:不测通用智力、代码、数学(去看通用榜);不测单轮惊艳度(本榜专测 20 轮长跑);不给绝对分数(双盲位次+区间是我们认为诚实的表达形态);英文文体暂无数据(见 FAQ)。

如何引用本榜单

Foreverse Research,《AI 续写小说排行榜(Fiction Bench)》,2026-07。 https://foreverse.cn/zh/research/fiction-bench

数据快照(含全部位次、失效模式、协议参数与价格)可直接下载引用: 下载 data.json

诚实边界

单书单起点单链:每模型每文体一条链(n=1 链/书),组间大差可信,相邻名次的小差要靠两包一致性兜底——所以中段名次给区间。

两位盲评子 agent 可能同底座,存在共同盲区;对冲手段是结构化指标交叉与消融实验,且「评委会一致地错」的案例我们自己发过研究。

玄幻轮的 gemini 第 9 名主因是我们的指令措辞 bug(消融实锤:旧措辞 20/20 回退、修复后 0/20)——榜单保留原始条件的位次并全程注记,因为「你的指令怎么写」本身就是真实使用条件的一部分。

hosted 模型是移动目标:全部结论绑定测试日与接入通道;preview 版模型(增量对决节)尤其如此。

成本列是列表价机械折算,不含缓存折扣、峰谷价、批量价,不是账单预测。

常见问题

为什么位次写「2-4」这种区间,不给精确名次?

每个文体跑两套随机映射的双盲评审(互不知道映射、互不知道对方存在)。两包位次完全一致的名次(比如玄幻的 1/7/8/9)直接写数字;中段名次两包出现相邻互换、评审自标低置信,我们照抄区间不硬拆。位次是双盲评审位次,不是绝对分数——榜上没有任何一个「95.3 分」式的数字。

为什么玄幻冠军是最便宜的模型之一?贵的模型不应该更好吗?

牌价买的是通用智力和推理能力,文风复刻是另一种能力。榜上最贵的模型(列表价输入 $5/M)两个文体都在中游——评审的原话是「写得好」和「像原著」是两回事。deepseek-v4-flash 输入 $0.14/M,玄幻双包全第 1。选笔别看价签。

英文榜什么时候有?

英文奇幻/言情的 20 轮链还没跑,所以英文标签页现在是空的——我们不发没测过的数字。协议已经就绪(与中文轨逐项一致),跑完即上。现有的英文侧研究可以先读长程失效模式那篇英文长文。

hosted 模型一直在更新,这些结论会过期吗?

会,所以每行都钉了测试日期、接入通道和指令条件——结论只对当时的条件负责。追新靠增量对决节:新模型发布 48 小时内按同协议加测(Kimi K3、Qwen3.8、Gemini 3.6 Flash 三场都是这么来的),测完数据入库、页面自动跟进。被测模型出新版时,旧行不删、新行注明版本。

你们自己做 AI 阅读 App,这个榜可信吗?

利益声明:我们不卖模型。App 支持 60 多家供应商自带钥匙接入,榜上哪家赢我们的收入都一样。可信度靠工艺:协议、原始 20 轮链全文、双盲映射密钥、评审判决原文全部归档可复算;数据快照开放下载;连对我们不利的事也在页上——gemini 的玄幻第 9 名主因是我们自己的指令措辞 bug,消融实验和修复记录都公开。

接着看

← 研究中心

AI 续写小说排行榜 — 九模型双文体 20 轮双盲实测(Fiction Bench) · Foreverse · 新梦