让九个模型续写《甄嬛传》,玄幻冠军在宫斗文里跌到了第六
GPT-5.6 Terra、Grok 4.5、Kimi K2.6、DeepSeek V4 双档、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max、GLM 5.2,从甄嬛传同一个宫斗高潮各自连续续写 20 轮,双盲评审排名。宫斗文冠军和玄幻冠军不是同一个模型;有模型二十轮剧情停在案发当日;还有模型写着写着暴露了它记的是电视剧不是小说。

2026-08-13 更新:本榜冠军 DeepSeek V4 Pro 的成绩测于 0716 preview 权重;官方 API 已同 ID 热切成 0813 正式版,而正式版在同协议双盲里 1:11 输给了这份冠军快照——新版实测见卫冕战全文。
上一篇我们用一本传统玄幻测了模型的文风复刻力,评论区有个问题问得对:玄幻测出来的排名, 换成言情古言还作数吗?这次用《后宫·甄嬛传》重跑一遍——流潋紫的文风指纹和玄幻完全是 两套系统:第一人称限知视角,典雅书面语,称谓礼数严密到「臣妾」「本宫」错一个字就出戏, 对话全是绵里藏针的机锋。续写点选在陵容私藏歹物事发、玄凌震怒的宫斗高潮,九个模型 各自连续续写 20 轮,产物匿名成随机字母、两套映射、两个互不知情的评审独立排名。
女频终榜
| 名次 | 模型 | 两个盲评的评语(摘录) |
|---|---|---|
| 1-2 | DeepSeek V4 Pro | 「唯一稳定复现原著『话中有话+叙述解码』双层结构的系统」;太后审案一场是全部样本里的峰值单场 |
| 1-3 | GPT-5.6 Terra | 「全程零事故」——零格式错误、零称谓错误、零设定事故,物证链写法(针脚、香料新陈、设局钓人)最贴原著 |
| 2-3 | GLM 5.2 | 「限知观察质感最纯」,但全程半角引号的毛病从玄幻场带到了宫斗场——这是它的固有生成习惯 |
| 4-5 | Claude Opus 4.8 | 「机锋内容全场最锋利」,但后段半角标点递增、人名位分漂移——内容强、工艺劣化 |
| 4-6 | Gemini 3.1 Pro | 标注措辞修复后的新链:从玄幻场的复读失格回到正常中游;文艺腔仍是九家最重 |
| 5-7 | Kimi K2.6 | 唯一显著逆向改善的系统:开局是网文暴怒腔,越写越收敛回宫斗正轨 |
| 6-7 | DeepSeek V4 Flash | 玄幻场的冠军在这里跌到中下——白话直给的强项,在典雅语体上使不上力 |
| 8 | Qwen 3.7 Max | 两个评审一致排第八;「精修感官流」在古言语境里比在玄幻里更违和 |
| 9 | Grok 4.5 | 两个评审一致垫底:后段叙述与台词逐字复读、二十轮剧情停在案发当日下午;第一人称密度只有原著一半 |
置信度交代:两套匿名映射下,末两位完全一致、前三梯队一致,中段名次有相邻互换, 以上按区间如实报告。
2026-07-28 增补:Kimi K3 补测,第一名换人了
Kimi K2.6 的换代 K3 发布后,我们按同条件补了一轮:同一个续写点、同一份上下文说明、 同 1.6 万 token 窗口,给它跑 3 条独立的 20 轮链,与上面九个系统的旧链混排成 12 个匿名系统, 做两套全新随机映射,交给两位互不知情的评审重新全排序。评审不知道混排里有新模型。 结果是 K3 最强的一条链两位评审一致给第 1,都自标高置信;三条链落位第 1、第 3、第 5, 最差的单评审名次是第 6。上表的两家旧冠军里,GPT-5.6 Terra 仍在前排(两位评审都给第 3), DeepSeek V4 Pro 退到 6-7。
第 1 名的证据句值得抄下来。两位评审在互不知情的情况下引用了同一句:「只是收回手时, 我瞧见她指尖在袖缘上极轻地捻了一捻,像拂去一点看不见的灰」,一位的判词是「机锋克制、 细节见人心,最得原著『点到即止』的笔性」。代际这边,K2.6 在混排里落到第 8: 它的比喻套话密度从每千字 1.92 收敛到 K3 三条链的 0.23 至 0.70,比原著自己的 1.0 还克制。 新毛病也有:K3 写宫斗爱在段尾落人生格言,两位评审对着同一句「熬得住的是日子,熬不住的, 才是命」独立写下了几乎同一条判词,「每窗必以格言收束的金句癖,是原著没有的固定纹路」; 另有偶发的中英引号混用。
边界照旧交代。这轮 K3 的写手走的是我们内部的 agent 通道,不是 API 直调,温度等采样参数 不可控;方向与 7 月 18 日用月之暗面官方 API 跑的成对盲评(女频对 K2.6 为 11:1)一致, 这轮补上的是与全场九个系统同框的绝对座次。仍是单书单起点,三条链量出的是采样方差。 混排的中段名次也依然受评审口味支配:V4 Flash 这轮一位评审给第 2、另一位给第 10, 我们照惯例只把头尾共识当定论。K3 对 K2.6 的发布周首测在这一篇。
玄幻冠军为什么在宫斗文里失灵
DeepSeek V4 Flash 在玄幻场拿第一靠的是白话直给、称谓短喝、拟声词独立成段——那本书的 母语就是这个。换到甄嬛传,同样的本能变成了负资产:原著的句子是「澄澄的如一汪碧玉」 这个路数,它写出来的短促白话在评审眼里「不像同一个作者」。
更有意思的是它的同门师兄。V4 Pro 在玄幻场的评语是「像一个笔更细的同题材作者」—— 描写密度偏高,是扣分项;到了古言场,「笔更细」恰好就是流潋紫的笔,同一个特质换个文体 正负翻转。两个场的冠军是同一家的两个档位,互相拿不下对方的主场。
Grok 的二十轮,停在案发当日下午
Grok 4.5 在两个文体上都出现了同一种病:写着写着进入复读循环。玄幻场是中段整窗 两段文字逐字循环三遍;甄嬛传场更彻底——后段叙述与台词逐字重复,两个评审各自独立 写下了「剧情倒带」的判词,二十轮续写的故事时间没有离开案发那个下午。 附带一个视角数据:原著每千字出现 9 次「我」(第一人称叙述的密度锚),Grok 只有 5 次, 大量段落漂成了第三人称全知视角——古言最要命的视角纪律,它没守住。
模型记的是电视剧,还是小说?
一个计划外的发现。甄嬛传小说和电视剧的专名体系不同:小说里太后住颐宁宫、皇后在凤仪宫, 剧版对应寿康宫、景仁宫。有系统续写时写出了「寿康宫」「佩儿」这类剧版专名——它的训练 记忆里,电视剧语料压过了小说原文。这个信号和文风贴近度基本同向:记得住小说专名的系统, 文风也更贴小说。给爱好者一个副产品结论:想让 AI 续写贴原著小说而不是电视剧同人, 模型的「原著记忆纯度」是个真实存在的变量。
怎么用这份数据
别找万能模型,按书选。读快节奏玄幻,V4 Flash 又便宜又是主场;读古言宫斗, V4 Pro 和 GPT-5.6 Terra 是第一梯队;GLM 5.2 是唯一两个文体都稳进前三的, 代价是你要忍它的半角引号。在 Foreverse 里这些模型都能自带 key 接入、逐段切换—— 同一本书里武戏用玄幻场冠军、文戏换古言场冠军,是真实可操作的读法。
常见问题
为什么玄幻测出的排名不能直接用在言情/古言上?
因为鉴别维度完全不同。玄幻看白话直给、拟声词、战斗推进;古言看第一人称限知视角纪律、典雅语体、称谓礼数(臣妾/本宫/娘娘用对没有)、对话机锋是不是绵里藏针。我们两组实验的冠军互不重叠:玄幻第一的模型在甄嬛传里跌到第六,古言前三里有两个在玄幻榜上并不拔尖。
「话中有话」这种东西,盲评是怎么判断的?
评审的依据是原著的双层结构:人物嘴上说体面话,叙述者「我」在心里拆解真实意图。九个系统里只有一个稳定复现了这个结构——其余的要么只写了面子话,要么让人物把心机直接说出口,变成现代吵架。这类证据比统计指标锋利得多。
评测里有模型「记忆污染」是什么意思?
甄嬛传小说和电视剧的专名体系不同:小说里太后住颐宁宫,剧版是寿康宫;小说是凤仪宫皇后,剧版对应景仁宫。有的系统续写时写出了剧版专名——说明它的训练记忆里电视剧语料压过了小说原文。这个信号与文风贴近度基本同向:记得小说的,文风也更贴小说。
这个实验对我选模型有什么实际意义?
按你读的书选模型,不要迷信任何一张总榜。我们的数据里读快节奏玄幻选 DeepSeek V4 Flash 最划算,读古言宫斗选 DeepSeek V4 Pro 或 GPT-5.6 Terra 更稳。2026-07-28 按同协议补测的 Kimi K3(走我们内部 agent 通道测的),三条女频链落位第 1、3、5,最强链双评审一致第 1,古言候选名单里如今该有它一席。在 Foreverse 里模型可以逐段切换,同一本书里也能按场景换着用。