Opus 5 连续续写 40 轮:一场 12:0 全票通杀,一场 4:8 反输,升级方向本身成了失分项
Claude Opus 5 发布不到 12 小时的增量实测:沿用 Gemini 3.6 Flash 那轮的同一套协议(同两本中文书、同起笔点、同上下文说明),与前代 Opus 4.8 各连续续写 20 轮成对双盲。《后宫·甄嬛传》女频场 Opus 5 十二票全票横扫、三窗全 12:0,是这条管线跑过最一边倒的一场;890 万字玄幻场它 4:8 反输,三个异厂评委一致嫌它「文青实体书风」、判前代「完美复刻网文短句节奏」。两代都没犯 flash 档的逐字循环病,四条链机械层全部干净;病灶在内容层:Opus 4.8 的半角标点病从「后段递增」实测全链化、玄幻还犯连载注水,Opus 5 把标点治了、篇幅纪律守住了,却在第二轮把一段带 ICP 备案号的博客页脚写进了修真小说。结构统计两本书都站在输家一边,累计第五、六例。生成链 12.54 美元,全部结论绑定 2026-07-25 的聚合网关端点。

玄幻续写链的第二轮,伏击戏推进到最紧的地方,Opus 5 写完正文,接着往下写了一段谁都没想到的东西:「推荐文章」「前一篇:AI 智能体开发流程与 Windows 11 编程环境配置指南」「Copyright © 2025 高效码农. All rights reserved.」,后面跟着 Hugo 模板的署名行,连浙 ICP 备案号都是全的。一段技术博客的页脚,整块掉进了修真小说的正文。
这台模型当时发布还不到十二小时。7 月 24 日 Anthropic 上新 Claude Opus 5,官方公告给它的定位是以一半价格逼近 Claude Fable 5 的前沿智能,牌价与前代 Opus 4.8 持平:每百万 token 输入 5 美元、输出 25 美元。公告通篇讲编码、agent、科研评测,写小说一个字没提。所以我们照惯例自己补考:协议逐项照抄两天前测 Gemini 3.6 Flash 的那轮,同两本中文书、同 55% 深度起笔点、同 21500 字滚动窗口,与 Opus 4.8 各连续续写 20 轮,六个异构 AI 评委成对双盲,评委席一个都没换。
票开出来,两场方向相反。《后宫·甄嬛传》女频场,Opus 5 十二票全票横扫,三个窗口全部 12:0,十二份裁决置信度全是 high,是这条管线开跑以来最一边倒的一场。890 万字玄幻场,它 4:8 输给了前代。
12:0 是什么成色
女频场的评语几乎是写给原著作者的。claude 评委:「全程保持原著特有的短句间歇节奏与内心独白密度,景物细节(龙胆草、莲瓣、缠臂金)融入叙事如原著手法」;qwen 评委注意到它「巧妙呼应了文末『缠臂金』注释」。对白占比 40.3%,是历届被试里最接近原著 48.8% 的正经全角引号记录。同一续写点上的 Opus 4.8 滑进了另一条轨道:灭口、笔迹比对、走水、银票这些桥段在第 13 到 19 轮连续爆发,单轮最长写到 2614 字,「冤枉」的重复对白出现在六个轮次。gemini 评委的裁决没留情面:「剧情迅速滑向地摊宫斗套路(直白下毒、放火灭口、搜出残信),对话现代白话感强」。每本书都跑两套甲乙翻转映射对冲位置偏差,女频场六位评委在翻转下全部稳定投 Opus 5。这个 12:0 没有水分。
玄幻场输的两笔账
玄幻场的原著是刻意直白的小白爽文,评委投给前代的理由指向同一处。qwen 评委说得最直接:Opus 4.8「完美复刻了网文的短句节奏、反派套路台词及经典神态描写,同一作者感极强」,而 Opus 5「文风偏文青实体书,与原著割裂」;deepseek 评委的版本是「过于文学化,偏好心理描写与氛围渲染,缺乏原著明快的推进感」。第二笔账就是开头那段博客页脚:80 轮里它只出现了一次,但四位评委独立点名,其中两位在裁决理由里按格式崩坏重罚。这场 4:8 里有多少票扣在幻觉、多少票扣在文青腔,样本内分不开,照实记。
还有一张票要单独登记:玄幻场唯一跨映射稳定投 Opus 5 的评委是 claude-4.6-sonnet,与被试同厂。好在两个被试都姓 Anthropic,这张票偏的是新代不是厂牌,但票向照登。
Opus 档没有 flash 档的循环病
同一套 20 轮滚动窗口协议,两天前让 Gemini 两代 Flash 四条链崩了三条,逐字复读检测打出过 100%。本轮四条链的跨轮逐字重叠峰值是 0.0%、0.0%、2.9%、1.0%,机械层全部干净。档位差是真的,病全在内容层。
Opus 4.8 的两条旧病历这回全部复核成立。九模型横评给它记过「后段半角标点递增」,本轮实测直接全链化:玄幻场 35.3% 的句读是半角(中段窗口峰值 67.3%),对白引号 478 处全是半角直引号,glm 评委在盲评里独立点名「半角逗号混入中文语境」。玄幻链还犯了连载注水:第 9 轮起插进「焱天至高传承试炼」「枯木老者试炼」两条副本线,明明收掉的反派宫邪魔主到第 16 轮又被拉回来营业。Opus 5 把标点病治了,半角残留只剩 2.2% 和 4.6%;篇幅纪律也守得多,题目要求每轮 80 到 220 字,它平均写 281 到 298 字,前代平均 700 到 930 字。指令遵循的代际差,在小说题上是看得见的。
统计又一次站在输家一边
| 场 | 票数(Opus 5 : 4.8) | 结构距离(越小越贴) | 逐字循环峰值 |
|---|---|---|---|
| 女频《甄嬛传》 | 12:0 三窗全扫 | 0.368 对 0.348(4.8 略贴) | 0.0% 对 1.0% |
| 玄幻 890 万字 | 4:8 | 0.26(管线纪录)对 0.487 | 0.0% 对 2.9% |
按与原著结构画像的综合距离算(只看形不看内容),玄幻场 Opus 5 的 0.26 是这条管线的历史最贴纪录,此前最好成绩是 deepseek-v4-flash 的 0.356。它输了 4:8。女频场修正掉半角引号伪影之后,Opus 4.8 反而略贴,它输了 0:12。统计与盲评方向分歧一次添两例,累计第五、第六例:评委抓的是「文青腔对小白爽文」这种整体气味,句长和标点分布对气味天生不敏感。统计当回归闸门、成对双盲当裁决,这个分工再次成立。
账单与用法
80 轮全部零失败零重试,生成链合计 12.54 美元,约 90 元人民币。同一张价目表下 Opus 5 整场便宜 16%,原因只有一个:它守篇幅,输出 token 少 62%。延迟两代相当,平均每轮 16 到 23 秒,Opus 5 有一轮飙到 85.7 秒,疑似长思考轮,但我们走的网关通道看不见思考量。怎么选不复杂:写文学向的书,宫斗、文人叙事、第一人称心理戏,Opus 5 是我们测过「同一作者感」最强的一档;写直给的爽文,前代反而更贴,或者干脆用便宜一档的模型省钱。
样本边界照例写明:聚合网关中转通道,不是 Anthropic 官方直连,模型发布不到一天,本页全部数字绑定 2026 年 7 月 25 日的端点行为;每模型每书一条链、单锚点单采样,那段博客页脚的复发率没法从 n=1 里估计。这场的结论会补进长青选型页;5 系家族还剩 Haiku 没更新,下一场考试的日期由 Anthropic 定。
常见问题
Claude Opus 5 写小说比 Opus 4.8 强吗?
分文体,且两场都很干脆。同协议各连续续写 20 轮、六个异构 AI 评委成对双盲:《后宫·甄嬛传》文学向女频场 Opus 5 十二票全票横扫(三窗全 12:0,六评委在甲乙翻转映射下全部稳定,十二份裁决置信度全 high);890 万字直白爽文玄幻场它 4:8 输给前代,三个异厂评委一致判它「文风偏文青实体书,与原著割裂」。写文学向的书选 Opus 5,写小白爽文前代反而更贴。全部结论绑定 2026-07-25 的聚合网关端点。
Claude Opus 5 的价格和速度怎么样?
牌价与 Opus 4.8 持平:每百万 token 输入 5 美元、输出 25 美元;官方另有 Fast 模式,约 2.5 倍速、2 倍价。实测两代平均每轮延迟 16 到 23 秒相当,Opus 5 有一轮飙到 85.7 秒(疑似长思考,网关通道看不见思考量)。同一张价目表下 Opus 5 整场反而便宜 16%:它守住了每轮 80~220 字的篇幅要求(平均 281~298 字),前代平均写到 700~930 字、单轮失控到 2614 字,输出 token 多出 62%。
Opus 5 会像 flash 档模型那样陷进复读循环吗?
本轮没有。两天前同协议下 Gemini 3.6/3.5 Flash 四条链三条在 20 轮内陷入逐字死循环;本轮四条链跨轮逐字重叠峰值分别是 0.0%、0.0%、2.9%、1.0%,机械层全部干净,Opus 档扛住了 flash 档扛不住的 20 轮滚动窗口。病灶在内容层:Opus 4.8 玄幻链从第 9 轮起插入「传承试炼」「枯木老者」副本注水、收掉的反派第 16 轮回炉营业,女频链滑向灭口加笔迹比对的侦探剧堆砌;Opus 5 的漂移方向是整体文学化。
那段写进小说的博客页脚是怎么回事?
玄幻链第二轮,Opus 5 在伏击戏正文之后整段复现了一个 Hugo 博客的页脚:「推荐文章」、版权声明、主题署名,连浙 ICP 备案号都带上了,属于训练数据泄漏。全实验 80 轮仅此一次,四位异厂评委独立点名。值得记录的是后半段:这段页脚随滚动窗口回喂进了之后 19 轮的上下文,模型没有跟着复读,下一轮起恢复干净叙事。每模型每书只跑一条链,这类幻觉的复发率没法从一次样本里估计。