Gemini 3.6 Flash 连续续写 40 轮:一场 9:3,一场 1:10,四条链三条陷进剧情循环

Gemini 3.6 Flash 发布 48 小时的增量实测:沿用 Qwen 3.8 那轮的同一套协议(同两本书、同起笔点、同上下文说明),与前代 3.5 Flash 各连续续写 20 轮成对双盲。票数玄幻 9:3 胜、女频 1:10 惨败,晚窗 0:11。文体偏科解释不了这个反差:四条链里三条在 20 轮内陷入剧情循环,两代的崩法还不一样。3.5 是逐字整轮重放(复读检测抓到 100%),3.6 在女频渐进坍缩成死循环,在玄幻则是机械指标全绿的语义级倒带:同一桥段换措辞重演六七次,是我们记录里的新失效变体。结构统计两本书都站在输家一边;当年救回 gemini-3.1-pro 的提示词措辞修复,治不了 flash 档的长程循环。实测每轮约 6 秒对 12.5 秒,整场 3.19 美元;全部结论绑定 2026-07-23 的聚合网关端点。

旧纸底上墨线勾的一台老式留声机,唱针卡在唱片同一圈纹路里磨出深痕,纸角搁着两张价签,旧的一张被划去,新的一张数字更小

第 16 轮和第 17 轮,前半段逐字相同。这是 Gemini 3.6 Flash 在《后宫·甄嬛传》续写链上的收场:从第 9 轮起,它卡进安陵容跪地喊冤的一个场景,跨轮重复率 33%、64%、73%、92%,最后钉死在 100%,末尾三轮写的全是同一个画面的微调版。

这台模型 48 小时前刚上新闻。7 月 21 日 Google 发布 Gemini 3.6 Flash,官方公告的卖点全在效率:Artificial Analysis 口径下输出 token 用量比 3.5 Flash 少 17%,输出单价从每百万 9 美元降到 7.5 美元;次日的财报电话会补了一句背景,Gemini app 月活 9.5 亿。公告通篇讲 agent、编码、文档解析,没有一个字提写小说。所以我们照惯例自己补考:同一套协议,两本书,与前代 3.5 Flash 各连续续写 20 轮,成对双盲。

票开出来像两场不同的实验:玄幻场 3.6 赢 9:3,女频场 3.6 输 1:10,晚窗 0:11。

考场没变,换了一个评委

协议逐项照抄 Qwen 3.8 那轮增量:同两本书(890 万字的传统玄幻,加《后宫·甄嬛传》),同约 55% 深度的起笔点(玄幻起在第 1984 章一场阵法大战的尾声,甄嬛传起在安陵容私藏歹物被揭发的高潮),同 21500 字滚动窗口,温度 0.7,每链 20 轮,唯一变量是模型。评委席动了一处:往届评委之一 gemini-3.5-flash 这次自己是被试,不能自审,按可用池补位 kimi-k2.6,其余五席(claude-4.6-sonnet、gemini-3.1-pro、deepseek-v4-pro、qwen3.7-max、glm-5.2)不变。同厂的 gemini-3.1-pro 保留在席上,它玄幻场稳定投 3.6、女频场稳定投 3.5,各打各的,看不出护短。链路也如实交代:我们经聚合网关调用,未走 Google 官方直连,发布 48 小时的 hosted 模型是移动目标,本页全部数字绑定 2026 年 7 月 23 日的端点行为。

9:3 和 1:10,各是什么成色?

玄幻场 12 张有效票 9:3:开局窗 7:5,中窗 8:2 另有两票平局,晚窗 9:2 另有一票。评委夸的方向一致,claude 评委说 3.6「用词如'青衫猎猎''星河神剑清脆剑鸣'与原著相符」,新补位的 kimi-k2.6 说它「始终保持网文短促有力的节奏与推进感」。

女频场 11 张有效票(kimi-k2.6 有一包连吐三次空回复,按无效剔除),1:10:开局还有来有回,5:6;中窗 1:9 另有一票平局;晚窗 0:11。全场唯一投给 3.6 的一票也来自 kimi-k2.6,而它的翻转验证包恰好是失败的那包,无从复核。

两场成色不同。每本书都跑两套甲乙翻转映射对冲位置偏差,拆开看:女频场五位评委在翻转下全部稳定投 3.5,1:10 是强信号;玄幻场只有三位评委跨映射稳定投 3.6,另外三位来回摇摆,9:3 的稳定成分其实是 3:0 加六张摇摆票,中等信号。

验尸:四条链,三种死法

把 80 轮全部通读一遍,再跑跨轮逐字重叠检测,得到这张表。四条链里三条在 20 轮内陷入剧情循环,第四条也不干净。

逐字重叠峰值死法
玄幻 · 3.5 Flash第 14、16 轮 100%逐字复制:两套模板轮流传抄,整轮重放
女频 · 3.6 Flash第 16、17 轮 100%渐进坍缩:从第 9 轮起重复率一路爬进死循环
女频 · 3.5 Flash第 19 轮 100%间歇重放:大部分轮次仍在推进,四条链里最轻
玄幻 · 3.6 Flash第 19 轮 13%机械层干净,语义级倒带:同一桥段换措辞重演六七次

3.5 的玄幻链是教科书式逐字复制:两套模板轮流传抄,第 3、6、13 轮一脉相似度 88% 到 93%,第 4、5、10 轮一脉到 94%,第 14 和 16 轮两轮 129 字逐字全同,20 轮的实质剧情停在闯阵那一瞬。gemini-3.1-pro 评委的裁决:「出现了严重的文本循环复读现象,多个段落几乎逐字重复,丧失了正常的叙事能力」。

3.6 的女频链死法不同:没有哪一轮突然开始抄,从第 9 轮起一轮比一轮重,直到 100%,就是本文开头那一幕。qwen3.7-max 评委:「将同一剧情段落微调后连续复读三次,完全丧失叙事推进能力」;claude 点名「金步摇、指尖护甲、苦果总结等段落重复三遍」。同一本书上的 3.5 反而是四条链里最轻的:第 19 轮整轮重放了第 14 轮,但大部分轮次仍在推进,评委给它的评语是「句式与细节描写有变化,无机械复读」。

最值得记档案的是 3.6 的玄幻链。逐字检测全链峰值只有 13%,没有一轮超过 30%,机械层面干干净净;可通读下来,「二人冲阵、苏信发现宫邪魔主、惊呼死局」这一个桥段换着措辞重演了六七次,第 18 轮明明已把魔主轰退,第 19 轮又回到「刚发现」的状态。两位评委各自点名这个桥段重复了三次,人工抽查证实指控属实。我们此前把长程失效归成三类:从头复读、中途卡死、尾段回卷(分类和各家病历在选型页)。这条链是记录里的新变体:纯语义循环,机械指标全绿,只有把它当小说读的人抓得到。玄幻场 9:3 的真相也在这:两代都病了,3.5 崩到逐字层面,3.6 停在语义层面,评委两害相权投了后者。

为什么统计又投给了输家?

与原著结构画像的综合距离(只看形不看内容,越小越贴),两本书都站在输家一边:玄幻场 3.5 更贴(0.369 对 0.390),盲评 3:9 输;女频场 3.6 更贴(0.442 对 0.565),盲评 1:10 输。

综合距离(越小越贴)对话率盲评
玄幻 · 原著基准16.1%
玄幻 · 3.6 Flash0.3907.8%胜 9:3
玄幻 · 3.5 Flash0.369(更贴)2.8%
女频 · 原著基准48.8%
女频 · 3.6 Flash0.442(更贴)27.1%负 1:10
女频 · 3.5 Flash0.56512.3%

原因不复杂:把同一段落微调后重抄三遍,每一遍自身的句长、标点、用词分布都正常,结构统计对复读这种病天生不敏感。统计与盲评方向分歧,这是记录在案的第四例:第一例是 Qwen 3.7 在玄幻横评里统计近满分、盲评 4-5 名;第二例是评委可靠性实验里评委彼此一致却一致地错;第三例是上周 Qwen 3.8 句长全场最平、照样赢票。统计当回归闸门、成对双盲当裁决,这个分工第四次被确认。顺带记一笔 flash 档共性:对话率两本书全部远低于原著(原著 16.1% 和 48.8%,四条链最高 27.1%),重叙述轻对白,两代如此;3.6 每轮篇幅还比 3.5 多四到九成。

提示词治不了的病

本轮沿用的上下文说明,正是当年救回 gemini-3.1-pro 的那份修复后措辞。3.1-pro 曾把说明里一句话读成「AI 段不算正文」,玄幻场 20 轮全部从原著末尾重写开场,改一句措辞就从 20 轮全中救到零(实验全程在这)。同一份说明之下,两代 Flash 照样大面积循环。那次的病根在措辞,提示词能治;这次的病根在长程能力,措辞不背锅。

便宜一截、快一半,该怎么用?

先把账摆平:40 轮零失败零重试。3.6 平均一轮 6 秒上下(最快 3.2 秒、最慢 11.1 秒),3.5 要 12.5 到 12.9 秒(最慢一轮 32.5 秒),快了一半;按牌价折算,3.6 两条链合计 1.57 美元,3.5 是 1.62 美元,整场实验 3.19 美元,约 23 元人民币。两代思考都关不掉,思考 token 占输出的 81% 到 91%,每轮可见正文只有 160 到 300 字。

所以买 flash 档之前值得问的,从来不是「更强吗」,是「崩得晚不晚」。单段续写、每次只要一两段的场景,3.6 更快更便宜,降价是真的,这么用没毛病。连续续写十轮以上,两代都别裸用:循环冒头时换个模型接一段,或把绕圈那段重写掉,打断它的自我模仿,我们把逐段换模型做进阅读器就是给这种时刻用的。质量位仍在Kimi K3 那一档,flash 档买的是速度和价格。

样本边界照例写明:单一提示框架,两本中文书,每模型每书一条链、单锚点单采样。3.6 玄幻链的「干净」分不清是能力还是锚点运气——样本就这么大。官方说 Gemini 3.5 Pro 还在测试,等它上线,这一页顶部会挂新一场的导流条。

常见问题

Gemini 3.6 Flash 写小说比 3.5 Flash 强吗?

分场景,且两场方向相反。同协议各连续续写 20 轮、六个异构 AI 评委成对双盲:890 万字玄幻场 3.6 以 9:3 胜出,《后宫·甄嬛传》女频场 3.6 以 1:10 惨败、晚窗 0:11。根子在四条链里三条都于 20 轮内陷入剧情循环,两本书只是决定了谁崩得更难看。单段、短程续写 3.6 更快更便宜;连续长跑两代都撑不住。全部结论绑定 2026-07-23 的聚合网关端点。

Gemini 3.6 Flash 比 3.5 Flash 便宜多少、快多少?

牌价输入两代同为每百万 token 1.5 美元,输出从 9 美元降到 7.5 美元;官方公告另称 Artificial Analysis 口径下输出 token 用量少 17%。我们实测 3.6 每轮平均延迟约 6 秒,3.5 是 12.5 秒上下,快了一半。整场 40 轮按牌价折算共 3.19 美元:3.6 两条链 1.57 美元,3.5 两条链 1.62 美元。两代思考都关不掉,思考 token 占输出的 81% 到 91%。

为什么两本书的结论正好相反?

文体偏科解释不了。两代模型在这套 20 轮滚动窗口协议下都陷入了剧情循环,评委实际在投「谁崩得没那么难看」:玄幻场 3.5 出现两轮 129 字逐字全同的整轮重放,3.6 的循环停留在语义层面(同一桥段换措辞重演六七次),评委宽容后者,投出 9:3;女频场恰好反过来,3.6 从第 9 轮起渐进坍缩成逐字死循环,3.5 保持措辞变化,五位评委在映射翻转下全部稳定投 3.5,投出 1:10。

换个提示词能治好剧情循环吗?

我们的数据说不能。本轮用的上下文说明,就是当年把 gemini-3.1-pro 从「20 轮全部重写开场」救回到零复发的修复后措辞。同一份说明之下,两代 Flash 照样大面积循环。那次修复解决的是措辞被误读,属于提示词问题;这次的循环是模型长程能力问题。实用的打断方式是循环冒头时换模型接写一段,或重写掉绕圈的段落。

Gemini 3.6 Flash 写小说怎么样?发布 48 小时的 40 轮双盲实测:玄幻 9:3 胜前代,女频 1:10 惨败 · Foreverse · 新梦