Foreverse Research · Fiction Bench
Gemini 3.1 Pro 写小说怎么样?
先说清楚一件事:它的玄幻第 9 名主要是我们自己的指令措辞 bug——旧措辞让它把 AI 续写段当成「可忽略的参考」,20 轮全在重写开场;措辞修正后 0/20 回退。修复条件下的女频轮它排 4-6 中游,但比喻套话密度仍是全场最高:复读是 bug,文艺腔是本性。
玄幻《踏天境》
9 / 9
两套映射:p303 第9 · p404 第9
旧 directive 下接续点回退 20/20(每轮从原著末尾重写开场,零推进)——已被消融证实是我们指令措辞的 bug,修复后 0/20。
女频《甄嬛传》
4-6 / 9
两套映射:p505 第6 · p606 第4
修复后(D2 directive)从失格回到中游;比喻套话密度 2.50‰ 仍全场最高——文艺腔是本性,复读是 bug。
20 轮链上实际看到了什么
玄幻链(旧 directive)三窗口复读同一开场、20 轮零推进,双盲两包一致第 9。这个失格后来被三段消融拆开:旧措辞「仅供情节衔接参考」→ 20/20 回退;删掉说明句 → ~6/8 回退;修正为「已发生的正文剧情」→ 0/20。「〔来源标注〕」这类陌生符号在不解释时,它的默认理解是「标注段不算正文」。
这条 bug 的修复原则后来写进了产品:说明句只声明地位(已发生的剧情事实、不是可忽略的参考),绝不指挥动作——deepseek 系对三种措辞都不敏感,而它是「最容易误读的模型」,指令鲁棒性要按它设计。
女频轮(D2 修复版)它回到 4-6 名正常竞争,flavor 2.50‰ 仍是全场最高——修好我们的 bug 之后剩下的,才是模型自己的底色:偏文艺、爱堆比喻,且这个偏好不随轮数漂移。
长程失效模式
从头复读
从头复读(旧 directive 诱发):每轮回到原著末尾重写开场,20 轮零推进。消融三段实锤:旧措辞 20/20 回退、零说明 ~6/8、修正措辞 0/20——「标注段不算正文」是它对陌生标记的默认理解,说明句不可省。
结构指纹
比喻套话密度全场最高(修复后玄幻 2.47‰ / 女频 2.50‰,原著基线 1.0‰);文艺腔恒定。
跨文体画像:directive 措辞修复=从失格到正常竞争的分水岭。
测试条件披露(hosted 模型是移动目标)
被测模型:gemini-3.1-pro(发布 2026-02-19)
评测执行:2026-07-16 · 接入通道:yunwu 聚合网关
协议:每文体一条 20 轮连续续写链 · 温度 0.7 · 双盲两套映射全排序 · 结构指标交叉
指令条件:玄幻轮=旧 directive / 女频轮=修正后 D2 directive(榜单方法论节有完整说明)
写一万字要多少钱
$0.56 列表价 输入 $2/M · 输出 $12/M(models.dev 快照 2026-07-24)
按 App 续写口径:一段约 400 字 = 8k token 装填 + 550 token 输出,一万字 ≈ 25 段,不含缓存折扣。只作组间相对比较。
Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Gemini 3.1 Pro 接着写。
在 Foreverse 里用它续写如何引用
Foreverse Research,《Gemini 3.1 Pro 写小说怎么样(Fiction Bench)》,2026-07。 https://foreverse.cn/zh/research/fiction-bench/gemini-3-1-pro