Foreverse Research · Fiction Bench
Grok 4.5 写小说怎么样?
在这套评测里不推荐拿它写中文小说:玄幻第 8、女频两包一致第 9。病灶跨文体复现——写到中段进入逐字循环(同两段循环三遍)、女频链 20 轮剧情停摆在案发当日,而且第一人称密度只有原著一半,限知视角守不住。
玄幻《踏天境》
8 / 9
两套映射:p303 第8 · p404 第8
感官轰炸长句连环 + mid 整窗同两段逐字循环三遍(双包独立发现)。
女频《甄嬛传》
9 / 9
两套映射:p505 第9 · p606 第9
两包完全一致垫底;复读循环+剧情倒带跨文体复现(late 逐字重复、20 轮停摆在案发当日)+ 第一人称密度 5‰ 仅原著一半(视角纪律崩)。
20 轮链上实际看到了什么
玄幻双包一致第 8:感官轰炸式长句连环,mid 整窗把同两段逐字循环三遍——两套映射的评审互不知情、各自独立点名了这次循环。late 窗恢复出新文本,说明「中途卡死」不是永久死机而是自回归对自己产物的固定点塌缩。
女频双包一致第 9:复读循环+剧情倒带跨文体复现,late 逐字重复、20 轮停摆在案发当日;另有一条视角纪律的硬数字——第一人称密度 5‰,仅原著的一半,第一人称限知文写着写着丢了「我」。
两文体都垫底且失效形态一致,说明这不是文体适配问题而是长程生成的结构性弱点。短平快的单轮任务它未必差,这个榜测的是 20 轮连续续写。
长程失效模式
中途卡死
中途卡死:玄幻 mid 整窗同两段逐字循环三遍(late 恢复出新文本);女频 late 逐字重复+剧情倒带、20 轮停摆在案发当日——跨文体复现。
结构指纹
感官轰炸长句连环;女频第一人称密度 5‰ 仅原著一半(限知视角纪律崩)。
跨文体画像:双文体垫底;复读/倒带病跨文体复现。
测试条件披露(hosted 模型是移动目标)
被测模型:grok-4.5(发布 2026-07-08)
评测执行:2026-07-16 · 接入通道:评审网关(OpenAI 兼容直连)
协议:每文体一条 20 轮连续续写链 · 温度 0.7 · 双盲两套映射全排序 · 结构指标交叉
指令条件:玄幻轮=旧 directive / 女频轮=修正后 D2 directive(榜单方法论节有完整说明)
写一万字要多少钱
$0.48 列表价 输入 $2/M · 输出 $6/M(models.dev 快照 2026-07-24)
按 App 续写口径:一段约 400 字 = 8k token 装填 + 550 token 输出,一万字 ≈ 25 段,不含缓存折扣。只作组间相对比较。
Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Grok 4.5 接着写。
在 Foreverse 里用它续写如何引用
Foreverse Research,《Grok 4.5 写小说怎么样(Fiction Bench)》,2026-07。 https://foreverse.cn/zh/research/fiction-bench/grok-4-5