Foreverse Research · Fiction Bench
Qwen3.7-Max 写小说怎么样?
它是这个榜单最有教育意义的一行:句长、对话率、套话密度全是全场最贴原著的,双盲却只排 5-6(玄幻)和 8(女频)。原因是它每个窗口都要写气味和触感——「焦糊味刺得鼻腔发酸」——而原著全书零气味描写。统计像不等于读着像。
玄幻《踏天境》
5-6 / 9
两套映射:p303 第5 · p404 第6
「气味指纹」恒定——每窗必现气味/触感描写,原著全书零气味描写;恒定及格、恒定不像。
女频《甄嬛传》
8 / 9
两套映射:p505 第8 · p606 第8
两包完全一致的第 8;「精修感官流」在古言语境更违和。
20 轮链上实际看到了什么
结构指标全场冠军:句长 32.1(gold 32.1)、对话率 18.1%、比喻套话密度 1.74‰ 全场最低。盲评却把它排在玄幻 5-6、女频两包一致第 8。
评审的解释一致且具体:它的「感官流」——每窗必现的气味/触感/新奇比喻(「焦糊味刺得鼻腔发酸」「清冷幽香」)——是原著完全不存在的维度。句长统计测不出「写了原著从来不写的东西」。
这一行是我们方法论「结构化指标只当回归闸门、像不像的裁决必须有细读评审」的直接出处。如果你只看统计表选模型,会把它选成第一名。
长程失效模式
未观察到
无长程失效;它的问题是恒定的风格外加,而非随轮数劣化。
结构指纹
结构指标全场冠军(句长 32.1≈gold 32、对话率 18.1%、套话密度 1.74‰ 最低)——盲评却 5-6:统计测不出「写了原著从来不写的东西」。
跨文体画像:「精修感官流」在古言更违和;统计最像、气质最远的代表。
测试条件披露(hosted 模型是移动目标)
被测模型:qwen3.7-max(发布 2026-05-21)
评测执行:2026-07-16 · 接入通道:评审网关(OpenAI 兼容直连)
协议:每文体一条 20 轮连续续写链 · 温度 0.7 · 双盲两套映射全排序 · 结构指标交叉
指令条件:玄幻轮=旧 directive / 女频轮=修正后 D2 directive(榜单方法论节有完整说明)
写一万字要多少钱
$0.60 列表价 输入 $2.5/M · 输出 $7.5/M(models.dev 快照 2026-07-24)
按 App 续写口径:一段约 400 字 = 8k token 装填 + 550 token 输出,一万字 ≈ 25 段,不含缓存折扣。只作组间相对比较。
Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Qwen3.7-Max 接着写。
在 Foreverse 里用它续写如何引用
Foreverse Research,《Qwen3.7-Max 写小说怎么样(Fiction Bench)》,2026-07。 https://foreverse.cn/zh/research/fiction-bench/qwen3-7-max