Foreverse Research · Fiction Bench
Qwen3.8-Max-Preview 写小说怎么样?
对上代 Qwen3.7-Max 是真升级:女频 11:1 碾压(三窗全胜),3.7 的「精修感官流」病显著收敛;玄幻只是微弱改善(7:5),且修掉词级复读换来了情节级复读——评委点名「20 轮仍卡在逃亡与封印的死循环」。对同月发布的 Kimi K3 则 3:20 惨败。preview 是移动目标,结论绑定 2026-07-21 的托管版本。
对决记分卡(成对双盲,6 评委 × 两套映射翻转)
vs Qwen3.7-Max · 同厂上代 · 榜上玄幻 5-6 / 女频第 8
玄幻《踏天境》
7 : 5
女频《甄嬛传》
11 : 1
测试日 2026-07-21
女频三窗全胜(11:1/11:0);玄幻分窗 early 6:6 / mid 7:5 / late 7:5,只算微弱胜出。
vs Kimi K3 · 同月发布的续写强者 · 见其对决页
玄幻《踏天境》
1 : 10
女频《甄嬛传》
2 : 10
测试日 2026-07-21
六个分窗全部落后;名下三张票在映射翻转下全部自相矛盾(位置偏差),无一张稳定判断。
它和榜上的模型是什么关系
上代 Qwen3.7-Max 在主榜是「统计最像、气质最远」的教材行:结构指标全场冠军,双盲却只排玄幻 5-6、女频第 8——每窗必写原著全书没有的气味描写。3.8 把这个病修掉了一半:女频场感官流显著收敛、11:1 三窗全胜;玄幻场 7:5 只算持平偏上。
但修掉词级复读换来了情节级复读:评委点名玄幻链「严重剧情倒带,20 轮后仍卡在逃亡与封印血纹的死循环中,叙事停滞」、女频链「三个窗口均围绕卫临验毒展开,缺乏实质剧情推进」——属主榜三分类学里的「中途卡死」型(kimi-k2.6 / grok-4.5 族)。机械口径干净(相邻轮逐字 overlap 0.0%),循环发生在情节层,逐字检测抓不到。
新体征是句子越写越匀:句长 CV 全场最平(玄幻全链 0.318、late 窗只有 0.217,两书原著基线是 0.837/0.495)。统计与双盲第三次方向分歧也出在它身上:玄幻场 3.7 的统计距离更贴(0.244 vs 0.442),盲评却是 3.8 赢——指标划得出档位,判不出人味。
横向定位一句话:对同月 K3 的 3:20 说明这次升级追上的是自家上代,不是当前强者线。
测试条件披露(hosted 模型是移动目标)
被测模型:qwen3.8-max-preview(发布 2026-07-19)
评测执行:2026-07-21 · 接入通道:阿里 Token Plan(OpenAI 兼容端点)
评审形态:成对双盲判定(每书两套甲乙翻转映射对冲位置偏差),非九模型全排序
与 K3 增量轮逐项一致(同两书 · 同 55% anchor · 同 D2 directive · 20 轮链 · 温度 0.7);唯一协议差异 max_tokens 2800→6000(qwen3.8 恒思考,防正文被思考 token 挤空)。
诚实边界
Qwen3.8-Max-Preview 未参与九模型同协议全排序盲评,主榜的位次列对它不适用——本页只给有票据的成对对决记录,不虚构名次。它何时进全排序取决于下一轮主榜重跑。
preview 是移动目标:全部结论绑定 2026-07-21 的托管 preview 版本,正式版行为可能漂移。
对 3.7 的票数可以参照 3.7 的在榜位次一起读,但成对票数与全排序位次是两种评审形态,不能换算。
价格:preview 未进 models.dev 列表价快照,本页成本节如实缺省(评测走阿里 Token Plan 订阅额度)。
Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Qwen3.8-Max-Preview 接着写。
在 Foreverse 里用它续写如何引用
Foreverse Research,《Qwen3.8-Max-Preview 写小说怎么样(Fiction Bench 增量对决)》,2026-07。 https://foreverse.cn/zh/research/fiction-bench/qwen3-8-max-preview