Foreverse Research · Fiction Bench

Qwen3.8-Max-Preview 写小说怎么样?

对上代 Qwen3.7-Max 是真升级:女频 11:1 碾压(三窗全胜),3.7 的「精修感官流」病显著收敛;玄幻只是微弱改善(7:5),且修掉词级复读换来了情节级复读——评委点名「20 轮仍卡在逃亡与封印的死循环」。对同月发布的 Kimi K3 则 3:20 惨败。preview 是移动目标,结论绑定 2026-07-21 的托管版本。

vs Qwen3.7 · 7:5 / 11:1成对对决记录 · 未进全排序评测 2026-07-21

对决记分卡(成对双盲,6 评委 × 两套映射翻转)

vs Qwen3.7-Max · 同厂上代 · 榜上玄幻 5-6 / 女频第 8

玄幻《踏天境》

7 : 5

女频《甄嬛传》

11 : 1

测试日 2026-07-21

女频三窗全胜(11:1/11:0);玄幻分窗 early 6:6 / mid 7:5 / late 7:5,只算微弱胜出。

vs Kimi K3 · 同月发布的续写强者 · 见其对决页

玄幻《踏天境》

1 : 10

女频《甄嬛传》

2 : 10

测试日 2026-07-21

六个分窗全部落后;名下三张票在映射翻转下全部自相矛盾(位置偏差),无一张稳定判断。

它和榜上的模型是什么关系

上代 Qwen3.7-Max 在主榜是「统计最像、气质最远」的教材行:结构指标全场冠军,双盲却只排玄幻 5-6、女频第 8——每窗必写原著全书没有的气味描写。3.8 把这个病修掉了一半:女频场感官流显著收敛、11:1 三窗全胜;玄幻场 7:5 只算持平偏上。

但修掉词级复读换来了情节级复读:评委点名玄幻链「严重剧情倒带,20 轮后仍卡在逃亡与封印血纹的死循环中,叙事停滞」、女频链「三个窗口均围绕卫临验毒展开,缺乏实质剧情推进」——属主榜三分类学里的「中途卡死」型(kimi-k2.6 / grok-4.5 族)。机械口径干净(相邻轮逐字 overlap 0.0%),循环发生在情节层,逐字检测抓不到。

新体征是句子越写越匀:句长 CV 全场最平(玄幻全链 0.318、late 窗只有 0.217,两书原著基线是 0.837/0.495)。统计与双盲第三次方向分歧也出在它身上:玄幻场 3.7 的统计距离更贴(0.244 vs 0.442),盲评却是 3.8 赢——指标划得出档位,判不出人味。

横向定位一句话:对同月 K3 的 3:20 说明这次升级追上的是自家上代,不是当前强者线。

测试条件披露(hosted 模型是移动目标)

被测模型:qwen3.8-max-preview(发布 2026-07-19)

评测执行:2026-07-21 · 接入通道:阿里 Token Plan(OpenAI 兼容端点)

评审形态:成对双盲判定(每书两套甲乙翻转映射对冲位置偏差),非九模型全排序

与 K3 增量轮逐项一致(同两书 · 同 55% anchor · 同 D2 directive · 20 轮链 · 温度 0.7);唯一协议差异 max_tokens 2800→6000(qwen3.8 恒思考,防正文被思考 token 挤空)。

诚实边界

Qwen3.8-Max-Preview 未参与九模型同协议全排序盲评,主榜的位次列对它不适用——本页只给有票据的成对对决记录,不虚构名次。它何时进全排序取决于下一轮主榜重跑。

preview 是移动目标:全部结论绑定 2026-07-21 的托管 preview 版本,正式版行为可能漂移。

对 3.7 的票数可以参照 3.7 的在榜位次一起读,但成对票数与全排序位次是两种评审形态,不能换算。

价格:preview 未进 models.dev 列表价快照,本页成本节如实缺省(评测走阿里 Token Plan 订阅额度)。

Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Qwen3.8-Max-Preview 接着写。

在 Foreverse 里用它续写
Qwen3.8-Max-Preview 写小说怎么样 — 成对双盲对决实测(Fiction Bench) · Foreverse · 新梦