Qwen 3.8 比 3.7 会写小说吗?两本书 40 轮双盲:一场 11:1,一场 7:5

Qwen3.8-Max-Preview 发布 48 小时的增量实测:沿用 Kimi K3 那轮的同一套协议(同两本书、同起笔点、同上下文说明),与前代 Qwen 3.7 Max 各连续续写 20 轮成对双盲。票数女频 11:1 碾压、玄幻 7:5 险胜,前代的「精修感官流」在古言场明显收敛。最有意思的反差:结构统计反而是 3.7 更贴原著,句长 CV 全场最平是 3.8 的新体征,盲评却照样判 3.8 赢。三个坑如实记录:感官堆砌替代叙事推进、玄幻 20 轮卡进死循环、古言里写出「把夜色熬成了毒」。preview 是移动目标,全部结论绑定 2026-07-21 的端点。

旧纸底上并排两幅同一株墨兰的写生:左幅被浓雾裹住只剩轮廓,右幅雾散、枝叶分明,纸角搁着一只沙还没流完的沙漏

在 7 月的九模型横评里,Qwen 3.7 Max 领到的可能是全场最扎心的一句评语:「恒定的精修感官流:每轮都写原著从不写的气味描写,恒定及格、恒定不像」。 玄幻场排 4-5,宫斗古言场两个评审一致排第八。7 月 19 日,阿里在上海 WAIC 期间放出 Qwen3.8-Max-Preview:2.4T 参数,官方公告自称「second only to Fable 5」(仅次于 Fable 5),没附任何公开 benchmark 表。口号我们不接,考卷可以重发:48 小时内,让 3.8 和它的前代在同两本书上各连续续写 20 轮,成对双盲。

结果一半意外一半不意外。女频场 11 比 1,碾压级翻身;玄幻场 7 比 5,开局窗口打成 6 比 6,只赢一口气。

同一张考卷,只动了一个参数

协议照抄 K3 那轮增量实测,逐项一致:同两本书(890 万字的传统玄幻,加《后宫·甄嬛传》),同一个约 55% 深度的起笔点,同一份上下文说明,同 21500 字的滚动窗口,温度 0.7,每轮产物拼回上下文再写下一轮,每链 20 轮。唯一动过的参数是 max_tokens,从 2800 抬到 6000:3.8 的思考关不掉,不抬上限,正文会被推理过程挤空。两代模型跑同一套参数,变量仍然只有模型。

为什么做成对增量而没重跑九模型全榜?全榜要以周计,preview 不等人。成对纵向对比恰好回答升级真正抛出的那一个问题:比它替掉的东西是强是弱。其余变量全部钉死,还能赶在发布窗口内、赶在这个托管端点还订得到的时候交卷。

评委还是那六个异构模型(claude-4.6-sonnet、gemini-3.1-pro-preview、gemini-3.5-flash、deepseek-v4-pro、qwen3.7-max、glm-5.2),每本书两套甲乙翻转映射,票取整体判定,个别评委 JSON 解析失败的票按无效剔除,两场各计 12 张有效票。一个细节:qwen3.7-max 自己坐在评委席上, 在女频场的两套映射里都把票投给了 3.8;玄幻场它投给了自己这一代。

两场票数:一场翻身,一场险胜

对决(Qwen 3.8 对 3.7)整体票分窗 early / mid / late
玄幻(890 万字)7:56:6 / 7:5 / 7:5
女频《后宫·甄嬛传》11:1全部 11:1 或 11:0

分窗的意思是把每条 20 轮的链切成前中后三段各自投票,开局惊艳、后段崩坏的链藏不住。女频场是这次升级的主戏:三个评审窗口全部一边倒,没有一段摇摆。对照它的前代在九模型宫斗榜上的位置(第八名,评语是「精修感官流在古言语境里比在玄幻里更违和」),3.8 把这本书从垫底区打进了能打的区间。玄幻场克制得多:开局平手,全场 7:5,方向是改善,幅度是一口气。

同周还有另一场对决,交代一句就走:与 7 月 16 日发布的 Kimi K3 成对双盲,3.8 两本书合计 3 比 20 惨败,K3 仍是当前续写强者,完整票据与评语在对决篇。本文只管 3.7 到 3.8 这条纵向线。

统计说 3.7 更像,评委说 3.8 更好

把结构指标摆出来,会得到一个和票箱打架的结论。与原著结构画像的综合距离(量的是产物离原著「形」有多远,只看结构不看内容,越小越贴):玄幻场 3.7 是 0.244,3.8 是 0.442,差了近一倍;女频场 3.7 也略贴,0.321 对 0.385。按统计,更像原著的是 3.7;可盲评两场都判给 3.8,女频还是 11 比 1。

综合距离(越小越贴)句长 CV对话率
玄幻 · 原著基准0.83716.1%
玄幻 · Qwen 3.80.4420.318(late 窗 0.217)4.5%
玄幻 · Qwen 3.70.2440.5085.5%
女频 · 原著基准0.49548.8%
女频 · Qwen 3.80.3850.39333.6%
女频 · Qwen 3.70.3210.40330.8%

表里还藏着 3.8 的一个新体征:句长 CV 全场最平,分窗量在 0.217 到 0.406 之间,远低于两本书原著的 0.837 和 0.495。翻译一下,它的句子越写越匀,长短起伏被熨平了。句长均匀是我们量过的第一 AI 指纹,本该重扣分,评委的人味票却照样投它。统计与双盲方向分歧,这已经是记录在案的第三次:第一次是 3.7 在玄幻横评里统计几乎完美、盲评只拿 4-5 名;第二次是评审可靠性实验里评委高度一致却一致地错。统计当回归闸门、成对盲评当裁决,这个分工又一次被确认。顺带一行:对话率两本书都仍低于原著,升级没往这个方向动。

复读体检两代都干净:四条链相邻轮逐字重叠全部 0.0%,没有早年那种整段自我复制。3.8 的毛病要去评语里找。

评委点名了哪三类劣化?

先交代出处:下面的病历引语来自同批链的另一场对决(对 K3)的评委席——两场共用同两条 3.8 链,那组评委把毛病挑得更狠。 第一类,感官堆砌替代叙事推进。claude 评委给玄幻链的原话:「感官细节堆砌(盐壳碎裂/腥甜血气/枯叶焦土) 替代叙事推进」;qwen3.7-max 评委的版本是「文风持续偏离原著,偏向细腻微观的传统武侠/实体仙侠风」。对照前代:3.7 挨批的是感官词的词级复读(「嗤嗤/牙酸/黏腻」循环叠用、「唇角微勾」套话滑落),3.8 把词级复读修掉了,感官偏科本身还在。

第二类更伤,剧情死循环。gemini-3.5-flash 评委:「严重剧情倒带,20 轮后仍卡在逃亡与封印血纹的死循环中,叙事停滞」。女频场轻一些但同族,qwen3.7-max 评委:「情节模式复读:三个窗口均围绕卫临验毒展开,缺乏实质剧情推进」。这属于三种长程失效模式里的「中途卡死」型:字面不重复,情节在绕圈。修掉词级复读、换来情节级复读,这笔交换正是玄幻场只赢一口气的主因。

第三类,现代文艺腔。女频链里被评委摘出来示众的原话是「把夜色熬成了毒」——摘它的是对上 K3 那组评委;有意思的是,在对前代 3.7 的这组里,同一句被两位评委引为「极具流潋紫神韵」的正面例证。搁在古言语境里它仍是现代腔比喻,这类小破绽后劲很长:随手翻翻能原谅,追了几百章的读者不会。

慢、贵,以及缓存全程未命中

3.8 思考恒开,reasoning token 占输出的 50% 到 90%,单轮 12 到 38 秒,比 3.7 的 21 到 29 秒波动更大:快时更快,慢时更慢。给个量级参照,上周的 K3 实测是每轮 37 到 54 秒,思考关不掉的模型在按钮前大抵就是这个等法。四条链 80 轮共消耗 1,227,401 个 input token 和 103,229 个 output token,缓存命中为零。连续续写是滚动窗口,每轮前缀都在变,这类负载天然吃不到前缀缓存的折扣;在阅读器里,比平均值更要命的是波动本身,12 秒的一轮按下去无感,38 秒的一轮就是干等。我们跑在 Token Plan Lite 订阅上(限时 39 元/月),preview 期 Credits 按 1 折消耗,全部实验没有耗尽当期额度。

这页结论能保鲜多久?

Preview 是移动目标。官方文档写明:qwen3.8-max-preview 预览期间会持续迭代,预览结束后下线或替换成正式版本。所以本页全部票数与指标只绑定 2026-07-21 的 hosted preview(Token Plan 的 OpenAI 兼容端点,模型 ID qwen3.8-max-preview 与 qwen3.7-max),正式版不承诺复现。官方同时预告正式版将开源,那是第二张考卷的日期:等它转正,我们复跑同一套 40 轮双盲,把结论更新进选型页,这一页顶部也会挂上新实测的导流条。

最后一条实操建议。preview 期间别急着把在读的书整本迁过去:拿你书里最新的一章,两代各续三段,打乱顺序盲读完再翻牌,几分钱就能换来只对你这本书负责的答案,通用流程在模型更新决策笔记里。局限也照实交代:每本书一条链、单一起笔点,样本就这么大。我们的票可以参考,替代不了你的翻牌。

常见问题

Qwen 3.8 写小说比 3.7 强多少?

分文体。宫斗古言场是碾压:同协议各连续续写 20 轮,六个异构 AI 评委、双映射成对盲评,整体票 11:1,三个评审窗口全部 11:1 或 11:0,前代在九模型榜上垫底区的第八名被明显甩开。传统玄幻场只是险胜:整体票 7:5,开局窗口还打成 6:6 平手。前代标志性的「精修感官流」收敛了,但感官偏科与剧情死循环仍被评委点名。全部结论绑定 2026-07-21 的 preview 端点。

Qwen 3.8 和 Kimi K3 写小说谁更强?

同一套协议的成对双盲里,Qwen 3.8 对 Kimi K3 两本书合计 3:20 惨败(玄幻 1:10、女频 2:10),K3 仍是当前续写强者。完整票据、评语与成本对照在我们的《Qwen 3.8 对 Kimi K3》对决篇里单独展开,本文主轴是 3.7 到 3.8 的纵向对比。

Qwen 3.8 的 API 多少钱?一段续写要等多久?

我们跑在阿里 Token Plan 订阅上(2026-07-21 核实):个人版 Lite 限时 39 元/月,qwen3.8-max-preview 预览期 Credits 按 1 折消耗。速度实测单轮 12 到 38 秒,思考关不掉,reasoning token 占输出的 50% 到 90%。整场实验四条链 80 轮共 1,227,401 个 input token、103,229 个 output token,缓存命中为零,没有耗尽 Lite 当期额度。

正式版发布后,这份结论还算数吗?

不承诺。官方文档写明 preview 期间模型会持续迭代,预览结束后下线或替换成正式版本,所以本页票数与指标只绑定 2026-07-21 的 hosted preview。官方已预告正式版将开源;等它转正,我们会复跑同一套 40 轮双盲,把名次更新进长青选型页,并在本页顶部挂新实测的导流条。

Qwen 3.8 写小说怎么样?发布 48 小时的 40 轮双盲实测:女频 11:1 碾压前代,玄幻只赢一口气 · Foreverse · 新梦