Foreverse Research · Fiction Bench
DeepSeek V4 Pro 0813 写小说怎么样?
正式版(0813)在同协议成对双盲里两书均负于自家已下架的 preview 前代:玄幻 3:9(稳定 0:3)、女频 1:11(稳定 0:5,本轮最强信号);挑战玄幻现任冠军 flash 0716 快照亦 3:9。病灶是「现代文艺化」漂移——高武写成低武武侠、甄嬛体写成疼痛文学;机械层反而历届最干净之一(40 轮 12-gram 峰值 0%/1.8%、零半角引号)。系统级发现:官方 API 同 ID 热切权重,榜上的女频冠军已经调不到了。
对决记分卡(成对双盲,6 评委 × 两套映射翻转)
vs DeepSeek V4 Pro 0716 preview · 自家前代 · 榜上女频冠军 1-2 / 玄幻 2-4(已被同 ID 热切,无带日期旧入口)
玄幻《踏天境》
3 : 9(稳定 0:3)
女频《甄嬛传》
1 : 11(稳定 0:5)
测试日 2026-08-13
女频分窗 1:11 / 2:8(平 2)/ 1:11,五评委跨映射稳定投前代、零评委稳定投 GA;玄幻稳定 0:3(claude/glm/kimi 甲位摇摆 6 票废)。四家评委独立点名 GA「现代文艺化」:疼痛文学式比喻堆砌、辞藻过度诗意化、暴室场景驻留约 10 轮。
vs DeepSeek V4 Flash(0716 快照) · 玄幻现任冠军 · 榜上第 1(该榜位同为 preview 快照,7/31 已被同 ID 热切)
玄幻《踏天境》
3 : 9(稳定 1:4)
女频《甄嬛传》
——(未对阵)
测试日 2026-08-13
输现任冠军尚可读作档位分工(前代 Pro 玄幻本就 2-4),两书都输自家前代无从辩解;claude-4.6-sonnet 是唯一跨映射稳定投 GA 的评委(赞其短促句式与克制),品味分歧如实登记。
它和榜上的模型是什么关系
本页的头条不是票数,是系统级发现:DeepSeek 官方 API 升级正式版不换模型 ID——deepseek-v4-pro 这个字符串 7/16 供的是 preview 权重、8/13 起供的是 0813 正式版,模型列表无带日期旧入口。两个权重在双盲里文风判若两人(女频稳定 0:5),所以「锁定模型 ID=行为可复现」在静默热切面前不成立。对 BYOK 用户是直接痛点:上周顺手的「deepseek-v4-pro」,这周可能已换了文风,配置页不会有任何提示。主榜三个 DeepSeek 占位(玄幻冠军 flash、女频冠军 pro、玄幻 2-4 pro)全部是 preview 期测量值,7/31 与 8/13 先后被同名热切——榜上的冠军已经调不到了。
文风回归性劣化的病理:两书败因同源不同貌。玄幻场三家评委独立点名「高武设定降维」——宇宙主宰级人物在 late 窗写成涉溪水、林间避雨、荧光石照明、听夜鸟惊飞的低武武侠(r16-19 逐字核验命中);女频场四家独立点名「现代疼痛文学」——「像」字系比喻密度 7.36‰=前代 2.2 倍(原著续写窗 0 处)。专名记忆探针加重翻车:皇后居所写成电视剧设定「景仁宫」×6(原著正文 0 次、书中体系是昭阳殿 ×67),6 处全出自参数记忆。另有暴室场景驻留 r10-19 约 10 轮——12-gram 仅 1.8% 抓不到、评委独立点名,登记为三分类学之外的「场景驻留」软失效候选。与 opus5 轮对照最说明问题:同是「变文艺」,opus-5 古典向女频 12:0 通吃,GA 现代向女频 1:11 被杀。
机械层是历届最干净之一:40 轮零请求失败零重试,12-gram 峰值玄幻 0.0%(20 轮全零)/女频 1.8%,零半角引号伪影。「统计贴≠人味」在玄幻场再现方向分歧:GA 综合距离 0.369 明明优于前代 0.454,盲评仍 3:9 输——设定降维与文艺化在句长统计上不显影。评委也留下正面票据:claude 稳定投 GA(「短促句式、克制内敛、临场感」),glm 引「如剑鸣般切开血光」夸其文笔——「文笔好但不像」是 GA 三场的共同画像。
GA 新体征三处:句 CV 两书 0.443/0.378 均显著低于前代(0.592/0.454),句子均匀化加重(第一 AI 指纹恶化);玄幻「的」密度 1.08/百字=gold 的 37%(前代 3.27 超标,GA 矫枉过正成回避式精修);女频「我」密度 20.7‰=gold 2.3 倍(刷新 K3 轮 16.2‰ 纪录)。本轮复读体检还在两条冠军归档链上翻出「吞并式复述」新观察(flash r13 瞬时 72%、前代 pro r4 53%,均不在盲评窗、不影响历史票数)——与逐字死循环不同种,各 n=1 仅记录。
测试条件披露(hosted 模型是移动目标)
被测模型:deepseek-v4-pro(发布 2026-08-12)
评测执行:2026-08-13 · 接入通道:DeepSeek 官方 API(同 ID 热切,GA 后 1-2 小时实测)
评审形态:成对双盲判定(每书两套甲乙翻转映射对冲位置偏差),非九模型全排序
与 K3 轮及全部 DeepSeek 历史链同口径(同两书 · 同 55% anchor · 同 D2 directive · 20 轮链 · 温度 0.7 · max_tokens=2800);女频对手链=D2 条件干净成对,玄幻两组对手为旧 directive 归档链(消融证据对冲);评委池 deepseek-v4-pro 因是被试回避、gemini-3.5-flash 补位。同一模型 ID 的权重已于 8/13 热切:本页被试=0813 正式版,榜上女频冠军=0716 preview 快照,两者现已无法同时调到。
诚实边界
DeepSeek V4 Pro 0813 未参与九模型同协议全排序盲评,主榜的位次列对它不适用——本页只给有票据的成对对决记录,不虚构名次。它何时进全排序取决于下一轮主榜重跑。
成对盲评只对自家两个 preview 快照(0716 pro / 0716 flash),未与其他厂商同场;与主榜名次不可跨榜硬比(评审形态不同)。本轮位置偏差偏高:稳定票 12/36,kimi-k2.6 三组全摇摆 6 票废——结论以稳定票+多评委独立点名+机械核验三重交叉为准。
玄幻场两组对手为旧 directive 归档链(deepseek 系消融 0 回退证据对冲,严格说混入变量);女频对手链为 D2 同款条件,干净成对。
GA 为官宣后约 1-2 小时的 hosted 行为(2026-08-13 凌晨平峰实测),后续可能漂移;「景仁宫 ×6 / 暴室驻留 / 低武降维」均基于单链 n=1,复发率无法估计。
价格:同 ID 热切使列表价快照无法与权重版本一一对应,且 8/6 公告的「预计涨幅较大」整体调价尚未落地——本页成本节如实缺省。官方定价页(2026-08-13 实况):平峰输入未命中 ¥3/M、命中 ¥0.025/M、输出 ¥6/M,工作日高峰 ×2;两链 40 轮账面实扣 ¥2.30,全实验 ≈¥5。
Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 DeepSeek V4 Pro 0813 接着写。
在 Foreverse 里用它续写如何引用
Foreverse Research,《DeepSeek V4 Pro 0813 写小说怎么样(Fiction Bench 增量对决)》,2026-07。 https://foreverse.cn/zh/research/fiction-bench/deepseek-v4-pro-0813