DeepSeek V4 Flash 正式版上线当天,我们让它连续写小说:复读少了,high/max 却会把 32K 也吃进思考

DeepSeek V4 Flash 正式版 API 上线公测当天实测:官方 Chat、Responses、Agent 工具闭环、同题20轮长篇、原创12轮续写、角色扮演和四题材写卡。新版把跨轮逐字复读峰值从72.0%降到1.2%,但文风距离变大;8K下high首轮8191 tokens全是reasoning、正文为0。把输出放到32K后high/max长篇均跑满12轮,却仍有长度失控、事实矛盾和机关模板化;max复杂写卡再次耗尽32767 reasoning、正文为0。

旧纸画风的两张写字桌,中间隔着一条墨河;左桌稿纸整齐成册,右桌散落着大量续写页

这次最值得写在开头的,不是一个漂亮排行榜,而是一条空回复:请求返回 HTTP 200,output_tokens=8191reasoning_tokens=8191,正文 0。模型不是没工作, 而是在用户看不见的地方想了近两分钟,然后把整段输出额度用光。

7 月 31 日,DeepSeek 在官方更新日志宣布 DeepSeek V4 Flash 正式版 API 上线公测。稳定调用名仍是deepseek-v4-flash;changelog 里的日期标签只是托管版本备注,不是新的模型字符串。我们先用官方/v1/models确认目录,再直连官方端点完成 Chat、Responses、Agent、长篇、RP 和写卡测试; 每个 case 只发一次,没有自动重试。

考卷:不是一句“你好”,而是连续写下去

协议分三层。第一层是 Chat 与 Responses SSE 加 Responses Agent 两步工具闭环;第二层复用既有 M69 考卷,在同一本中文长篇、同一起点、同一 21500 字滚动窗口下连续写 20 轮,与上线前 Preview 链对比; 第三层完全使用原创素材,none、low、high、max 各跑连续 12 轮,再补两张原创 RP 卡和一次四题材写卡。

原创长篇每轮明确要求 450–700 个中文字符、推进一个新动作或信息、不复述已发生剧情。这个长度闸很重要: “成功返回正文”只能证明接口完成,不能证明模型听话,更不能证明故事写得好。

20 轮对比:复读从 72.0% 降到 1.2%,文风却更远

指标上线前 Preview 链正式版上线日链
完成轮数20/2020/20
可见正文总字符65148761
跨轮 12-gram 最坏重叠72.0%1.2%
与原著结构画像距离(越低越贴)0.3560.550
翻转映射盲评1 票1 票

进步很具体:旧链第 14 轮与此前内容出现 72% 的机械重叠,正式版链最坏只有 1.2%,20 轮全部唯一。代价也很具体:它更愿意自己扩写,三轮超过 500 字、两轮超过 1000 字,结构画像离原著更远。 两位盲评员最终 1:1——一位判 Preview 文风和事实更稳,一位判正式版推进更强、没有“倒带”。

这组结果不支持“正式版全面提升 X%”。更准确的说法是:它把复读风险换成了更强的自主推进, 而自主推进有时就是擅自增加人物动机、规则和长段落。

8K 四档:none/low 跑满,high/max 会在正文前用完

effort8K 连续长篇正文首字/等待reasoning 与费用
none12/12;长度合规 0/12首正文中位 0.75s0 reasoning;$0.00464
low12/12;长度合规 0/12首正文中位 7.06s6179 reasoning;$0.00745
high首轮失败,正文 0109.5s 后截断8191 reasoning;$0.00252
max前三轮有正文,第4轮失败第4轮无正文第4轮 8189 reasoning

none 和 low 的问题不是“没生成”,而是写得太长:要求 450–700 字,两档都是 0/12 合规,none 正文中位 921 字,low 达 1303 字。low 还更慢、更贵,没有在这条链上换来可见质量收益。

32K 复测:长篇获救,质量没有自动变绿

随后只改一个变量,把 high 和 max 的输出上限放到 32768,各重新跑一条原创 12 轮链。两条都 12/12 完成且有正文,说明 32K 对普通长篇确实有效;但长度、事实和叙事结构留下了更有价值的结果。

32K 长篇完成与长度reasoning等待与费用
high12/12;仅3/12落在450–700字84322;单轮最高11642首正文中位89.5s;$0.02752
max12/12;仅2/12落在450–700字76972;单轮最高13232首正文中位43.5s;$0.02558

这次 high 反而比 max 思考更多、更慢、更贵。单次样本不能证明 high 永远比 max 重, 却足以否定“effort 档位就是单调的 token、速度或质量旋钮”。max 的主线更清楚,从 47 号柜一路推进到旧南闸、真管和主钟;同时也更臃肿,12 轮用了 55 次“像”,high 是 23 次, 两条链都反复套用“物件严丝合缝——弹出下一条线索”的机关流水线。

high 更克制,但事实纪律更差:时间先说往后拨、后面改成往前拨;墙上刻痕从 17 道变 7 道;同一块柳叶铜片一边在台面组装,一边又留在值班簿原位。max 也会硬填未给事实, 包括把手术金属扣解释成姐姐安装的拾音针,以及凭空落下一个精确日期。两条链几乎没有逐字复制, 病在语义和结构模板,不在复制粘贴。

我们另取两条链的第 1–2、6–7、11–12 轮做 A/B 匿名包,两位独立评审都在不知道档位的情况下判 B 小胜,置信度分别 0.77 和 0.76;揭盲后 B 是 max。两份评审都认为 max 的人物反应、因果衔接和语言节制更稳, 也都指出 high 晚段给出的“白塔号可能没有出海”“岑野当晚在船上”是更有分量的主线推进。 这是一场小胜,不足以把 max 升成默认档,尤其考虑到它后面的写卡归零。

复杂写卡揭示了 32K 的边界

high 的四题材卡在 32K 下完成:四卡结构、700–1000 字开场和示例对话全部通过,禁词 0,跨卡 15-gram 重合仅 0.08%;但它用了 30057 输出 tokens,其中 27099 是 reasoning,首正文等待 236 秒。都市与古风卡成品较好,怪谈卡出现楼层算术和状态冲突,网游卡则在已经进入队伍语音后又问“能不能上游戏看看”。

更关键的是 max:同一张 32K 考卷,32767 tokens 全部是 reasoning,正文仍是 0, 等待 293.9 秒、成本 0.00918 美元。此前另一次 max 32K 写卡曾在 16617 输出 tokens 时成功完成四卡; 一成一败说明:对已确认具备大输出窗的模型,32K 能降低截断概率;它不是能力保证,也不能 原样下发给小窗口 BYOK。更完整的预算解释见8K、16K、32K 的 reasoning 截断实测

RP:长度全绿,人物事实仍会乱补

high 4K 的两张原创角色卡共 8 轮,8/8 有正文且 8/8 落在 180–350 字,首正文中位 2.9 秒。人工通读仍抓出三种问题:替用户断言“不敢醒”的内心、为了化解伦理质疑临时编出母亲的许可式原话、 记录“借了伞”而用户从未借伞。长度闸通过,不等于角色扮演质量通过。

Responses Agent 与缓存:能用,但 required 组合不能用

Chat SSE 和 Responses SSE 都正常。Agent 使用 Responses 无状态两步方式:第一步返回 function call, 客户端执行工具,第二步重放 reasoning、function call 和 function_call_output。tool_choice=auto时两步都是 200,最终答案正确,第二步命中 512 个缓存 tokens。

thinking=max + tool_choice=required 则稳定返回 400:Thinking mode does not support this tool_choice。所以“模型支持工具”不等于所有 OpenAI 参数组合兼容;生产适配器应使用 auto 加清晰提示,不要机械强制 required。

费用、缓存与最终建议

发布日第一批全部官方调用约 0.07994 美元;新增 32K 质量批 34 次调用约 0.07195 美元。Responses 内容链都能看到 cached_input_tokens,但 cache_write_tokens 始终是 null, 因此只能证明缓存读取命中,不能虚构写入 token。价格按DeepSeek 官方定价页当日牌价计算, reasoning 已包含在输出 token,不重复收费。

给小说 App 的建议很清楚:普通续写默认 none 或 low;需要复杂规划时单次升档;high/max 至少给到 32K, 但仍要识别 incomplete/length + 正文0;“关闭思考”必须显式传 Responsesnone或 Chat thinking=disabled,省略字段会回到模型默认。服务端可以保留计费预扣, 但不能再用统一 8K 把 reasoning 和正文挤在同一个旧包络里。

样本边界也照实写:20 轮对比只有一本书、一个起点、每版一条链;32K high/max 各一条 12 轮链,无法证明普遍胜率。它能证明的是几个稳定的工程事实:正式版少了机械复读,effort 与真实思考量不单调, 32K 能救多数高思考长篇,却仍救不了每一次复杂 max 任务。

如果你正在 DeepSeek、Luna 和 Terra 之间选型,见三款模型的价格、长篇与 Agent 对表; 新文会明确区分同场证据和跨考卷建议,不把两套分数硬拼成总榜。

常见问题

DeepSeek V4 Flash 正式版写小说更强了吗?

不是全面升级。同题20轮里,跨轮12-gram逐字复读峰值从上线前 Preview 链的72.0%降到1.2%,剧情更愿意向前走;但与原著结构画像的距离从0.356变成0.550,长度服从和事实稳定也没有同步变好。两位翻转映射盲评员最终1:1,一位偏爱 Preview 的文风和事实纪律,一位偏爱正式版的推进与低复读。

为什么 DeepSeek 会显示 8191 reasoning tokens、正文却是空的?

Responses API 的 max_output_tokens 同时包含隐藏 reasoning 和可见正文。high档在8192上限下返回8191个output tokens,8191个全部是reasoning,终止状态为incomplete/length,因此没有额度再写正文。这不是输入上下文满了,也不是网络断流。

把 max_output_tokens 调到 32768 就一定能解决吗?

不能保证。32K让high和max两条原创长篇都跑满12轮,证明它能显著降低普通续写被思考截断的概率;但独立四题材写卡复测中,max仍把32767 tokens全部耗在reasoning,正文为0。32K只适合作为已确认具备大上下文和大输出窗模型的工程默认值,不应原样下发给小窗口BYOK,也不是模型不会再耗尽的承诺。

DeepSeek V4 Flash 正式版的 Agent 工具调用能用吗?

能,但参数组合有边界。Responses无状态两步工具链在tool_choice=auto时两步均为HTTP 200,第二步命中512个缓存tokens;thinking=max与tool_choice=required组合则返回400:Thinking mode does not support this tool_choice。生产适配器不能把“需要工具”机械翻译成required。

写小说应该选 none、low、high 还是 max?

本轮更适合作为默认值的是none或low。8K下两者都完成12/12,none更快、更便宜;high/max即使放到32K也没有稳定带来更好质量,反而大幅增加首字等待,并继续出现长度失控和事实矛盾。需要复杂规划时可以单次升档,但不建议把high/max当普通续写的全局默认。