DeepSeek V4 Flash、GPT-5.6 Luna 和 Terra 写小说怎么选?先把两张考卷放对位置
DeepSeek V4 Flash 0731 正式版与 GPT-5.6 Luna / Terra 的真实小说测试对表:官方输入、缓存与输出价格,32K 长篇完成度、首正文等待、450–700 字服从、reasoning 截断、Agent 工具和缓存。明确披露两批不是同场盲评:Terra medium 是 Luna/Terra 正式矩阵第一,DeepSeek none 最便宜,但不能把不同考卷硬排成总冠军。

把三篇报告分开看,答案像是在互相打架:Terra medium 拿了 Luna/Terra 正式盲评第一,DeepSeek V4 Flash 便宜得多,Luna high 又是 Luna 内最实用的质量档。问题不在分数不够多,而在两套考卷不能混成一张总榜。
下面只对齐 2026 年 7 月 31 日已经完成的两批真实 API 实验,不补造样本,也不把接口成功率当小说质量。 DeepSeek 流量直连官方端点;Luna/Terra 正式长篇走 Requesty Responses。两边都测了 32K、连续续写、 reasoning、缓存和 Agent,但题材、链数与评审表不同。
两张考卷哪些能比,哪些不能比?
| 项目 | DeepSeek V4 Flash 0731 | GPT-5.6 Luna / Terra | 能否直接排同榜 |
|---|---|---|---|
| 正式路径 | DeepSeek 官方 Chat / Responses | Requesty Responses;协议另有双中转生产验证 | 只能比较已观察行为 |
| 长篇规模 | 旧考卷 20 轮单链;原创每档 12 轮单链 | 28 条计划链、最多 20 轮;548 次完整正文 | 不能比较成功率 |
| 32K | high/max 各 12/12;复杂 max 写卡仍归零 | 548 次完整调用都有正文;5 次流未完成 | 可以比较截断边界 |
| 长度要求 | 原创链要求 450–700 字 | 两个原创题材同样要求 450–700 字 | 可看服从,但题材不同 |
| 质量评审 | high/max 匿名 A/B;max 两票小胜 | 两个隔离模型会话、五维 84 行评分 | 不能换算分数 |
| Agent | auto 两步闭环;required + max 返回 400 | Luna/Terra 两条中转均完成两步工具链 | 可以比较参数边界 |
| 缓存 | 读命中;write tokens 为 null | 两中转读命中;write tokens 为 null | 结论一致 |
价格先放同一把尺:DeepSeek 最便宜,Terra 最贵
下表是 2026-07-31 的官方短档美元价,以及 Foreverse 统一加价 50% 后的 credits。1 credit = $0.0001。DeepSeek 没有单列缓存写入价;Luna/Terra 只有在上游返回cache_write_tokens 时才按写入档结算,字段为 null 时保持未知。
| 模型 | 官方输入未命中 $/M | 官方缓存读 $/M | 官方缓存写 $/M | 官方输出 $/M | App +50% credits/M:输入 / 读 / 写 / 输出 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.0028 | 未单列 | $0.28 | 2100 / 42 / — / 4200 |
| GPT-5.6 Luna | $0.20 | $0.02 | $0.25 | $1.20 | 3000 / 300 / 3750 / 18000 |
| GPT-5.6 Terra | $2.00 | $0.20 | $2.50 | $12.00 | 30000 / 3000 / 37500 / 180000 |
Luna 的未缓存输入价约为 DeepSeek 的 1.43 倍、缓存读取价约为 7.14 倍、输出价约为 4.29 倍; Terra 的输出价约为 DeepSeek 的 42.86 倍。统一加价不会改变这些倍率。价格来源分别是DeepSeek 官方价目和OpenAI 官方价目。
真实长篇现场:把总成本除以各自完成轮数,但别假装输入相同
为了避免拿 12 次总价和 80 次总价硬比,下面展示每个已完成轮次的观察均价。DeepSeek 行先按官方成本乘 1.5,再除以完成轮数,尚未叠加每请求向上取整;Luna/Terra 直接使用正式矩阵的逐笔统一用户价。 这仍不是严格价格基准,因为故事、输入长度和缓存命中率不同。
| 配置与包络 | 正文完成 | 450–700 字 | 首正文中位 | 观察均价 / 完整轮 | 质量证据 |
|---|---|---|---|---|---|
| DeepSeek none · 8K | 12/12 | 0/12 | 0.75s | 约 $0.000580 | 未做三家同场评分 |
| DeepSeek low · 8K | 12/12 | 0/12 | 7.06s | 约 $0.000931 | 本链未见相对 none 的可见增益 |
| DeepSeek high · 32K | 12/12 | 3/12 | 89.5s | 约 $0.003440 | 匿名 A/B 负于 max |
| DeepSeek max · 32K | 12/12 | 2/12 | 43.5s | 约 $0.003198 | 匿名 A/B 两票小胜 high |
| Luna none · 32K | 80/80 | 21/80 | 2.256s | $0.006008 | 五维均分 3.658 |
| Luna high · 32K | 77/78 | 32/77 | 16.420s | $0.008469 | 五维均分 4.175;Luna 第一 |
| Luna max · 32K | 80/80 | 27/80 | 14.652s | $0.008514 | 五维均分 3.950 |
| Terra medium · 32K | 78/79 | 34/78 | 3.429s | $0.057617 | 五维均分 4.725;该场第一 |
如果先看钱包,DeepSeek none 没有悬念。Luna 内部则只有 high 真正拉开了质量差距;Terra medium 贵得多,也拿到了它所在矩阵里最强、最稳的质量证据。到这里为止都能从表里直接读出来。表里读不出来的是 “DeepSeek 便宜所以一定写得差”,更读不出“Terra 的 4.725 已经同场击败 DeepSeek”。
32K 的差别:三家都受益,DeepSeek max 的复杂任务风险更显眼
旧 8K 下,DeepSeek high 首轮用了 8191 个 reasoning tokens 后正文为 0;Luna 的旧筛选也出现过 8192 输出全部进 reasoning。放到 32K 后,DeepSeek high/max 两条普通长篇均跑满 12 轮,Luna/Terra 的 548 次完整调用也全部有正文。这说明把大窗口模型统一压在 8K 确实过死。
但复杂任务揭示了差异:DeepSeek high 的四题材卡虽然完成,首正文等了 236 秒并用了 27099 reasoning; max 则等 293.9 秒,把 32767 tokens 全部耗在 reasoning,正文仍为 0。Luna/Terra 本轮没有同规模、 同评分的正式写卡对照,所以不能宣布它们写卡更强;能确定的是,生产端仍要识别incomplete/length + 正文 0,不能把 32K 当保证书。
Agent 与缓存:都能用,但不能共用一套强制参数
| 能力 | DeepSeek V4 Flash | Luna / Terra | App 路由建议 |
|---|---|---|---|
| 流式文本 | 官方 Chat、Responses 均完成 | Inroi Chat、Requesty Responses 均完成 | 客户端保持统一 Chat SSE |
| 工具第一步 | Responses auto 返回 function call | 两条中转均返回工具调用 | 后端按上游协议转换 |
| 工具结果回传 | 第二步 200,答案正确 | 两款模型、两条路均闭环 | 只结算一次最终 usage |
| 强制工具 | thinking=max + required 返回 400 | 命名工具选择经转换后可用 | DeepSeek thinking 使用 auto + 明确提示 |
| 缓存读取 | 工具第二步命中 512;内容链也有命中 | 两家中转均观察到命中 | 只按权威 cached tokens 计价 |
| 缓存写入 | cache_write_tokens=null | cache_write_tokens=null | 保持未知,不猜 0 |
按你正在写的那一段来选
最低成本草稿与高频试写:DeepSeek none。它在独立链里首正文 0.75 秒,价格最低, 但长度服从 0/12,App 需要更强的终止与长度控制。
普通逐段续写:Luna none/low 或 DeepSeek none。偏预算选 DeepSeek,偏向更大规模的 正式长篇证据选 Luna;两边都不该把高 effort 设成全局默认。
重要章节的质量升级:Luna high。它是 Luna 六档中唯一明确拉开质量的档位,首正文中位 16.420 秒;xhigh/max 没有继续涨分。
预算允许、追求现有最强质量证据:Terra medium。它在两题材、四计划链的正式矩阵中 以 4.725 第一,但这句话的边界是“现有最强证据”,不是“已经同场战胜 DeepSeek”。
如果要回答真正的三家冠军,只能开一份新考卷:相同原创题材、相同上下文、相同 32K、相同轮数、相同盲包, 再让 DeepSeek none/low、Luna high 与 Terra medium 同场。在那之前,可以据此定价格、工程风险和 App 默认值;三家质量总榜先空着,比硬凑一个冠军诚实。
原始结论可分别回看Luna / Terra 第 1 轮与第 20 轮完整原文盲读、DeepSeek V4 Flash 0731 正式版实测、Luna/Terra 548 次正式盲评和Luna/Terra API、缓存与统一价格。要从九个模型、两种文体 的总入口开始看,回到AI 续写小说模型选型页。
常见问题
DeepSeek V4 Flash、Luna 和 Terra,谁写小说最好?
目前不能给三家同场总冠军,因为 DeepSeek 与 Luna/Terra 没有跑同一批题材、同一盲包和同一评分表。现有最强质量证据是:Luna/Terra 的 548 次正式矩阵中 Terra medium 以 4.725/5 第一,Luna high 以 4.175/5 第二;DeepSeek 的独立 32K 原创链里,两位匿名评审都判 max 小胜 high,但这组票不能换算进前一张榜。
DeepSeek V4 Flash 真的比 Luna 便宜吗?
按 2026-07-31 官方短档,DeepSeek 缓存未命中输入/缓存命中/输出分别为 $0.14/$0.0028/$0.28 每百万 token,Luna 为 $0.20/$0.02/$1.20。也就是 Luna 输出价约为 DeepSeek 的 4.29 倍,缓存读取价约为 7.14 倍。Foreverse 对两者统一加价 50%,倍率关系不变。
哪个适合普通逐段续写?
预算最优先可从 DeepSeek none 开始;它在独立 12 轮链里最快、最便宜,但 450–700 字服从为 0/12,需要更强的长度约束。想要规模更大的质量证据与较稳定的等待,Luna none/low 更适合日常;重要章节按次升 Luna high。预算允许并追求本轮最高质量证据时选 Terra medium。
三款模型给到 32K 就不会再空正文了吗?
不会。Luna/Terra 正式矩阵的 548 次完整调用都有正文,说明 32K 消除了旧 8K 下 reasoning 先吃满的主要截断;DeepSeek 的 high/max 32K 长篇也各完成 12/12。但 DeepSeek max 的复杂四卡任务仍出现 32767 tokens 全是 reasoning、正文为 0。32K 是风险缓解,不是能力保证。
DeepSeek、Luna、Terra 的 Agent 工具都能用吗?
能,但边界不同。DeepSeek Responses 在 tool_choice=auto 下完成两步工具闭环,thinking=max 加 required 则真实返回 400;Luna/Terra 经 Foreverse 的 Chat 接口和后端 Responses 转换,两个中转都完成了工具调用与工具结果回传。生产路由不能把所有模型都机械强制成 required。