板报 · Field notes

阅读与酒馆的工程笔记

我们一边做一个装进口袋的阅读器和酒馆,一边把路上的坑、取舍和实测记下来。没有软文腔,全是踩过的路。

书案上,一柄戴着冠军绶结的绣叶团扇正对一面铜镜,镜中映出同一柄扇,枝叶更新了一簇
模型评测2026年8月13日9 分钟

DeepSeek V4 Pro 正式版上线两小时,我们安排它挑战卫冕冠军——它自己的旧版

DeepSeek V4 Pro 正式版(0813)官宣当晚一到两小时内,我们按九模型横评同一套协议做了增量实测:两本书各连续续写 20 轮,与自家 preview 前代(0716 快照)成对双盲。女频《甄嬛传》场 1:11(跨映射稳定票 0:5)、玄幻场 3:9(稳定 0:3);挑战玄幻现任冠军 V4 Flash 0716 快照的第三场也是 3:9。败因是「现代文艺化」漂移:高武玄幻写成低武武侠,甄嬛体写成现代疼痛文学,「像」字系比喻密度是前代 2.2 倍,皇后居所写成电视剧设定「景仁宫」6 次。机械层反而全干净:40 轮零逐字循环、零半角引号。比比分更要紧的发现:官方 API 不换 ID 热切权重,同一个 deepseek-v4-pro 字符串,7 月与 8 月是文风判若两人的两个模型——榜上的冠军已经调不到了。全实验成本约 5 元。

读全文 →
旧纸画风的剪刀把长稿纸剪成小块,小纸块落进黄铜手摇漏斗,出口只滚出几枚硬币
API 实测2026年7月31日7 分钟

8191 个 token 全在思考、正文为 0:DeepSeek 的 max_output_tokens 到底该设多少

DeepSeek Responses 返回HTTP 200却没有正文,usage里8191个output tokens全部是reasoning,通常不是网络故障,而是隐藏思考耗尽max_output_tokens。本文用DeepSeek V4 Flash 0731的8K、16K、32K真实请求解释output_tokens与reasoning_tokens关系:8K high首轮归零,16K max四卡只剩开头,32K能跑完high/max长篇,但max复杂写卡仍可能耗尽32767 reasoning。附Chat与Responses参数、Agent工具边界、计费预扣和生产兜底。

读全文 →
旧纸画风的两张写字桌,中间隔着一条墨河;左桌稿纸整齐成册,右桌散落着大量续写页
模型评测2026年7月31日9 分钟

DeepSeek V4 Flash 正式版上线当天,我们让它连续写小说:复读少了,high/max 却会把 32K 也吃进思考

DeepSeek V4 Flash 正式版 API 上线公测当天实测:官方 Chat、Responses、Agent 工具闭环、同题20轮长篇、原创12轮续写、角色扮演和四题材写卡。新版把跨轮逐字复读峰值从72.0%降到1.2%,但文风距离变大;8K下high首轮8191 tokens全是reasoning、正文为0。把输出放到32K后high/max长篇均跑满12轮,却仍有长度失控、事实矛盾和机关模板化;max复杂写卡再次耗尽32767 reasoning、正文为0。

读全文 →
手绘墨线插画:小小的人影站在梯子上从高书架抽出一本发光的书,纸页和索引卡飘向下方的书桌
模型评测2026年7月31日8 分钟

DeepSeek V4 Flash 正式版上线当天,我们让 App Agent 在一部 385 章长篇里自主挑场面改写

DeepSeek V4 Flash 正式版 API 上线公测当天,用同一本 385 章都市长篇、同一句用户话术,在 Foreverse App Agent 里复跑「读章裁量、挑场面改写」。书存活、写失败 0 次、章级工具调用约 174 次、整文件改写 0 次;净增≥300 字的章 13 章,耗时约 19 分钟。对照 7 月 21 日同模型 ID 基线:工具纪律明显更稳,吞吐没有变快。

读全文 →
六支毛笔在同一张卷轴上临写同一段文字,其中一支朱红毛笔落笔最稳
模型评测2026年7月31日10 分钟

GPT-5.6 Luna 六档思考强度对上 Terra Medium,长篇续写谁赢?

GPT-5.6 Luna none/low/medium/high/xhigh/max 与 Terra medium 的 32K 长篇续写正式矩阵:560 个计划轮次、548 次完整正文、5 次 incomplete_stream,两场中文小说各跑两条 20 轮链。两个隔离的模型评审会话独立盲评,Terra medium 以 4.725/5 第一,Luna high 是 Luna 内部最佳。附质量、成本、首正文速度、链完整度与 450–700 字服从率。

读全文 →
三份写作考卷并排摊开,分别标注 DeepSeek V4 Flash、GPT-5.6 Luna 与 GPT-5.6 Terra
模型对比2026年7月31日10 分钟

DeepSeek V4 Flash、GPT-5.6 Luna 和 Terra 写小说怎么选?先把两张考卷放对位置

DeepSeek V4 Flash 0731 正式版与 GPT-5.6 Luna / Terra 的真实小说测试对表:官方输入、缓存与输出价格,32K 长篇完成度、首正文等待、450–700 字服从、reasoning 截断、Agent 工具和缓存。明确披露两批不是同场盲评:Terra medium 是 Luna/Terra 正式矩阵第一,DeepSeek none 最便宜,但不能把不同考卷硬排成总冠军。

读全文 →
暖纸底色上的墨线插画:一支毛笔沿着前人字迹的虚线继续书写,笔尖旁放着三件小工具——一枚刻着「基准」的印章、一把标尺、一排可挑选的笔头
AI 续写2026年7月27日7 分钟

保持文风不靠玄学:实测有效的三层做法

「续到第三十段,原著那股劲儿没了」有解法。想让 AI 续写保持文风,我们用一本 890 万字的玄幻和《后宫·甄嬛传》跑了六百多轮续写生成找答案:提示词里一句话把文风基准说死(比喻套话密度约减半)、给上下文标注哪段是原著哪段是 AI(重度续写的长跑保护器)、按文体选模型(两种文体的第一名互不重叠)。三层做法逐层给数据,附能直接抄的指令原句和一个措辞翻车案例。

读全文 →

更早的文章(112)

2026 年 7 月