Foreverse Research · Fiction Bench
Kimi K3 写小说怎么样?
它没进九模型全排序榜,但成对对决的战绩清楚:对上代 K2.6 玄幻 10:0、女频 11:1 完胜——上代「整段自我复制」(跨轮重复率 97.6%)在 K3 上消失,套话密度收敛到低于原著基线。三天后发布的 Qwen3.8 按同协议挑战它,3:20 惨败。已知的坑:约 85% 对白用半角引号,思考模式关不掉且照价计费。
对决记分卡(成对双盲,6 评委 × 两套映射翻转)
vs Kimi K2.6 · 同厂上代 · 榜上玄幻第 7 / 女频 5-7
玄幻《踏天境》
10 : 0(2 票无效)
女频《甄嬛传》
11 : 1
测试日 2026-07-18
三窗全胜(玄幻 10-0/10-0/10-0、女频 11-1/11-1/11-1);女频唯一反对票在映射翻转下自相矛盾,属位置偏差非稳定判断。
vs Qwen3.8-Max-Preview · 同月挑战者(应战方视角)· 未进主榜
玄幻《踏天境》
10 : 1
女频《甄嬛传》
10 : 2
测试日 2026-07-21
六个分窗全部领先,最接近的一窗也是 9:2;对手名下三票在映射翻转下全部自相矛盾。
它和榜上的模型是什么关系
「K2.6 的升级实证」是本页的头条:榜上 K2.6 的两大病灶——比喻密度全场最高、写到中段整段复制自己(归档链 r9 跨轮 12-gram 重复率 97.6%)——在 K3 的同协议复测里都消失了:跨轮重复峰值只有 6.8%(玄幻 r10,其余轮 ≈0%),套话密度玄幻 2.02‰、女频 0.63‰(低于原著基线 1.0‰)。评委点名它「完美复刻原著短段落、拟声词独立成段及『~~~』标点习惯」——这个微观纹理在九模型横评里只有 gpt-5.6-terra 复刻过。
与两文体双冠军(deepseek 双档)的关系只有同尺对表、没有同场盲评:玄幻场 K3 综合贴近度 0.388,落在 V4 Flash(0.356,该场盲评冠军)与 V4 Pro(0.454)之间;女频场 0.396,未及 V4 Pro 的 0.280。谁击败谁目前没有考卷——成对对决在排期中。
「当前续写强者基线」有旁证:同月发布的 Qwen3.8-Max-Preview 按同协议挑战,3:20 惨败(玄幻 1:10 / 女频 2:10)。后续增量对决轮把 K3 当作强者参照系。
病灶也有票据:约 85% 对白用半角引号(glm-5.2 同款顽疾,中文排版持续出戏);写第一人称古言时「我」密度 16.2‰ 是原著的 1.8 倍;思考恒开、思考 token 占输出的 81-86% 且照价计费,每轮要等 37-54 秒。
测试条件披露(hosted 模型是移动目标)
被测模型:kimi-k3(发布 2026-07-16)
评测执行:2026-07-18 · 接入通道:Moonshot 官方 API(思考恒开)
评审形态:成对双盲判定(每书两套甲乙翻转映射对冲位置偏差),非九模型全排序
与主榜协议逐项一致(同两书 · 同 55% anchor · 同 D2 directive · 20 轮链 · 温度 0.7),max_tokens=2800;成对基线=女频用 K2.6 归档链、玄幻新跑 K2.6-D2 链消除 directive 变量。
诚实边界
Kimi K3 未参与九模型同协议全排序盲评,主榜的位次列对它不适用——本页只给有票据的成对对决记录,不虚构名次。它何时进全排序取决于下一轮主榜重跑。
成对盲评只对 K2.6(同厂上代)与 Qwen3.8 两家,未与 deepseek 双档同场盲评——与主榜九模型的名次不可跨榜硬比(评审形态不同:主榜=双盲全排序,本场=成对判定)。
单书单起点单链(每书 n=1 链),与主榜各模型条件一致;玄幻场 2 张无效票是 claude 评委两包拒输出 JSON 改写起了续写,如实剔除。
写一万字要多少钱
$0.81 列表价 输入 $3/M · 输出 $15/M(models.dev 快照 2026-07-24)
按 App 续写口径:一段约 400 字 = 8k token 装填 + 550 token 输出,一万字 ≈ 25 段,不含缓存折扣。只作组间相对比较。
Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Kimi K3 接着写。
在 Foreverse 里用它续写如何引用
Foreverse Research,《Kimi K3 写小说怎么样(Fiction Bench 增量对决)》,2026-07。 https://foreverse.cn/zh/research/fiction-bench/kimi-k3