Foreverse Research

研究中心:
数据都能复算,缺陷也在页上

我们围绕「AI 读小说、写小说、扮演角色」做第一手评测:同尺条件、双盲评审、逐调用计量,原始数据归档可复算。这一页是全部研究资产的门面——写文章要引数据,从这里拿。

研究资产

AI 续写小说排行榜(Fiction Bench)九个模型 × 两种文体 × 每链 20 轮连续续写,双盲位次 + 结构指标 + 三种长程失效模式分类学;新模型发布 48 小时内按同协议加测。9 模型 · 双盲 · 数据快照可下载 · 2026-07Foreverse vs SillyTavern 四方对比评测同模型、同 Key、逐字节相同脚本,每次调用过同一个计量网关:缓存命中、成本、深设定、长对话记忆——包括这场评测抓出的我们自己的缺陷。四方 · 逐调用计量 · 2026-07中文续写实录馆AI 写崩的三种现场证据原文陈列:从头复读、中途卡死、尾段回卷——九模型 20 轮链的失效标本逐段可查,重复率可复算,附「AI 评委正确率 12%」的评审可靠性研究。3 失效模式 · 原文标本 · 2026-07角色卡宇宙普查对一个中文角色卡社区的人口普查:9.5 亿次对话、4,596 位创作者、9,995 个标签的聚合统计——热度金字塔(1% 的卡吃走 40.3%)、83% 男性角色的人口结构、标签供需错位榜、热门卡的工程规格。19,776 卡 · 只出聚合统计 · 快照 2026-07缓存经济学:命中率与真实账单同一段 15 轮聊天、同模型同 Key 逐字节相同脚本:命中率 46.5% 的装配比 91.5% 的贵 2.8 倍。十二款模型缓存读价倍率表、四个带修复前后数字的杀缓存病例、六条自查清单。四方计量 · 12 模型读价表 · 2026-07

研究档案(可引用长文)

排行榜和评测页背后的完整实验记录,按发表形态归档在博客——每篇都有样本量、日期和方法节。

年度数据报告

还没到发的时候,先不占位。原料在自动积累:模型价格表每天归档一份快照(从 2026-07 起)、每场评测的原始链和判决都进研究档案。攒够一个年度,第一份报告会出现在这一页。

我们怎么做研究

  • 同尺条件:对比类评测里各方用同一个模型、同一把 Key、逐字节相同的脚本,每次 AI 调用都经过同一个计量网关记账;不同条件下采的数字不同台展示。
  • 排序靠双盲:排名类结论一律双盲评审、两套随机映射对冲位置偏差;前后判决不一致的票作废,不进结论。
  • 评委先考试:AI 评审员要在已知答案的样本上达到 80% 正确率才有投票权。我们自己发过「评委一致地错」的研究——所以关键结论要么人工终裁,要么只写「倾向」。
  • 结构指标只当闸门:句长、对话率、复读检测用来抓回归、交叉验证盲评;「像不像人写的」这类裁决不交给统计。
  • 自家缺陷如实入表:评测抓出我们自己的问题照样发(缓存命中率被打脸、指令措辞 bug 都在页上),修复过程公开。
  • 可复算:原始 20 轮链全文、盲评映射密钥、评审判决、逐调用计量日志全部归档;数据页提供 JSON 快照下载。

如何引用

引用惯例:Foreverse Research + 页面标题 + 年月 + 页面 URL。数据类页面都带 JSON 快照下载;转载数字请一并注明我们标注的采集日期——hosted 模型是移动目标,日期是结论的一部分。

Foreverse Research,《AI 续写小说排行榜(Fiction Bench)》,2026-07,https://foreverse.app/zh/research/fiction-bench

← 全部免费工具

Foreverse Research 研究中心 — 评测数据全部可复算