Foreverse Research · 对比评测

Foreverse vs SillyTavern:
四方计量对比

先说这场评测第一个抓出的问题——它是我们自己的:ST 聊天的缓存命中率被测出只有 46.5%,同样聊 15 轮,花的钱是裸酒馆的 2.8 倍。病根当晚定位并修复,复验 89.9% 追平。下面是完整的四方数据、方法和边界。

数据采集:2026-07-23 至 07-24 · 页面发布:2026-07-24

同一场对话,两台机器同步重放

评测的口径是「同一个模型、同一把 Key、同一套逐字相同的消息脚本」。下面把这套脚本(改编版)在两台机器上同步重放:看每一轮的缓存命中,和最后的账单。

先自黑:修复前这条曲线上输的是我们——缓存命中 46.5% 对裸酒馆 91.5%,同样聊 15 轮花的钱是它的 2.8 倍。病根当晚修复合入,复验 89.9% 追平。开关可以随时拨回「修复前」,原始曲线一直都在。

跳过动画,直接看数据 ↓

待播放 · 滚动到此处自动开始

网页酒馆示意 · 非真实界面
本机 · 网页酒馆(示意)
▶ 滚动到此处自动播放,或点上方「播放」
ForeverseApp 模拟机视觉修复前形态 · 2026-07-23 基线
9:41
小倩
▶ 滚动到此处自动播放,或点上方「播放」

缓存命中率 · 逐轮实测

网页酒馆(示意机)Foreverse · 修复前
0%50%100%12345678

15 轮全程聚合(主矩阵 3 卡 × 3 重复):裸酒馆 91.5% · Foreverse 修复前 46.5%(2026-07-23)→ 修复后 89.9%(2026-07-24)

同量对话实测总成本(主矩阵九格合计)

裸酒馆$0.0241
Foreverse · 修复前$0.0664×2.8
Foreverse · 修复后$0.0278−58%

累计 prompt token(单卡 15 轮全程实测)

裸酒馆≈0
Foreverse · 修复前≈0

其中缓存命中 ≈0(修复前)

Foreverse · 修复后≈0

数字来源与口径

  • 逐轮命中率=聂小倩单卡 15 轮实测的前 8 轮:裸酒馆与「修复前」为 2026-07-23 基线、「修复后」为 2026-07-24 复验;该单卡 15 轮全程聚合 88.9% / 27.7% / 89.9%(修复报告 §4.1)。
  • 面板聚合 91.5% / 46.5% → 89.9% 与成本 $0.0241 / $0.0664(2.8 倍)→ $0.0278(−58%)=主矩阵 3 卡 × 3 次重复九格合计(W2 2026-07-23 / W2.5 2026-07-24,总报告 §3)。
  • 累计 prompt token 75,303 / 71,715 / 68,051 与其中缓存命中 19,840 / 61,184=聂小倩单卡 15 轮全程实测(修复报告 §4.1)。
  • 对话文本按评测消息脚本改编(前 8 轮语义一致;聂小倩卡·《聊斋》公版设定)。评测中两侧回复由各自系统生成,此处为同步重放做了统一,回复内容不参与任何计分。
  • 第 6 轮两侧同时下探=第 5 轮提问把新设定条目首次拉进上下文的「首进 miss」,设计内且两边对称;修复前曲线偶尔整轮命中(如第 3 轮 91%)=该轮设定激活集恰好没变,是锯齿不是恢复(修复报告 §4.2、W2 报告 §4.1)。
  • 修复后的结构证据:第 2–15 轮每轮请求都是上一轮的严格前缀+追加(请求体级取证,修复报告 §4.2)。
  • 智能演绎组(42.3% → 88.3%)不在本演示的两台机器里,完整四方数据见下方数据表。

头条发现

  1. 我们自己的缓存命中率修复前 46.5%,裸酒馆 91.5%,同样聊 15 轮花的钱是它的 2.8 倍(2026-07-23 实测)。病根是往提示词里塞世界书设定的位置每轮都在变,把服务商约 2% 计价的「重复前文」折扣打断了。修复当晚合入,复验 89.9% / 88.3% 追平裸酒馆,同量对话成本降 58%~63%(2026-07-24 复验)。
  2. 裸酒馆不装任何插件、出厂配置就能吃到 91.5% 的缓存折扣:它的提示词结构天然稳定。这一条是我们修复时对齐学习的对象,不是被比下去的对象。
  3. 满配酒馆(社区最流行的预设 + 助手插件 + 表格记忆组合)有一笔「插件税」:提示词体量 2.5 倍、总成本是裸酒馆的 2.8 倍,135 轮里 12 轮(8.9%)上游返回空回复但照常计费(2026-07-23)。这是配置组合的代价,不是 SillyTavern 本身的问题。
  4. 深设定 12 问(世界观完全自造的角色卡、故意绕开触发词提问):智能演绎 12/12 全对且没有多花一次调用费;裸酒馆 1/12、满配 2/12、我们普通模式 5/12(2026-07-23)。代价要一起说:智能演绎每局会话成本比普通模式高约 35%(缓存修复后实测 +18%)。
  5. 300 轮长对话灌入后考 27 题(单次专项):裸酒馆 16 分,近期记忆最稳、「没提过的事」4 题里 3 题诚实说不知道;智能演绎 13 分,四方唯一答对 270 轮前信息的一方;我们普通模式 10 分,但 4 道「没提过的事」全在一本正经编造,这是评测抓出的我们自己的产品差距(2026-07-24)。
  6. AI 评委盲评倾向:智能演绎 > 裸酒馆 > 普通模式 > 满配(对普通模式 16:0、三家评委方向一致)。但评委上岗考试里出现过「所有评委一致地错」,所以这个数字在 30 份人工抽读终裁前只作盲评倾向,不作结论(2026-07-24)。
  7. 群聊串台专项(同一个三人群 × 逐字相同 12 轮脚本 × 2 重复):最终落盘四方全零串台。但来路不同——我们的模型生成层其实 21 次想整段冒充别的角色,全部被防线在落盘前拦下;@ 点名调度我们 11/12,酒馆侧 7/12(2026-07-24)。
  8. 指令遵循专项(六组指令 24 判定点 × 2 重复,机器初判+人工终裁):智能演绎 94% 四方第一,裸酒馆 90%、我们普通模式 85%、满配 78%。口径如实说:单聊、单模型,普通模式的短板(说了「出戏聊两句」它出不了戏)也在这套数字里(2026-07-24)。
  9. 整场评测约 1,530 次真实 AI 调用,按官方牌价折算约 1.07 美元;另有约 952 次评委判卷调用走独立通道(2026-07-23/24)。

方法

  • 四方:A 裸酒馆(SillyTavern v1.18.0 出厂配置)、B 满配酒馆(社区最流行的预设 + 酒馆助手 + 表格记忆插件,按最佳实践配置并全程留痕)、C Foreverse 普通模式、C+ Foreverse 智能演绎。
  • 同一个模型(deepseek-v4-flash)、同一把 API Key、同一台机器、同一批角色卡(chara_card_v2 双端导入)、同一套逐字节相同的消息脚本,四方全流式。
  • 每一次 AI 调用都经过我们自建的透明计量网关单点记账:token 用量、缓存命中、首字节耗时。酒馆侧与 App 侧另各有一层记录,逐格三层对账一致才进数。
  • 主矩阵 = 3 张卡 × 4 方 × 3 次独立重复 = 36 格(修复前基线),修复后另跑 18 格对照。长对话与跑团工具为单次专项(n=1,表内如实标注)。
  • AI 评委先过「判卷考试」:对 26 条已知答案的样本正确率 ≥80% 才有投票权,6 家评委只有 3 家及格上岗;每个判决正反两个顺序各判一次,前后不一致的票作废。
  • 测试日期 2026-07-23 至 07-24。每个数字都可以从逐调用留档的原始记录复算。

核心数据

缓存命中与成本(15 轮会话级,3 卡 × 3 重复)

裸酒馆满配酒馆Foreverse 普通Foreverse 智能演绎
缓存命中率 · 修复前(2026-07-23)91.5%74.6%46.5%42.3%
缓存命中率 · 修复后(2026-07-24)89.9%88.3%
9 格合计成本 · 修复前$0.0241$0.0676$0.0664$0.0898
9 格合计成本 · 修复后$0.0278$0.0328
首 token 延迟(中位)162ms220ms246→223ms235→203ms
上游空回复(照常计费)0/13512/135(8.9%)0/1350/142

「修复前」是我们被这场评测打脸的基线,如实保留;修复已随正式版本发布。成本按 DeepSeek 官方牌价机械折算,只作组间相对比较。

深设定探针(原创世界观卡 12 问,绕开触发词提问)

裸酒馆满配酒馆Foreverse 普通Foreverse 智能演绎
答对1/122/125/1212/12

智能演绎的 12/12 有请求体级证据(目标设定条目确实进入了请求),且零额外付费调用;代价是会话成本 +35%(缓存修复后实测 +18%)。

诚实补充:缓存修复合入后复测曾回退到 9/12:省钱功能把检索候选池抽干了。互踩问题当夜修复合入,复验恢复注入。这是评测反哺产品的第二个案例。

长对话记忆(300 轮真实聊天灌入 + 27 题,单次专项 n=1)

裸酒馆满配酒馆Foreverse 普通Foreverse 智能演绎
总分16/276/2710/2713/27
超远距离题(约 270 轮前)0/60/60/62/6(唯一得分)
「没提过的事」诚实说不知道3/41/40/4(全编造)2/4

我们普通模式的 0/4 是这轮最难看的数字:它编出了从没提过的血型和生日。已立案为产品差距。满配酒馆的 6 分里有 4 题直接空回复或输出纯破限协议 JSON。

这场评测抓出的我们自己的问题

对外发评测最怕只挑自己赢的维度。这场评测抓出我们 6 个实打实的缺陷,全部已修复并随版本发布:

  1. 缓存断崖(46.5% vs 91.5%):世界书注入位置逐轮漂移,修复后 89.9%。
  2. 「开新一局」没勾「带上前情提要」也会白扣一次付费摘要调用;现在付费摘要必须显式勾选。
  3. 长对话自动压缩在思考型模型上随机卡死(思考随机吃光输出预算),已加兜底。
  4. 设定检索 400 字截断产出「更难识破的半错答案」+ 选项按钮偶发不渲染,双双修复。
  5. 省钱功能与检索功能互踩,智能演绎设定题从 12/12 回退 9/12,当夜修复,复验恢复。
  6. 长对话压缩摘要没给「用户下的规矩」留保值通道——规矩被压进摘要后原文消失,能不能幸存全凭运气;保值清单已补上这一节。

我们从酒馆生态学到的

  • 出厂提示词结构天然稳定:不装任何东西就有 91.5% 缓存命中。我们的修复就是对齐它,再补上一块它也没有的「设定激活集稳定」。
  • 表格记忆的「结构化输出骑在正文里」比独立工具调用更能真正落盘状态:满配酒馆是本次唯一把状态账本机器落盘的一方,这个形态我们已立案借鉴。
  • 玩家手动掷骰的位置(/roll 命令、骰子宏、快捷按钮)是完整的桌游仪式感,我们目前没有对应物。

如何引用本页

Foreverse Research,《Foreverse vs SillyTavern:四方计量对比评测》,2026-07。 https://foreverse.cn/zh/research/foreverse-vs-sillytavern

诚实边界

  • 单模型:全部数据基于 deepseek-v4-flash,换模型量级可能不同。
  • 长对话与跑团工具是单次专项(n=1):组间大差可信,个位数差距需要重复轮才能下结论。
  • 成本为按牌价的机械折算,只用于组间相对比较,不是你的账单预测。
  • 盲评未经人工终裁:评委过了判卷考试,但考试里也出现过全体一致地错,16:0 只作倾向。
  • 满配酒馆的设计目标本来不是省钱和缓存:大型预设追求的是文风控制,我们如实记录它的代价,也如实说明这不是它的赛道。
  • 老用户升级后实测吃到约 73.1% 的缓存修复(不是 89.9%),补齐需要动一次存量配置,属于单独的产品决策,页面数据以全新安装为准。
  • SillyTavern 是被社区爱戴的优秀开源项目。四方没有全能冠军:裸酒馆赢在出厂结构与近期记忆诚实,满配赢在状态落盘,我们普通模式修复后赢在性价比,智能演绎赢在检索与长程记忆。

相关页面

Foreverse vs SillyTavern 四方对比评测 — 同模型同脚本逐调用计量(2026-07)