Labs · 缓存计算器

长对话开 Prompt 缓存能省多少,
真实价差算。

免费本地计算 · 不上传命中率数据来自实测
每轮长度
实测锚点:

省下

0%

¥2.63¥0.386

缓存读价 $0.0028/M,是全价 $0.14/M 的 2.0%

成本随轮数累积(同一场聊天的两种账)

¥2.63¥1.31150100
无缓存 ¥2.63按命中算 ¥0.386
什么会打断缓存(为什么很多人吃不到这个折扣)

前缀缓存的规则只有一条:这一轮请求从第一个字节起、和上一轮逐字相同的部分,按折扣价重读。所以打断它的方式全都是「让开头变了」。

第一种:注入位置漂移。世界书、设定条目每轮插进对话历史的不同位置,插入点之后的全部内容作废重算。我们自己就栽在这——评测量出来命中率只有 46.5%,病根正是设定注入的位置每轮在变;把注入位置钉住之后回到 89.9%。

第二种:每轮变化的开头。把时间戳、状态栏放在提示词最前面,等于每轮第一个字节就不一样,整条历史一个字都命中不了。

第三种:改写历史。编辑、删除、重排旧消息,缓存从改动的那个位置起全部失效——这是功能的正当代价,不是 bug,但要知道账是这么算的。

价格数据 2026-07-24,以供应商官网为准 · 按公开牌价(自带 Key 直连口径)估算;官方渠道两条线等比 +50%,省率不变 · token 为混合口径估算

 

这套注入布局已经写进 App:设定驻留 + 位置钉住,实测命中 89.9%,你不用自己修。

装 App 拿到这个命中率

长对话开 Prompt 缓存,到底能省多少钱?

按 DeepSeek 的价差,缓存命中的部分只按全价的 2% 计费——角色扮演每轮都要原样重发全部历史, 聊得越长省得越多。在上面选模型、拖轮数和命中率,两条成本曲线当场拉开;默认的 89.9% 命中率是我们计量评测的实测值,不是宣传数字。

这页背后是一次被打脸的评测

2026 年 7 月我们做四方对比评测(裸 SillyTavern / 满配酒馆 / 我们的两个模式),每次调用过同一个计量网关逐笔对账。结果先打了自己的脸:裸酒馆出厂命中 91.5%,我们只有 46.5%,同样聊 15 轮花的钱是它的 2.8 倍。取证发现病根是世界书条目往提示词里注入的位置每轮在变——插入点之后的缓存全部作废。把注入位置钉住、设定改成常驻之后,复测 89.9%,追平裸酒馆,成本降了约六成。修复已随版本发布。

计算器的价差数据用各家公开牌价:DeepSeek 命中价是全价的 2%,Anthropic、Google 约 10%。命中率滑杆的四个锚点(46.5 / 73.1 / 89.9 / 91.5)全部来自这场评测的实测值。

它模拟不了的

曲线假设每轮长度均匀、命中率恒定——真实聊天里两者都会波动,新设定条目首次进场的那一轮必然 miss(这是设计内代价,不是故障)。有些供应商对缓存写入额外收费、缓存有效期几分钟到几小时不等,这些细则没有进模型。窗口顶满之后开始滑窗截断的场景(几百轮的超长会话)缓存会永久碎掉,那是另一笔账,这里不算。

常见问题

默认命中率 89.9% 是哪来的?

我们自己的实测。2026 年 7 月做了一场四方对比评测:同一个模型、同一把 Key、逐字节相同的消息脚本,量出裸 SillyTavern 出厂命中 91.5%,我们当时只有 46.5%——病根是设定条目每轮注入的位置在漂移。修好之后新装形态 89.9%、老用户升级形态 73.1%。四个数字都做成了锚点按钮,点一下就能看对应的账。

省的比例为什么随轮数越聊越大?

每轮请求都要把全部历史重发一遍,历史越长、其中「和上一轮逐字相同」的前缀占比越高。10 轮时前缀大约占六成,300 轮时超过 99%——所以短对话开不开缓存无所谓,长对话里它就是账单的大头。

缓存折扣要申请吗?谁给的?

供应商给的,多数家自动生效:DeepSeek、Anthropic、Google、xAI 都会在响应里报告命中了多少 token、按折扣价计了多少。不用申请,但有一个前提——客户端把请求组织成「前缀逐字稳定」。做不到这一点,折扣就静默拿不到,这正是这页存在的原因。

这个数字能当账单预估吗?

当量级参考可以,当账单不行。token 按中文混合口径估算;真实命中率取决于你的客户端行为(锚点按钮里那 45 个百分点的差距就是行为差距);各家对缓存写入、缓存有效期的计费细则也不同。方法论节写了完整口径。

接着看

← 全部免费工具

缓存省钱计算器 — 长对话开缓存能省多少,按真实价差算 · Foreverse · 新梦