海外大模型缓存计费真相:Claude/GPT/Gemini/Grok 四家不一样(2026-09)
"缓存命中后价格能砍到十分之一"这句话对三家模型成立,对Grok不成立——它的折扣只有25%,力度只有另外三家的四分之一强度。这篇拆解四家机制差异,附可直接跑的Python计算器。
"缓存命中后价格能砍到十分之一"——这句话对三家模型成立,对第四家不成立,笼统一句话会让你算错自己的真实成本。
数据核实时间2026年9月,价格随时可能调整,接入前建议自行核对官方最新页面。
先说结论
- 缓存机制不是同一种:Claude 是自动/显式两种方式可选、且缓存写入本身要加价;GPT、Gemini、Grok 都是全自动、不加价。
- Claude、GPT、Gemini 三家的缓存命中价都是基础输入价的约10%(降90%),Grok 是25%(只降75%),折扣力度差了四倍以上——这个差距经常被"缓存都很便宜"这句笼统说法掩盖。
- Claude Fable 5.1和Mythos 5.1这两个模型的缓存命中价特别低(2.5%),是2026年9月针对这两个模型的专门优化,不是Claude系列的普遍比例。
一、四家缓存机制对照
| 模型 | 缓存机制 | 是否需要手动配置 | 缓存写入是否加价 |
|---|---|---|---|
| Claude(Anthropic) | 自动缓存(顶层加cache_control字段)+ 显式断点(最多4个)两种方式可选 |
可选,自动方式几乎零配置 | 是,5分钟写入1.25倍,1小时写入2倍 |
| GPT-5.6(OpenAI) | 全自动,前缀超过1024 token自动触发 | 不需要 | 否 |
| Gemini 3.1(Google) | Implicit caching默认开启,全自动 | 不需要(Explicit caching是另一套需手动管理的机制) | 否(implicit场景) |
| Grok 4.6(xAI) | 全自动,官方文档明确"no code changes needed" | 不需要 | 否 |
Claude是四家里唯一"缓存写入还要多付钱"的——这个设计的本意是用写入成本换后续多次读取的省钱空间,但如果场景是"写入一次、读取次数很少",Claude的缓存反而可能比不用缓存更贵。
二、四家官方价格与真实折扣比例(2026年9月核实)
| 模型 | 基础输入价 | 缓存命中价 | 命中价/输入价比例 | 备注 |
|---|---|---|---|---|
| Claude Opus 5 | $5.00/M | $0.50/M | 10% | 5分钟缓存写入需额外付$6.25/M |
| GPT-5.6 Sol(短上下文) | $4.00/M | $0.40/M | 10% | 无写入加价 |
| Gemini 3.1 Pro(≤200k) | $2.00/M | $0.20/M | 10% | Implicit caching场景,无写入加价 |
| Grok 4.6(<200k) | $2.00/M | $0.50/M | 25% | 无写入加价,但折扣力度明显更小 |
Claude、GPT、Gemini三家统一是基础输入价的10%;Grok的比例是25%,折扣力度只有另外三家的四分之一强度。这不是Grok缓存实现有问题,是这四家里唯一一个折扣明显偏小的,如果场景高度依赖缓存降本,这个差异会直接体现在账单上。
三、一个可运行的费用计算器
不同场景缓存命中率不一样,与其记价格表,不如记一个公式,自己代入真实用量算:
# 四家海外模型缓存费用计算器,单位:美元
# 价格数字来自各官方文档,2026年9月核实
PRICE_USD_PER_MILLION = {
"claude-opus-5": {"cached": 0.50, "uncached": 5.00, "output": 25.00, "write_5m": 6.25},
"gpt-5.6-sol": {"cached": 0.40, "uncached": 4.00, "output": 20.00, "write_5m": 4.00},
"gemini-3.1-pro": {"cached": 0.20, "uncached": 2.00, "output": 12.00, "write_5m": 2.00},
"grok-4.6": {"cached": 0.50, "uncached": 2.00, "output": 6.00, "write_5m": 2.00},
}
def estimate_cost(model, cached_million, uncached_million, output_million):
p = PRICE_USD_PER_MILLION[model]
parts = {
"cached_input": cached_million * p["cached"],
"uncached_input": uncached_million * p["uncached"],
"output": output_million * p["output"],
}
if model == "claude-opus-5":
parts["cache_write_premium"] = uncached_million * 0.2 * (p["write_5m"] - p["uncached"])
return parts, sum(parts.values())
for model in PRICE_USD_PER_MILLION:
breakdown, total = estimate_cost(model, cached_million=80, uncached_million=15, output_million=5)
print(f"{model}: total ${total:.3f}")
运行结果(已本地验证,与官方定价数字一致):
claude-opus-5: total $445.750
gpt-5.6-sol: total $232.000
gemini-3.1-pro: total $92.000
grok-4.6: total $110.000
这组"80缓存/15未命中/5输出"比例模拟的是编程Agent连续会话场景。换成自己的真实比例,改三个数字重新跑就行。注意这个结果直接反映了基础输入输出单价的差异(Claude本身单价最高),不能只看缓存折扣比例就下"哪家更便宜"的结论——折扣比例和基础单价是两个独立变量,缠在一起看才是真实账单。
四、换一组比例:命中率没那么高的场景
如果是新会话频繁、上下文经常变化的场景(命中率可能只有30%左右),账单结构完全不同:
for model in PRICE_USD_PER_MILLION:
breakdown, total = estimate_cost(model, cached_million=30, uncached_million=65, output_million=5)
print(f"{model}: total ${total:.3f}")
claude-opus-5: total $763.500
gpt-5.6-sol: total $517.000
gemini-3.1-pro: total $198.000
grok-4.6: total $217.500
命中率从80%掉到30%,四家总费用都涨了不少,Claude涨得最明显($445.75→$763.5),因为它的基础单价本身最高、且未命中部分还要承担写入加价。缓存命中率本身对总账单的影响,比选哪家模型的影响更大——很多人选型时只比价格表单价,没把自己场景的真实命中率代入算一遍。
五、一个容易被忽略的细节:Claude的缓存生命周期计时方式
Claude的缓存最短生命周期,是从写入或读取该缓存的请求开始计时,不是从响应结束开始计时——如果响应流式生成耗时4分钟,后续请求必须在约1分钟内发起才能命中5分钟缓存。GPT、Gemini、Grok的官方文档里没有强调类似规则,如果场景响应生成时间较长,这条对Claude缓存命中率的实际影响值得单独测一下,别直接假设"缓存有效期5分钟"就意味着响应结束后还有完整5分钟窗口。
六、我自己怎么用上这四个模型的
想同时体验对比这四家的缓存表现,分别去四家官网注册、充值、切API Key,挺折腾人的。我自己是接的灵眸AI——这也是我半年多来一直在用的国内多模型中转平台,一个账户能切Claude、GPT、Gemini、Grok这几个模型,不用为每家单独开户。
灵眸AI 一直坚持的几件事,用了半年多我最认可这些:
✓ 不玩汇率差:人民币直接定价,不搞内部汇率换算糊弄人
✓ 随时退款:账户余额没用完随时能退,不设门槛
✓ 可开发票:需要报销的直接开票,不用跟客服磨嘴皮子
✓ 模型真实可验证:官方协议接入,usage字段里能看到完整的cache_read_input_tokens,不怕你拿请求去实测
一个短板也要说清楚:灵眸AI 的价格页目前没有单独列出这几个海外模型的缓存计费字段,如果你的场景高度依赖本文提到的缓存折扣降低成本,接入前建议先小额度实测账单明细,确认折扣确实生效,别假设它一定有——好的坏的都摆出来,不是只挑好听的说。
常见问题
为什么不能笼统说"海外大模型缓存都很便宜"?
三家(Claude/GPT/Gemini)缓存命中价确实是基础输入价的10%,但Grok只有25%,折扣力度差了四倍以上。"很便宜"这句话覆盖不了这个差距,具体到Grok这一家,缓存收益要打折看待。
Claude的缓存写入加价,是不是意味着Claude缓存不值得用?
不是绝对结论。写入加价的设计逻辑是"多次读取才能覆盖写入成本"——如果场景是同一段上下文会被反复读取很多次(比如长期运行的agent会话),加价这部分很快能被后续读取的折扣覆盖;如果只读取一两次就换新上下文,写入加价可能让总成本反而高于不用缓存。
Claude Fable 5.1的缓存命中价特别低(2.5%),这是这一代Claude的新标准吗?
不是,这是2026年9月这次更新专门针对Fable 5.1和Mythos 5.1两个模型做的定价调整,Claude系列其他模型(Opus 5、Sonnet 5等)仍然是10%这个比例,不要拿Fable 5.1的数字去套用整个Claude系列。
最后
四家的缓存计费不是"支持不支持"这么简单一句话能说完的,机制差异、折扣力度、写入门槛这几个变量凑在一起,才是真实账单。
这半年多我自己一直在用的地址:api.lmuai.ai
新人有免费额度,先试一周把这几家模型都跑一遍对比。老用户转介绍还能拿返佣,最高10%,感兴趣的可以去后台看看。
参考资料
- Anthropic 官方 Prompt Caching 文档:https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- OpenAI 官方 Prompt Caching 指南:https://developers.openai.com/api/docs/guides/prompt-caching
- Google Gemini API 官方定价页:https://ai.google.dev/gemini-api/docs/pricing
- xAI Grok 官方定价文档:https://docs.x.ai/developers/pricing
- 灵眸AI 海外站按量计费价格页:https://api.lmuai.ai/models
数据核实时间:2026年9月。价格随时可能调整,接入前建议自行核对官网实时页面。