Claude Fable 5.1 缓存读取降价 75%:围绕 0.25 美元的缓存 Token 重建 Agent 成本模型

·阅读约 11 分钟·Evergreen Tools Team
Cost analytics dashboard representing token spend before and after the cache cut

💡 工具推荐想验证 Fable 5.1 缓存降价是否真的体现在账单上?先用 Evergreen Tools 的 AI Token 计数器估算每个任务的 token,再用 JSON 格式化工具检查原始用量回包;如果你把支出聚合在数据库里,还可以用 AI SQL 优化器。 AI Token 计数器, JSON 格式化工具, AI SQL 优化器

2026 年 9 月 1 日,Anthropic 同时发布 Claude Fable 5.1 与 Claude Mythos 5.1。模型本身很强:Fable 5.1 在 Terminal-Bench-Science 0.1 上拿到 52.6%,而上一代 Fable 5 只有 24.7%;Mythos 5.1 在 Terminal-Bench 4.0 上达到 60.9%。但对大多数工程团队来说,真正的新闻藏在价格表里:Fable 5.1 输入输出标价没动,缓存读取却从每百万 token 1.00 美元降到 0.25 美元。Anthropic 估计典型负载成本下降约 25%,重度 Agentic 负载最高下降约 45%。为什么缓存降价对 Agent 影响这么大?因为 Agent 每一轮都要重新读取长长的系统提示与工具定义。本文讲清楚新缓存经济学、什么时候 Fable 5.1 在成本上反超 Opus 5,以及怎么改提示与路由让账单真正变小。

1. 发布要点:模型升级 + 一条价格线的重写

Fable 5.1 的标价与 Fable 5 完全一致:输入每百万 token 10 美元、输出 50 美元,缓存写入保持 5 分钟 12.50 美元、1 小时 20 美元。唯一变化是缓存读取从 1.00 美元降到 0.25 美元——这是 Anthropic 官方定价里第一次出现这么低的缓存乘数:Fable 5.1 的缓存读取只有其普通输入价的 2.5%,而其他 Claude 模型通常是 10%。基准方面,除 Terminal-Bench-Science 翻倍式提升外,Fable 5.1 在 Terminal-Bench 4.0 上为 55.8%,Mythos 5.1 达到 60.9%;Anthropic 还提到安全护栏改进:良性网络安全请求被误拦的比例下降约 60%。

# Track the three line items that decide your bill after the cut.
# cache_read_tokens at $0.25/MTok now dominates the math for agent loops.
def invoice_math(uncached_input, cache_read, cache_write_5m, output):
    return {
        "uncached_input_usd": round(uncached_input * 10 / 1_000_000, 2),
        "cache_read_usd": round(cache_read * 0.25 / 1_000_000, 2),
        "cache_write_5m_usd": round(cache_write_5m * 12.50 / 1_000_000, 2),
        "output_usd": round(output * 50 / 1_000_000, 2)
    }

print(invoice_math(200_000, 12_000_000, 400_000, 300_000))

2. 为什么缓存降价对 Agent 是最大的利好

Agent 循环与聊天最大的区别在于重复:每一轮工具调用都会带着几乎相同的系统提示、工具定义与历史上下文重新请求模型。缓存命中时,重复的前缀不再按 10 美元/百万计费,而是按 0.25 美元/百万计费。缓存读取占比越高,降价影响越大——这正是 Anthropic 敢说「重度 Agentic 负载最多降 45%」的原因。反过来也说明:如果你的负载里缓存读取占比很低,说明提示词每次都在变化,那么你首先该优化的不是模型,而是把「稳定前缀」和「易变尾巴」拆开。

Code editor showing prompt caching configuration
# Restructure prompts so the stable prefix is big and the volatile tail is small.
STABLE_PREFIX = [
    {"role": "system", "content": SYSTEM_PROMPT},   # rarely changes
    {"role": "user", "content": TOOL_DEFINITIONS}, # grows, but stable
]

VOLATILE_TAIL = [
    {"role": "user", "content": f"Task: {task}"},
    {"role": "assistant", "content": f"Plan: {plan}"},
]

messages = STABLE_PREFIX + VOLATILE_TAIL
# Cache is keyed by exact token prefix: keep STABLE_PREFIX byte-identical
# between turns or you pay a cache write instead of a cache read.

3. Fable 5.1 vs Opus 5:什么时候谁更便宜

Fable 5.1 的普通输入价是 Opus 5 的两倍(10 对 5 美元),但缓存读取只有 Opus 5 的一半(0.25 对 0.50 美元)。粗略的分界线是:当缓存读取占输入类账单约三分之一以上时,Fable 5.1 的总价可能反超。独立分析也指出,Opus 5 在缓存读取占比低于该临界点时通常仍更便宜;按 The Decoder 的测算,Fable 5.1 在 max effort 下每个 Intelligence Index 任务约 3.76 美元,而 Opus 5 约 2.34 美元。结论不是「Fable 5.1 更便宜」,而是「高缓存命中率的 Agentic 负载才适合 Fable 5.1」——路由策略必须基于你实测的缓存命中率。

# Choose cache duration from real pause patterns, not habit.
# 5-minute writes: $12.50/MTok. 1-hour writes: $20/MTok.
# If your agent pauses under ~5 min between turns, 5m wins on write cost.
import statistics

def pick_duration(inter_turn_gaps_min):
    median_gap = statistics.median(inter_turn_gaps_min)
    if median_gap < 4:
        return "5m"      # cheap writes, most turns re-read inside the window
    return "1h"          # long pauses make 1h cheaper overall

print(pick_duration([0.4, 0.8, 1.2, 6.0, 0.5]))

4. 围绕 0.25 美元重构提示词

缓存按「完全一致的 token 前缀」计费,因此提示词结构直接决定你是付 0.25 还是 10。三条实操原则:第一,把系统提示、工具定义、企业知识库这类长内容放进稳定前缀,任务描述等易变内容放在尾部;第二,稳定前缀在回合之间保持字节级一致,任何微小改动都会让整段前缀失效,变成一次昂贵的缓存写入;第三,把 5 分钟与 1 小时缓存按真实停顿模式选择——大多数 Agent 回合间隙短,5 分钟缓存的写入成本更低。

Server room representing LLM API infrastructure and routing

5. 缓存保活与路由:让每一轮都命中

命中率是这波降价能否兑现的关键。对停顿较长的流程,可以用 max_tokens=0 的空请求在空闲期刷新前缀 TTL,让 5 分钟缓存活过整个任务;对长任务,则要考虑 1 小时缓存。路由层建议写成显式策略:重 Agentic 且缓存占比高走 Fable 5.1,低复用的普通问答走 Opus 5,日常例行任务走 Sonnet 5。别凭感觉配路由,先跑一周真实流量,用 token 计数器记录每类任务的缓存读取占比,再决定默认模型。

# Keep the cache warm: a max_tokens=0 request on the unchanged prefix.
def keep_alive(client, prefix):
    # Re-reads the cached prefix without generating output, refreshing TTL.
    return client.messages.create(
        model="claude-fable-5-1",
        max_tokens=0,
        messages=prefix,
        extra_headers={"anthropic-cache": "true"}
    )

6. 落地检查清单

第一,确认 SDK 与代理层开启了 prompt caching 且透传 cache 头,很多团队发现自己根本没在缓存。第二,检查提示词稳定性:把「每次都变的时间戳、随机 ID」挪出前缀。第三,把成本监控从「总 token」升级为「未缓存输入/缓存读取/缓存写入/输出」四个分项,缓存降价的效果只会在分项里现形。第四,用 API 测试工具在灰度环境验证缓存命中后再全量切换。最后记住:厂商降价不是让你放松优化,而是让认真优化缓存的人拿到 45% 的红利,其他人只拿到 25%。

# Route between Fable 5.1 and Opus 5 by your measured cache-hit ratio.
# Opus 5 input $5 / cache $0.50; Fable 5.1 input $10 / cache $0.25.
# If cache reads are more than ~1/3 of your input bill, Fable 5.1 can win.
def pick_model(cache_ratio, heavy_agentic=False):
    if heavy_agentic and cache_ratio > 0.35:
        return "claude-fable-5-1"   # 75% cheaper reads dominate
    if cache_ratio < 0.20:
        return "claude-opus-5"      # low reuse: base input price matters
    return "claude-sonnet-5"        # middle ground for routine work

print(pick_model(0.45, heavy_agentic=True))

📌 常见问题 FAQ

Fable 5.1 是什么时候发布的?

2026 年 9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1;Fable 5.1 定位编码与知识工作,Mythos 5.1 定位更高难度任务。

Fable 5.1 是什么时候发布的?

2026 年 9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1;Fable 5.1 定位编码与知识工作,Mythos 5.1 定位更高难度任务。

Fable 5.1 是什么时候发布的?

2026 年 9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1;Fable 5.1 定位编码与知识工作,Mythos 5.1 定位更高难度任务。

Fable 5.1 是什么时候发布的?

2026 年 9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1;Fable 5.1 定位编码与知识工作,Mythos 5.1 定位更高难度任务。

Fable 5.1 是什么时候发布的?

2026 年 9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1;Fable 5.1 定位编码与知识工作,Mythos 5.1 定位更高难度任务。

Fable 5.1 的定价是多少?

输入每百万 token 10 美元、输出 50 美元,与 Fable 5 一致;缓存读取从 1.00 美元降至 0.25 美元(降 75%),5 分钟缓存写入 12.50 美元、1 小时缓存写入 20 美元。

Fable 5.1 的定价是多少?

输入每百万 token 10 美元、输出 50 美元,与 Fable 5 一致;缓存读取从 1.00 美元降至 0.25 美元(降 75%),5 分钟缓存写入 12.50 美元、1 小时缓存写入 20 美元。

Fable 5.1 的定价是多少?

输入每百万 token 10 美元、输出 50 美元,与 Fable 5 一致;缓存读取从 1.00 美元降至 0.25 美元(降 75%),5 分钟缓存写入 12.50 美元、1 小时缓存写入 20 美元。

Fable 5.1 的定价是多少?

输入每百万 token 10 美元、输出 50 美元,与 Fable 5 一致;缓存读取从 1.00 美元降至 0.25 美元(降 75%),5 分钟缓存写入 12.50 美元、1 小时缓存写入 20 美元。

Fable 5.1 的定价是多少?

输入每百万 token 10 美元、输出 50 美元,与 Fable 5 一致;缓存读取从 1.00 美元降至 0.25 美元(降 75%),5 分钟缓存写入 12.50 美元、1 小时缓存写入 20 美元。

这波降价到底能省多少?

Anthropic 估计典型工作负载成本下降约 25%,重度 Agentic 工作负载最高约 45%;实际节省取决于缓存读取占账单的比例。

这波降价到底能省多少?

Anthropic 估计典型工作负载成本下降约 25%,重度 Agentic 工作负载最高约 45%;实际节省取决于缓存读取占账单的比例。

这波降价到底能省多少?

Anthropic 估计典型工作负载成本下降约 25%,重度 Agentic 工作负载最高约 45%;实际节省取决于缓存读取占账单的比例。

这波降价到底能省多少?

Anthropic 估计典型工作负载成本下降约 25%,重度 Agentic 工作负载最高约 45%;实际节省取决于缓存读取占账单的比例。

这波降价到底能省多少?

Anthropic 估计典型工作负载成本下降约 25%,重度 Agentic 工作负载最高约 45%;实际节省取决于缓存读取占账单的比例。

Fable 5.1 与 Opus 5 谁更划算?

取决于缓存命中率:Fable 5.1 普通输入价是 Opus 5 的两倍但缓存读取只有一半,缓存读取占输入类账单约三分之一以上时 Fable 5.1 更可能胜出。

Fable 5.1 与 Opus 5 谁更划算?

取决于缓存命中率:Fable 5.1 普通输入价是 Opus 5 的两倍但缓存读取只有一半,缓存读取占输入类账单约三分之一以上时 Fable 5.1 更可能胜出。

Fable 5.1 与 Opus 5 谁更划算?

取决于缓存命中率:Fable 5.1 普通输入价是 Opus 5 的两倍但缓存读取只有一半,缓存读取占输入类账单约三分之一以上时 Fable 5.1 更可能胜出。

Fable 5.1 与 Opus 5 谁更划算?

取决于缓存命中率:Fable 5.1 普通输入价是 Opus 5 的两倍但缓存读取只有一半,缓存读取占输入类账单约三分之一以上时 Fable 5.1 更可能胜出。

Fable 5.1 与 Opus 5 谁更划算?

取决于缓存命中率:Fable 5.1 普通输入价是 Opus 5 的两倍但缓存读取只有一半,缓存读取占输入类账单约三分之一以上时 Fable 5.1 更可能胜出。

如何让缓存命中率更高?

把系统提示与工具定义放在字节级稳定的前缀里,易变内容放尾部;按真实停顿选择 5 分钟或 1 小时缓存;必要时用 max_tokens=0 请求保活前缀。

如何让缓存命中率更高?

把系统提示与工具定义放在字节级稳定的前缀里,易变内容放尾部;按真实停顿选择 5 分钟或 1 小时缓存;必要时用 max_tokens=0 请求保活前缀。

如何让缓存命中率更高?

把系统提示与工具定义放在字节级稳定的前缀里,易变内容放尾部;按真实停顿选择 5 分钟或 1 小时缓存;必要时用 max_tokens=0 请求保活前缀。

如何让缓存命中率更高?

把系统提示与工具定义放在字节级稳定的前缀里,易变内容放尾部;按真实停顿选择 5 分钟或 1 小时缓存;必要时用 max_tokens=0 请求保活前缀。

如何让缓存命中率更高?

把系统提示与工具定义放在字节级稳定的前缀里,易变内容放尾部;按真实停顿选择 5 分钟或 1 小时缓存;必要时用 max_tokens=0 请求保活前缀。