AIHub

Claude Fable 5.1 上手实战:缓存命中降价 75%,API 接入与提示缓存成本重算一次讲清

进阶约 14 分钟读完2026-09-04#Claude#Fable 5.1#Anthropic#API#提示缓存
Claude Fable 5.1 上手实战:缓存命中降价 75%,API 接入与提示缓存成本重算一次讲清

9 月第一周,前沿模型圈打得相当热闹:Anthropic 在 9 月 1 日发布 Claude Fable 5.1(以及面向可信访问计划的姊妹模型 Mythos 5.1),Google 第二天就端出 Gemini 3.8 Flash,Meta 和阿里也各自更新了旗舰。在这波更新里,Fable 5.1 是智能水平榜单上最靠前的那一个,而它最实在的变化不在跑分,在价格结构:缓存读取价格直接砍了 75%。对天天跑 Agent、多轮对话、长上下文任务的人来说,这比跑分重要得多。

本文做三件事:理清 5.1 到底改了什么、把网页 / Claude Code / API 三条接入路径走通、以及用提示缓存的新价格重算一笔成本账。

一、Fable 5.1 到底更新了什么

先看核心事实(数据来自 Anthropic 官方发布说明与公开报道):

项目 Fable 5 Fable 5.1 变化
模型 ID claude-fable-5 claude-fable-5-1 新端点
输入价格 $10 / 百万 token $10 / 百万 token 不变
输出价格 $50 / 百万 token $50 / 百万 token 不变
缓存读取 $1.00 / 百万 token $0.25 / 百万 token 降 75%
缓存命中相对输入价 10% 2.5% 其他 Claude 模型均为 10%
上下文窗口 1M token 1M token 不变

几个值得注意的点:

  • 缓存命中比 Opus 还便宜。Fable 5.1 的缓存读取价 $0.25,低于 Opus 5 的 $0.50——也就是说,只要你的提示缓存命中率高,用这个旗舰模型的"边际成本"反而比次旗舰低。这是 Anthropic 第一次在价格结构上做出这种倒挂。
  • 官方成本估算:Anthropic 称典型 Fable 工作负载整体成本下降约 25%,缓存密集的 Agent 类工作负载最高可降约 45%。
  • 能力面:官方口径是 Agent 编程、科学研究、商业工作流和 computer use 都有实质提升;第三方榜单上它目前排在智能水平第一。
  • 安全策略松绑:Fable 5.1 放开了源代码漏洞发现类任务,Claude Code 中每会话的网络安全拦截次数下降约 60%。进攻性和双用途任务仍然受限。Mythos 5.1 是同一模型、防护级别更宽松的版本,只面向经过审核的可信访问计划开放,普通开发者用 Fable 5.1 即可。

二、三条接入路径

路径 1:Claude 网页 / 桌面端

最简单的方式:打开 claude.ai,在模型选择器里切到 Fable 5.1。适合先体感一下新模型在你真实任务上的表现——尤其是长文档分析和多步推理类任务,这是官方重点提升的方向。订阅用户无需任何配置。

路径 2:Claude Code

终端里更新到最新版后,用 /model 切换到 Fable 5.1。两个实际收益:

  • 编程 Agent 工作流是本轮提升的重点,长任务(连续几十分钟的自主编码)稳定性更好;
  • 安全拦截每会话减少约 60%,以前读个依赖源码找潜在漏洞都可能被误拦,现在顺畅很多。

如果你的项目里有 .claude/settings.json 固定了模型,记得改成 claude-fable-5-1,否则会一直用旧端点。

路径 3:API

模型 ID 为 claude-fable-5-1,接口与之前完全一致,改一个字符串就能切:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-fable-5-1",
    "max_tokens": 4096,
    "messages": [
      {"role": "user", "content": "解释这段代码的并发风险:..."}
    ]
  }'

三、提示缓存实战:吃到那 75% 的降价

价格结构变了,写法就要跟着变。提示缓存(prompt caching)的用法是给你请求里"不变的大块内容"打上 cache_control 标记——系统提示、工具定义、长文档、代码库上下文都适合:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-fable-5-1",
    "max_tokens": 4096,
    "system": [
      {
        "type": "text",
        "text": "你是一名资深后端工程师。以下是本项目的完整架构文档与编码规范……(5 万字)",
        "cache_control": {"type": "ephemeral"}
      }
    ],
    "messages": [
      {"role": "user", "content": "帮我审查这个 PR:..."}
    ]
  }'

关键原则:

  1. 缓存的是前缀。把不变的内容放在 system 和消息列表最前面,变化的用户输入放最后。前缀一旦有变动,后面的缓存全部失效。
  2. 多轮对话复用缓存。Agent 循环里每一轮都把完整历史发回去,历史部分命中缓存,只有新增部分按全价计费——这正是"缓存密集负载降 45%"的来源。
  3. 有最低 token 门槛。太短的提示打缓存标记没意义,一般几千 token 以上的稳定前缀才值得标。

四、重算一笔成本账

以一个典型的代码审查 Agent 为例:每次调用带 10 万 token 的项目上下文(稳定前缀,可缓存)+ 2 千 token 新输入,输出 3 千 token,每天跑 200 次。

不写缓存(或缓存全 miss):

  • 输入:102,000 × 200 = 2040 万 token × $10/百万 = $204
  • 输出:3,000 × 200 = 60 万 token × $50/百万 = $30
  • 合计约 $234/天

缓存正常工作(首轮写入后命中):

  • 缓存读取:100,000 × 200 = 2000 万 token × $0.25/百万 = $5
  • 新输入:2,000 × 200 = 40 万 token × $10/百万 = $4
  • 输出:$30(不变,输出没有缓存价)
  • 合计约 $39/天 + 少量缓存写入费

同样的负载,在 Fable 5 上缓存命中价是 $1.00,这笔账是约 $54/天;换到 5.1 变成 $39/天,正好落在官方"缓存密集负载最高降 45%"的区间里。结论很直接:5.1 时代,不做提示缓存等于主动多付 5-6 倍的钱。

五、注意事项与常见问题

Q:输出价格 $50/百万还是贵,什么时候该用它? Fable 5.1 定位是最难的那批任务:长程 Agent、复杂重构、科研分析。日常补全、简单问答用 Sonnet 档($2/$15)或 Gemini 3.8 Flash($0.75/$3.75)更划算。一个实用的分流策略:先用便宜模型跑,失败或置信度低再升级到 Fable。

Q:Gemini 3.8 Flash 前一天刚发,怎么选? 3.8 Flash 的 DeepSWE v1.1 得分 73.7%,非常接近 Opus 5 的 74.0%,单价只有 Fable 的十几分之一,输出速度还快得多(约 305 token/s vs 66 token/s)。但多家报道提到它完成同一任务消耗的 token 量接近上代两倍,"单价便宜、总价未必"。对正确性敏感的长任务用 Fable 5.1,对吞吐和成本敏感的任务用 3.8 Flash,是目前的合理分工。

Q:从 Fable 5 迁移有什么坑? API 层面只需改模型 ID。需要注意的是 Claude Code 等客户端要升级到支持新模型的版本;自建系统里如果有按模型名做路由或成本统计的逻辑,记得把 claude-fable-5-1 加进映射表。

Q:缓存标记会不会反而更贵? 缓存写入本身要收费(高于普通输入价),所以如果前缀只命中一两次,可能不划算。经验法则:同一前缀预期复用 3 次以上再标记,复用越频繁越赚——5.1 把这个盈亏平衡点压得更低了。

小结

Fable 5.1 的更新逻辑很清晰:能力稳步提升,价格结构向 Agent 时代倾斜——基础价不变,把"重复读上下文"这件 Agent 最常干的事打到 2.5 折。接入只需改一个模型 ID,但真正吃到红利的前提是检查你的提示缓存策略:稳定前缀放前面、打上 cache_control、多轮对话复用历史。做到这三点,旗舰模型的实际账单可以比次旗舰还低。

相关教程

Claude Fable 5.1 上手实战:缓存命中降价 75%,API 接入与提示缓存成本重算一次讲清 | AIHub