AIHub

Claude Sonnet 5.5 上手实战:价格一分没降,任务成本凭什么最高省 30%?

进阶约 13 分钟读完2026-09-29#Claude#Anthropic#Claude Sonnet 5.5#AI 编程#API 接入#成本优化#模型迁移
Claude Sonnet 5.5 上手实战:价格一分没降,任务成本凭什么最高省 30%?

9 月 28 日,Anthropic 发布了 Claude Sonnet 5.5——Claude 5.5 家族的第二个成员(第一个是 9 月 22 日的 Opus 5.5)。这次发布最反常识的地方在于:价目表一个数字都没动,但 Anthropic 声称完成同一任务的总成本最高能降 30%,输出速度还快了 30% 以上。

钱省在哪?不在单价,在"干活方式"。Sonnet 5.5 用更少的 token 和更少的工具调用就能完成同样的工作——这直接改变了你账单的结构,也改变了"哪个模型该干哪类活"的选型逻辑。本文把发布要点、基准数据、API 接入和迁移坑一次讲清。

一、发布速览:一张表看懂 Sonnet 5.5

项目 Claude Sonnet 5.5 对照:Opus 5.5 对照:Sonnet 5
发布日期 2026-09-28 2026-09-22 2026-06-30
API 模型 ID claude-sonnet-5-5 claude-opus-5-5 claude-sonnet-5
输入 / 输出(每百万 token) $2 / $10 $4 / $20 $2 / $10
缓存读 / 5 分钟缓存写 $0.20 / $2.50 $0.20 / $5.00 $0.20 / $2.50
1 小时缓存写 $4 $8 ——
上下文 / 最大输出 1M / 128K 1M / 128K 1M / 128K
思考模式 自适应思考默认开启 自适应思考默认开启 可配置
Effort 档位 low / medium / high / xhigh / max 同左 ——
API 默认 effort high 自适应 ——

几个要点:

  • 价格与 Sonnet 5 完全一致,包括缓存价格。不用改预算表,直接换模型 ID 就能用。
  • 五个重新标定的 effort 档位(low 到 max),默认在 Claude Code 和 Claude App 里是 medium,在 Claude Platform / API 里是 high。档位直接决定思考深度,也是控制单任务成本的第一旋钮。
  • 已在 AWS、Google Cloud、Microsoft Azure 上线,提供 zero data retention 选项,企业合规路径和 Opus 5.5 相同。
  • 可靠知识截止为 2026 年 6 月。Claude Haiku 5.5(面向高并发、成本敏感场景)将在未来几周加入家族。

二、基准与企业实测:便宜的那档,这次真的不慢

先看 Anthropic 官方公布的核心成绩:

基准 Sonnet 5.5 Opus 5.5 Sonnet 5
Terminal-Bench 4.0(Agent 编程) 70.6% 66.4%(Xhigh) 10.3%
FrontierCode 1.1(Max / Xhigh) 46.2% / 52.1% 54.4% 42.4%
CursorBench 4.0 55.5% 57.8% 34.1%
GDPval-AA v2.1(知识工作) 1844 1846 1449
AA-Briefcase v1.1 1811 1822 1359
Humanity's Last Exam(带工具) 64.5% —— ——

Terminal-Bench 4.0 上从 10.3% 跳到 70.6%,是这次最夸张的数字;GDPval-AA 比 Sonnet 5 高了约 400 分,离 Opus 5.5 只差 2 分。

更值得关注的是企业侧的早期实测,因为它们测的是"任务成本"而不是榜单分:

  • Balyasny Asset Management:2441 道金融任务上,每答案平均 12.1 万 token,Sonnet 5 是 49.7 万——token 消耗直接砍到约四分之一。
  • Base44:118 次真实应用构建,平均 3.6 次迭代完成,Opus 5 需要 7.7 次,且失败工具调用最少。
  • Slack:离线 Slackbot 评测输出 token 减少约 14%,提示词零改动。
  • Zendesk:工单处理比现有 Claude 生产模型快 20%;Box:结果产出快 2.4 倍、总 token 少 12%;Atlassian:Rovo Agents 运行速度最高提升 30%。

但官方也明确说了边界:Opus 5.5 在需要持续判断力的复杂开放任务上仍然明显更强。Sonnet 5.5 的甜区是边界清晰的日常任务:修 bug、写文档、做幻灯片和表格、设计稿审查这类"有明确完成标准"的工作。

三、API 接入实操:十分钟跑通

Sonnet 5.5 走标准 Messages API,接入和其他 Claude 模型一致:

curl https://api.anthropic.com/v1/messages   -H "x-api-key: $ANTHROPIC_API_KEY"   -H "anthropic-version: 2023-06-01"   -H "content-type: application/json"   -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 8192,
    "thinking": { "type": "adaptive" },
    "messages": [
      { "role": "user", "content": "帮我把这段 Python 重写成 TypeScript,并列出你改动的每一处语义差异。" }
    ]
  }'

三个实用提示:

  1. effort 档位就是你最便宜的成本杠杆。对"有标准答案"的批量任务(代码审查、分类、摘要),先试 low 或 medium;只有结果不达标再升档。Balyasny 那种四分之一的 token 消耗,前提就是让模型在最够用的档位上干活。
  2. 缓存还是老配方。代码库上下文塞进 system 块并开缓存,5 分钟缓存写 $2.50、缓存读仅 $0.20,长会话场景务必用满。注意最小可缓存提示从 Sonnet 5 的 1024 token 降到了 512 token,短系统提示也能吃到缓存红利了。
  3. 零数据保留(ZDR)已可用,和 Opus 5.5 同级。金融、医疗等合规敏感场景可以直接谈这个档位。

四、从 Sonnet 5 迁移:4 个必踩的坑

如果你直接从 Sonnet 5 切模型 ID,有几处行为差异会咬人,官方迁移指南里点名了这几条:

  1. thinking disabled 会直接报 400。 自适应思考现在是默认且强制的,以前用 thinking: { "type": "disabled" } 关闭思考的代码会报错。想压思考成本,改用 between_tools 档位——这是目前最低可用档。
  2. 强制工具选择(forced tool choice)被拒。 旧的"指定必须用某个工具"写法不再接受,要改成自动工具选择 + strict tools 的组合,让模型在结构化约束下自己决定调用。
  3. 最小可缓存 prompt 降为 512 token。 这算好消息:以前短提示凑不够 1024 token 吃不到缓存价,现在一半就能命中。
  4. 拒绝行为会变多。 新增了五类拒绝 stop-reason(cyber、bio、frontier_llm、reasoning_extraction、general_harms)。Sonnet 5.5 是首个搭载旗舰级网络安全防护的 Sonnet:高风险请求会静默回退到 Sonnet 5 执行,良性安全任务也可能被误伤——如果你在跑安全研究类工作流,先把这层预期加进测试集。

五、什么时候还该用 Opus 5.5

选型建议一张表收尾:

场景 推荐
边界清晰的批量任务:代码审查、工单分类、文档/表格生成 Sonnet 5.5(medium)
Agent 编程、终端操作(Terminal-Bench 甜区) Sonnet 5.5(high)
需要持续判断力的复杂开放任务、长链路架构决策 Opus 5.5
高并发、成本极度敏感 等 Haiku 5.5(数周内)

常见问题

Q:账单上什么时候能看到"省 30%"? A:省的是任务总成本不是单价,前提是任务边界清晰、effort 档位设得克制。开放式任务上调到 xhigh/max 后,账单未必比 Opus 便宜多少——按自己的真实流量抽 5% 对比一周再下结论。

Q:Claude Code 里怎么切换? A:默认 effort 就是 medium。想全局换模型,把配置里的模型 ID 改成 claude-sonnet-5-5 即可,无需其他改动。

Q:会回落到旧模型吗? A:只有一类情况:网络安全防护判定为高风险请求时,会回退到 Sonnet 5 执行。其余请求都由 Sonnet 5.5 本体处理。

小结

Sonnet 5.5 是 Anthropic 少见的"不加价、改结构"式升级:单价没变,但 Terminal-Bench 4.0 从 10.3% 跳到 70.6%、企业实测 token 消耗砍到四分之一,让"中杯"第一次在长上下文编程任务上具备了挑战"大杯"的性价比。今天就能做的事:把批量化任务的模型 ID 换成 claude-sonnet-5-5、用 effort 档位替代"关思考"的旧习惯、把 512 token 的缓存门槛用起来。复杂开放判断留给 Opus 5.5——它现在贵得有底气,也贵得更孤独了。

相关教程

Claude Sonnet 5.5 上手实战:价格一分没降,任务成本凭什么最高省 30%? | AIHub