Claude Sonnet 5.5 发布:还是 $2 / $10,官方称快三成、每个任务最多省三成
Anthropic 2026-09-28 发布,Claude 5.5 家族第二款。1M 上下文、128K 输出,价格和 Sonnet 5 完全一样(输入 $2 / 输出 $10,缓存读取 $0.20),API 默认 effort high;关思考要改用 between_tools,强制调工具会报错。Haiku 5.5 官方说未来几周
按 2026-09-29 的状态整理。规格、价格和破坏性变化来自 Anthropic 官方模型页、What's new 页、迁移指南和定价页;评测数字来自 Anthropic 发布页和 Sonnet 5.5 system card,都是厂商自测或厂商请第三方跑的,不是独立复现。页末附全部来源。
hihi!洛洛来了!
六天前洛洛刚写完 Opus 5.5,那篇公告里说 Sonnet 5.5 和 Haiku 5.5 会在「未来几周」跟上。洛洛心想:几周,那至少能歇两周吧。
结果六天就来了。Anthropic 的「几周」和洛洛的「明天一定早睡」大概是同一种单位。
这次洛洛最在意的是一件事:价格一分没动。同样的钱,换一个更快、更强的 Sonnet,这种更新洛洛这种零基础选手也看得懂值不值。下面的数字全是官方口径,洛洛只在旁边写了点读后感。
洛洛碎碎念
公告里说,Sonnet 5.5 是第一个只看截图就通关《宝可梦 红》的 Sonnet 模型。
洛洛小时候玩红版,在月见山里转了整整一个暑假,第二个道馆都没见着。人家 AI 已经通关了。
一句话总结
赶时间的话,看完这一段就够了。
Anthropic 在 2026-09-28 发布 Claude Sonnet 5.5,Claude 5.5 家族第二款。API 模型名 claude-sonnet-5-5,上下文 1M token,最大输出 128K token,知识截止 2026 年 6 月。价格和 Sonnet 5 完全一样:输入 $2、输出 $10,缓存读取 $0.20 每百万 token,分词器也没换。官方称它输出比 Sonnet 5 快 30% 以上,大多数任务每个任务的成本最多低 30%。官方表里它在 GDPval-AA 上只比 Opus 5.5 低 2 分,Terminal-Bench 4.0 甚至高过 Opus 5.5,但 Anthropic 自己也说,复杂、开放、需要持续判断的活 Opus 5.5 仍明显更强。升级要注意五个破坏性变化,最常碰到的是:关思考要从 disabled 改成 between_tools,以及强制调工具会报错。
时间线
| 日期 | 事件 |
|---|---|
| 2026-06-30 | Sonnet 5 发布,当时 $2 / $10 是首发优惠价 |
| 2026-08-10 | 官方宣布 Sonnet 5 的 $2 / $10 转为长期价,原定 09-01 起改收 $3 / $15 的计划取消 |
| 2026-09-22 | Opus 5.5 发布,公告说 Sonnet 5.5 和 Haiku 5.5 会在未来几周跟进 |
| 2026-09-28 | Anthropic 发布 Claude Sonnet 5.5,同日公布 system card。Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS 同步可用 |
| 2026-09-28 | ZenMux 模型列表上架 anthropic/claude-sonnet-5.5(按 ZenMux 接口里的发布日期) |
| 截至 2026-09-29 | 本站洛洛 AI 的模型列表里仍是 Sonnet 5 |
| 未来几周 | Haiku 5.5(官方说法,没给具体日期) |
| 不早于 2027-09-28 | 官方弃用页给 Sonnet 5.5 写的最早退役日期 |
关键数字
这张表全部来自 Anthropic 官方模型页和 What's new 页。
| 项目 | Claude Sonnet 5.5 |
|---|---|
| 模型 ID | claude-sonnet-5-5(Amazon Bedrock 上是 anthropic.claude-sonnet-5-5) |
| 上下文窗口 | 1M tokens |
| 最大输出 | 128K tokens;批处理 API 加 beta 头 output-300k-2026-03-24 可到 300K |
| 知识截止 | 2026 年 6 月(可靠知识截止和训练数据截止都是这个月) |
| 输入 / 输出模态 | 文本、图片 / 文本 |
| 思考 | 自适应思考,默认开启;最低档是 between_tools,关掉「先想再答」 |
| 默认 effort | Claude API 上是 high;Claude Code 和 Claude 应用里默认 medium |
| 相对延迟 | 官方标「快」(Opus 5.5 标「中等」) |
| 采样参数 | temperature、top_p、top_k 设非默认值会报 400 |
| 最小可缓存提示长度 | 512 tokens(Sonnet 5 是 1,024) |
| 分词器 | 和 Sonnet 5 相同,同样的文本 token 数一样 |
| 可用平台 | Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS |
| 最早退役 | 不早于 2027-09-28 |
「分词器没换」这一行洛洛觉得特别重要:同价又同分词器,意味着「同价」是真同价,同一段话不会偷偷多算 token。
架构
还是很短,Anthropic 这次也没讲。
- 模型结构、参数量:未公开。 模型页和 system card 都没写
- 训练: system card 的说法和 Opus 5.5 基本一样:公开网络数据、公开和私有数据集、其他模型生成的合成数据,以及用户明确允许用于训练的数据;输出只有文本
- 定位: 公告原话是 Sonnet 5.5「没有推进 Anthropic 模型能力的前沿」,所以对齐评估只针对一组任何能力水平都适用的风险做;system card 也比以前短,官方说以后非前沿模型的 system card 都会这样精简
评测
以下摘自 Anthropic 发布页和 Sonnet 5.5 system card,只列 Anthropic 自家三款模型。除特别说明外都是自适应思考、max 档,每项跑 5 次取平均。CursorBench 由 Cursor 跑,GDPval-AA 和 AA-Briefcase 由 Artificial Analysis 跑。
| 基准 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%(xhigh) |
| FrontierCode v1.1(Main) | 46.2%(max)/ 52.1%(xhigh) | 42.4% | 54.4% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% |
| SWE-bench Pro | 81.3% | 63.2% | 89.9% |
| GDPval-AA v2.1(Elo) | 1844 | 1449 | 1846 |
| AA-Briefcase v1.1(Elo) | 1811 | 1359 | 1822 |
| HLE(带工具) | 64.5% | 54.9% | 67.7% |
| HLE(不带工具) | 56.9% | 43.1% | 64.4% |
| OSWorld 2.1(部分得分) | 80.1% | 57.0% | 81.8% |
| Chartography(不带工具) | 61.6% | 15.6% | 64.4% |
怎么读这张表:
- 比 Sonnet 5 全面提升,有几项是跳级:OSWorld 从 57.0% 到 80.1%,GDPval-AA 高了约 400 分,CursorBench 从 34.1% 到 55.5%
- 和 Opus 5.5 贴得很近:GDPval-AA 只差 2 分,AA-Briefcase 差 11 分,CursorBench 差 2 分多。但 Anthropic 自己强调,跑分只反映一个侧面,他们和外部测试者都觉得复杂、开放、需要持续判断的活 Opus 5.5 仍明显更强
- Terminal-Bench 4.0 反超 Opus 5.5:70.6% 对 66.4%。不过 system card 给的标准误分别约 ±2.5 和 ±2.6 分,差 4 分左右,洛洛不敢说它稳赢
- FrontierCode 的 max 档反而比 xhigh 低:官方解释是 max 档下它更常调用 Claude Code 的代码审查技能,开一堆子 agent,有两例因此超时或改了任务范围以外的东西被扣分
- 不开到最高档,分数会掉不少:system card 里 CursorBench 分档成绩是 max 55.5%、xhigh 53.1%、high 47.8%、medium 39.2%。Claude Code 和 Claude 应用默认就是 medium
- GPT-6 Sol 不在表里:Anthropic 发布页也列了 GPT-6 Sol 的几个数字,但那是引用 Artificial Analysis 等第三方的值,脚注还说 OpenAI 刚修了一个影响 GPT-6 Sol 看图能力的 bug,第三方分数可能还没更新。这些不是本篇能核到的 OpenAI 官方成绩,所以不收
洛洛碎碎念
Terminal-Bench 4.0 从 10.3% 跳到 70.6%,洛洛第一反应是小数点点错了。
回去翻了一遍:公告正文和表格里 Sonnet 5 都写的是 10.3%。但 system card 的 Terminal-Bench 4.0 那一节,把 Sonnet 5.5、Opus 5.5、Mythos 5.1、Fable 5.1、Opus 5 的分数和测法都写了(Claude Code 的 --bare 模式,除 Opus 5.5 用 xhigh 外都是 max 档),唯独没写 Sonnet 5 这个 10.3% 是怎么测的。所以洛洛只能照抄官方数字,没法确认它和 70.6% 是不是同一口径。看到这个差距先别激动,等独立榜单出来再说。
API 与价格
终于到了洛洛百分之百看得懂的部分:多少钱。
官方价格(美元 / 每百万 token):
| 计费项 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| 输入 | $2 | $2 | $4 |
| 输出 | $10 | $10 | $20 |
| 5 分钟缓存写入 | $2.50 | $2.50 | $5 |
| 1 小时缓存写入 | $4 | $4 | $8 |
| 缓存读取 | $0.20 | $0.20 | $0.20 |
| 批处理 API(输入 / 输出) | $1 / $5 | $1 / $5 | $2 / $10 |
几个要注意的点:
- 和 Sonnet 5 一模一样:What's new 页写明价格、缓存和批处理都和 Sonnet 5 相同。官方说省钱靠的是「同样的活用更少的 token」,每个任务最多便宜 30%,这是官方测试口径,你的账单以自己的负载为准
- 缓存读取和 Opus 5.5 一样是 $0.20:Opus 5.5 把缓存折扣做到了输入价的 5%,Sonnet 5.5 还是 10%,两者缓存读取正好同价。缓存命中率很高的 agent 场景,两者的差价主要在输入和输出上
- 1M 上下文全程同价,指定只在美国推理(
inference_geo: "us")所有计费项乘 1.1,和 Opus 5.5 一样 - 没有 fast mode:定价页的 fast mode 只列了 Opus 系列
价格随时会调整,以官方定价页为准。
升级前必看:五个破坏性变化
从 Sonnet 5 换过来,下面这些不改代码就会报 400:
- 关思考改用
between_tools:thinking: {"type": "disabled"}会报错,改成thinking: {"type": "between_tools"}。它只关掉「先想再答」,工具调用之间的简短进度说明照样有。只能配 low、medium、high 三档 effort,配 xhigh 或 max 会报错;用了它就不能中途按消息改 effort,也不能再带display等字段。手动思考预算{"type": "enabled", "budget_tokens": N}同样报错 - 不支持强制调工具:
tool_choice设成any或指定某个工具都会报错,只认auto和none。要合规的 JSON 就用auto加strict: true,或改用结构化输出 - 思考块和模型、对话绑定:Sonnet 5.5 能读 Sonnet 5、Opus 4.8、Haiku 4.5 及更早模型的思考块,但读不了 Opus 5、Opus 5.5 和 Fable、Mythos 的;反过来没有任何别的模型能读 Sonnet 5.5 的思考块,对话中途换模型,之前的推理就带不过去。2026-08-31 及之后建的账号,改了历史再回传思考块会报 400。思考块还和生成它的账号绑定,换账号发过去会被丢掉
- 旧版电脑操作工具:在 Claude API 和 Google Cloud 上,
computer_20251124不再接受,要换成computer_toolset_20260801;Amazon Bedrock 上旧工具还能用 - advisor 工具的搭配:Sonnet 5.5 当执行者时,顾问不能再用 Opus 4.8、Opus 4.7 或 Sonnet 5,要换成 Opus 5、Opus 5.5、Fable 5 / 5.1、Mythos 5 / 5.1 或 Sonnet 5.5 自己
还有一个不报错的变化:工具调用之间超过一两句的进度说明,改放在思考块里返回,默认 display: "omitted" 时内容是空的。想把这些话显示给用户,用自适应思考时要设 thinking.display;用 between_tools 的话文字会照常返回。
迁移后关掉「先想再答」的请求大概长这样:
{
"model": "claude-sonnet-5-5",
"max_tokens": 8000,
"thinking": { "type": "between_tools" },
"output_config": { "effort": "medium" },
"tool_choice": { "type": "auto" },
"messages": [...]
}effort 也重新校准过了:同一档的思考量和 Sonnet 5 不一样,别直接搬旧设置。官方建议一般从 high 开始;agent 编码和多步工具调用,任务明确的从 medium 起步、难的再调到 high;聊天这类在意延迟的从 medium 或 low 起步。
对你意味着什么
洛洛按人群分了一下,你对着自己那条看就行。
- Claude Code 和 Claude 应用用户:默认 effort 是 medium。上面的跑分都是 max 档,medium 下 CursorBench 从 55.5% 掉到 39.2%,碰到难题记得手动把档位调高
- 调 API 的开发者:同价、同分词器,换个模型 ID 就能直接对比账单,是这次最省心的地方。但五个破坏性变化里,
disabled改between_tools和强制调工具报错最容易踩到,上线前先过一遍。API 上默认 effort 是 high,和应用里不一样 - 在 Sonnet 和 Opus 之间犹豫的:Opus 5.5 单价是它的两倍。官方的分工是:Sonnet 5.5 擅长范围明确的日常任务、修 bug、做文档幻灯片表格,Opus 5.5 留给需要仔细判断的复杂工作。官方还说 Sonnet 5.5 在低档 effort 时和 Opus 5.5 互补最好,开到高档时成本和效果都会接近 Opus 5.5
- 还在用 Haiku 4.5 的:Haiku 5.5 官方只说「未来几周」;弃用页写的 Haiku 4.5 最早退役日期是 2026-10-15,这两件事都值得盯一下
- 做网络安全的:这是第一个带上和旗舰同类网络安全防护与回退的 Sonnet,高风险的网络安全请求会明显回退给 Sonnet 5 回答,日常找 bug、修 bug 不受影响
- 本站用户:洛洛 AI 的默认模型仍是 Opus 5.5。模型选择里的「更快的 Claude」目前是 Sonnet 5,按苹果核规则是标准档、每问 2 核。ZenMux 在 2026-09-28 已经上架 Sonnet 5.5,价格和 Sonnet 5 一样;站里会不会换、什么时候换,以站内公告和苹果核规则页为准
局限
以下主要来自 Anthropic 自己的公告和 system card。
- 复杂开放的活不如 Opus 5.5:官方原话是跑分只反映一个侧面,内部和外部测试都认为 Opus 5.5 在需要持续判断的复杂工作上明显更强
- 最高档不一定最好:FrontierCode 上 max 档比 xhigh 低约 6 分,原因是开太多子 agent 导致超时或改过头
- 第三方评测有个小插曲:Artificial Analysis 跑 GDPval-AA 和 AA-Briefcase 时用的预发布部署有个影响结构化输出的 bug(已修复),官方预计影响很小,而且只会让分数偏低
- 安全防护会误拦:生物安全措施和 Sonnet 5 相同,官方说部分微生物学和病毒学请求可能被误判;网络安全高风险请求会回退给 Sonnet 5
- 有几处退步:system card 说它在多轮测试里,跟踪监控、暴力极端主义、仇恨歧视几类比 Sonnet 5 退步;在电脑操作环境里拒绝有害任务的比例和 Opus 5.5 相当,但比部分更早的模型差
- 对齐评估不是万能的:官方说它可能有尚未发现的倾向,所以才配合安全防护一起用
between_tools只能配 high 及以下的档位,思考块又不能被别的模型读,经常在对话中途切换模型的应用要重新设计
洛洛写完这篇最大的感受是:这次没有什么惊天动地的新概念,就是同样的价钱,更快、更省、更强。对大多数人来说,这种「不用想就该换」的更新,可能比又一个刷新纪录的旗舰更实在。
数字都会过期,看到这篇的时候记得回官方页面对一眼。更多新模型速览在模型时讯,Haiku 5.5 来了洛洛再接着写。
参考来源
官方:
- Anthropic 发布页《Claude Sonnet 5.5》(速度与成本说法、评测表与脚注、effort 默认值、安全措施、可用平台):https://www.anthropic.com/claude-sonnet-5-5(2026-09-28)
- Claude Sonnet 5.5 模型页(模型 ID、上下文、输出上限、知识截止、思考、默认 effort、采样参数、平台、退役日期):https://platform.claude.com/docs/en/models/sonnet-5-5/overview(查阅于 2026-09-29)
- What's new in Claude Sonnet 5.5(五个破坏性变化、分词器、功能支持、行为变化、价格与可用平台):https://platform.claude.com/docs/en/models/sonnet-5-5/whats-new-sonnet-5-5(查阅于 2026-09-29)
- Sonnet 5.5 迁移指南:https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide(查阅于 2026-09-29)
- Claude 定价页(全部价格、批处理、fast mode 适用模型、1M 上下文同价、
inference_geo加价):https://platform.claude.com/docs/en/about-claude/pricing(查阅于 2026-09-29) - 模型弃用页(Sonnet 5.5、Haiku 4.5 最早退役日期):https://platform.claude.com/docs/en/about-claude/model-deprecations(查阅于 2026-09-29)
- Claude Sonnet 5.5 System Card(训练数据、知识截止、评测汇总表、Terminal-Bench 4.0 测法与标准误、CursorBench 分档成绩、安全与对齐结论):https://www.anthropic.com/claude-sonnet-5-5-system-card(2026-09-28)
- Anthropic《Introducing Claude Sonnet 5》(发布日期、$2 / $10 转长期价的 2026-08-10 更新):https://www.anthropic.com/news/claude-sonnet-5(2026-06-30,2026-08-10 更新)
- Anthropic 发布页《Claude Opus 5.5》(Sonnet 5.5 与 Haiku 5.5「未来几周」跟进):https://www.anthropic.com/claude-opus-5-5(2026-09-22)
其它:
- ZenMux 模型列表接口(
anthropic/claude-sonnet-5.5上架日期与价格):https://zenmux.ai/api/v1/models(查阅于 2026-09-29) - 本站苹果核规则(各档每问扣几核):https://luoluo.help/docs/faq/apple-core(查阅于 2026-09-29)
本站洛洛 AI 的模型列表来自站点配置记录,没有可公开引用的页面。