收藏、记忆、苹果核上线了看看 →
LuoLuoLuoLuo Wiki

Claude Sonnet 5.5 发布:还是 $2 / $10,官方称快三成、每个任务最多省三成

Anthropic 2026-09-28 发布,Claude 5.5 家族第二款。1M 上下文、128K 输出,价格和 Sonnet 5 完全一样(输入 $2 / 输出 $10,缓存读取 $0.20),API 默认 effort high;关思考要改用 between_tools,强制调工具会报错。Haiku 5.5 官方说未来几周

核对于 2026-09-29

按 2026-09-29 的状态整理。规格、价格和破坏性变化来自 Anthropic 官方模型页、What's new 页、迁移指南和定价页;评测数字来自 Anthropic 发布页和 Sonnet 5.5 system card,都是厂商自测或厂商请第三方跑的,不是独立复现。页末附全部来源。

hihi!洛洛来了!

六天前洛洛刚写完 Opus 5.5,那篇公告里说 Sonnet 5.5 和 Haiku 5.5 会在「未来几周」跟上。洛洛心想:几周,那至少能歇两周吧。

结果六天就来了。Anthropic 的「几周」和洛洛的「明天一定早睡」大概是同一种单位。

这次洛洛最在意的是一件事:价格一分没动。同样的钱,换一个更快、更强的 Sonnet,这种更新洛洛这种零基础选手也看得懂值不值。下面的数字全是官方口径,洛洛只在旁边写了点读后感。

洛洛碎碎念

公告里说,Sonnet 5.5 是第一个只看截图就通关《宝可梦 红》的 Sonnet 模型。

洛洛小时候玩红版,在月见山里转了整整一个暑假,第二个道馆都没见着。人家 AI 已经通关了。

一句话总结

赶时间的话,看完这一段就够了。

Anthropic 在 2026-09-28 发布 Claude Sonnet 5.5,Claude 5.5 家族第二款。API 模型名 claude-sonnet-5-5,上下文 1M token,最大输出 128K token,知识截止 2026 年 6 月。价格和 Sonnet 5 完全一样:输入 $2、输出 $10,缓存读取 $0.20 每百万 token,分词器也没换。官方称它输出比 Sonnet 5 快 30% 以上,大多数任务每个任务的成本最多低 30%。官方表里它在 GDPval-AA 上只比 Opus 5.5 低 2 分,Terminal-Bench 4.0 甚至高过 Opus 5.5,但 Anthropic 自己也说,复杂、开放、需要持续判断的活 Opus 5.5 仍明显更强。升级要注意五个破坏性变化,最常碰到的是:关思考要从 disabled 改成 between_tools,以及强制调工具会报错。

时间线

日期事件
2026-06-30Sonnet 5 发布,当时 $2 / $10 是首发优惠价
2026-08-10官方宣布 Sonnet 5 的 $2 / $10 转为长期价,原定 09-01 起改收 $3 / $15 的计划取消
2026-09-22Opus 5.5 发布,公告说 Sonnet 5.5 和 Haiku 5.5 会在未来几周跟进
2026-09-28Anthropic 发布 Claude Sonnet 5.5,同日公布 system card。Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS 同步可用
2026-09-28ZenMux 模型列表上架 anthropic/claude-sonnet-5.5(按 ZenMux 接口里的发布日期)
截至 2026-09-29本站洛洛 AI 的模型列表里仍是 Sonnet 5
未来几周Haiku 5.5(官方说法,没给具体日期)
不早于 2027-09-28官方弃用页给 Sonnet 5.5 写的最早退役日期

关键数字

这张表全部来自 Anthropic 官方模型页和 What's new 页。

项目Claude Sonnet 5.5
模型 IDclaude-sonnet-5-5(Amazon Bedrock 上是 anthropic.claude-sonnet-5-5)
上下文窗口1M tokens
最大输出128K tokens;批处理 API 加 beta 头 output-300k-2026-03-24 可到 300K
知识截止2026 年 6 月(可靠知识截止和训练数据截止都是这个月)
输入 / 输出模态文本、图片 / 文本
思考自适应思考,默认开启;最低档是 between_tools,关掉「先想再答」
默认 effortClaude API 上是 high;Claude Code 和 Claude 应用里默认 medium
相对延迟官方标「快」(Opus 5.5 标「中等」)
采样参数temperature、top_p、top_k 设非默认值会报 400
最小可缓存提示长度512 tokens(Sonnet 5 是 1,024)
分词器和 Sonnet 5 相同,同样的文本 token 数一样
可用平台Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS
最早退役不早于 2027-09-28

「分词器没换」这一行洛洛觉得特别重要:同价又同分词器,意味着「同价」是真同价,同一段话不会偷偷多算 token。

架构

还是很短,Anthropic 这次也没讲。

  • 模型结构、参数量:未公开。 模型页和 system card 都没写
  • 训练: system card 的说法和 Opus 5.5 基本一样:公开网络数据、公开和私有数据集、其他模型生成的合成数据,以及用户明确允许用于训练的数据;输出只有文本
  • 定位: 公告原话是 Sonnet 5.5「没有推进 Anthropic 模型能力的前沿」,所以对齐评估只针对一组任何能力水平都适用的风险做;system card 也比以前短,官方说以后非前沿模型的 system card 都会这样精简

评测

以下摘自 Anthropic 发布页和 Sonnet 5.5 system card,只列 Anthropic 自家三款模型。除特别说明外都是自适应思考、max 档,每项跑 5 次取平均。CursorBench 由 Cursor 跑,GDPval-AA 和 AA-Briefcase 由 Artificial Analysis 跑。

基准Sonnet 5.5Sonnet 5Opus 5.5
Terminal-Bench 4.070.6%10.3%66.4%(xhigh)
FrontierCode v1.1(Main)46.2%(max)/ 52.1%(xhigh)42.4%54.4%
CursorBench 4.055.5%34.1%57.8%
SWE-bench Pro81.3%63.2%89.9%
GDPval-AA v2.1(Elo)184414491846
AA-Briefcase v1.1(Elo)181113591822
HLE(带工具)64.5%54.9%67.7%
HLE(不带工具)56.9%43.1%64.4%
OSWorld 2.1(部分得分)80.1%57.0%81.8%
Chartography(不带工具)61.6%15.6%64.4%

怎么读这张表:

  • 比 Sonnet 5 全面提升,有几项是跳级:OSWorld 从 57.0% 到 80.1%,GDPval-AA 高了约 400 分,CursorBench 从 34.1% 到 55.5%
  • 和 Opus 5.5 贴得很近:GDPval-AA 只差 2 分,AA-Briefcase 差 11 分,CursorBench 差 2 分多。但 Anthropic 自己强调,跑分只反映一个侧面,他们和外部测试者都觉得复杂、开放、需要持续判断的活 Opus 5.5 仍明显更强
  • Terminal-Bench 4.0 反超 Opus 5.5:70.6% 对 66.4%。不过 system card 给的标准误分别约 ±2.5 和 ±2.6 分,差 4 分左右,洛洛不敢说它稳赢
  • FrontierCode 的 max 档反而比 xhigh 低:官方解释是 max 档下它更常调用 Claude Code 的代码审查技能,开一堆子 agent,有两例因此超时或改了任务范围以外的东西被扣分
  • 不开到最高档,分数会掉不少:system card 里 CursorBench 分档成绩是 max 55.5%、xhigh 53.1%、high 47.8%、medium 39.2%。Claude Code 和 Claude 应用默认就是 medium
  • GPT-6 Sol 不在表里:Anthropic 发布页也列了 GPT-6 Sol 的几个数字,但那是引用 Artificial Analysis 等第三方的值,脚注还说 OpenAI 刚修了一个影响 GPT-6 Sol 看图能力的 bug,第三方分数可能还没更新。这些不是本篇能核到的 OpenAI 官方成绩,所以不收

洛洛碎碎念

Terminal-Bench 4.0 从 10.3% 跳到 70.6%,洛洛第一反应是小数点点错了。

回去翻了一遍:公告正文和表格里 Sonnet 5 都写的是 10.3%。但 system card 的 Terminal-Bench 4.0 那一节,把 Sonnet 5.5、Opus 5.5、Mythos 5.1、Fable 5.1、Opus 5 的分数和测法都写了(Claude Code 的 --bare 模式,除 Opus 5.5 用 xhigh 外都是 max 档),唯独没写 Sonnet 5 这个 10.3% 是怎么测的。所以洛洛只能照抄官方数字,没法确认它和 70.6% 是不是同一口径。看到这个差距先别激动,等独立榜单出来再说。

API 与价格

终于到了洛洛百分之百看得懂的部分:多少钱。

官方价格(美元 / 每百万 token):

计费项Sonnet 5.5Sonnet 5Opus 5.5
输入$2$2$4
输出$10$10$20
5 分钟缓存写入$2.50$2.50$5
1 小时缓存写入$4$4$8
缓存读取$0.20$0.20$0.20
批处理 API(输入 / 输出)$1 / $5$1 / $5$2 / $10

几个要注意的点:

  • 和 Sonnet 5 一模一样:What's new 页写明价格、缓存和批处理都和 Sonnet 5 相同。官方说省钱靠的是「同样的活用更少的 token」,每个任务最多便宜 30%,这是官方测试口径,你的账单以自己的负载为准
  • 缓存读取和 Opus 5.5 一样是 $0.20:Opus 5.5 把缓存折扣做到了输入价的 5%,Sonnet 5.5 还是 10%,两者缓存读取正好同价。缓存命中率很高的 agent 场景,两者的差价主要在输入和输出上
  • 1M 上下文全程同价,指定只在美国推理(inference_geo: "us")所有计费项乘 1.1,和 Opus 5.5 一样
  • 没有 fast mode:定价页的 fast mode 只列了 Opus 系列

价格随时会调整,以官方定价页为准。

升级前必看:五个破坏性变化

从 Sonnet 5 换过来,下面这些不改代码就会报 400:

  1. 关思考改用 between_tools:thinking: {"type": "disabled"} 会报错,改成 thinking: {"type": "between_tools"}。它只关掉「先想再答」,工具调用之间的简短进度说明照样有。只能配 low、medium、high 三档 effort,配 xhigh 或 max 会报错;用了它就不能中途按消息改 effort,也不能再带 display 等字段。手动思考预算 {"type": "enabled", "budget_tokens": N} 同样报错
  2. 不支持强制调工具:tool_choice 设成 any 或指定某个工具都会报错,只认 auto 和 none。要合规的 JSON 就用 auto 加 strict: true,或改用结构化输出
  3. 思考块和模型、对话绑定:Sonnet 5.5 能读 Sonnet 5、Opus 4.8、Haiku 4.5 及更早模型的思考块,但读不了 Opus 5、Opus 5.5 和 Fable、Mythos 的;反过来没有任何别的模型能读 Sonnet 5.5 的思考块,对话中途换模型,之前的推理就带不过去。2026-08-31 及之后建的账号,改了历史再回传思考块会报 400。思考块还和生成它的账号绑定,换账号发过去会被丢掉
  4. 旧版电脑操作工具:在 Claude API 和 Google Cloud 上,computer_20251124 不再接受,要换成 computer_toolset_20260801;Amazon Bedrock 上旧工具还能用
  5. advisor 工具的搭配:Sonnet 5.5 当执行者时,顾问不能再用 Opus 4.8、Opus 4.7 或 Sonnet 5,要换成 Opus 5、Opus 5.5、Fable 5 / 5.1、Mythos 5 / 5.1 或 Sonnet 5.5 自己

还有一个不报错的变化:工具调用之间超过一两句的进度说明,改放在思考块里返回,默认 display: "omitted" 时内容是空的。想把这些话显示给用户,用自适应思考时要设 thinking.display;用 between_tools 的话文字会照常返回。

迁移后关掉「先想再答」的请求大概长这样:

{
  "model": "claude-sonnet-5-5",
  "max_tokens": 8000,
  "thinking": { "type": "between_tools" },
  "output_config": { "effort": "medium" },
  "tool_choice": { "type": "auto" },
  "messages": [...]
}

effort 也重新校准过了:同一档的思考量和 Sonnet 5 不一样,别直接搬旧设置。官方建议一般从 high 开始;agent 编码和多步工具调用,任务明确的从 medium 起步、难的再调到 high;聊天这类在意延迟的从 medium 或 low 起步。

对你意味着什么

洛洛按人群分了一下,你对着自己那条看就行。

  • Claude Code 和 Claude 应用用户:默认 effort 是 medium。上面的跑分都是 max 档,medium 下 CursorBench 从 55.5% 掉到 39.2%,碰到难题记得手动把档位调高
  • 调 API 的开发者:同价、同分词器,换个模型 ID 就能直接对比账单,是这次最省心的地方。但五个破坏性变化里,disabled 改 between_tools 和强制调工具报错最容易踩到,上线前先过一遍。API 上默认 effort 是 high,和应用里不一样
  • 在 Sonnet 和 Opus 之间犹豫的:Opus 5.5 单价是它的两倍。官方的分工是:Sonnet 5.5 擅长范围明确的日常任务、修 bug、做文档幻灯片表格,Opus 5.5 留给需要仔细判断的复杂工作。官方还说 Sonnet 5.5 在低档 effort 时和 Opus 5.5 互补最好,开到高档时成本和效果都会接近 Opus 5.5
  • 还在用 Haiku 4.5 的:Haiku 5.5 官方只说「未来几周」;弃用页写的 Haiku 4.5 最早退役日期是 2026-10-15,这两件事都值得盯一下
  • 做网络安全的:这是第一个带上和旗舰同类网络安全防护与回退的 Sonnet,高风险的网络安全请求会明显回退给 Sonnet 5 回答,日常找 bug、修 bug 不受影响
  • 本站用户:洛洛 AI 的默认模型仍是 Opus 5.5。模型选择里的「更快的 Claude」目前是 Sonnet 5,按苹果核规则是标准档、每问 2 核。ZenMux 在 2026-09-28 已经上架 Sonnet 5.5,价格和 Sonnet 5 一样;站里会不会换、什么时候换,以站内公告和苹果核规则页为准

局限

以下主要来自 Anthropic 自己的公告和 system card。

  • 复杂开放的活不如 Opus 5.5:官方原话是跑分只反映一个侧面,内部和外部测试都认为 Opus 5.5 在需要持续判断的复杂工作上明显更强
  • 最高档不一定最好:FrontierCode 上 max 档比 xhigh 低约 6 分,原因是开太多子 agent 导致超时或改过头
  • 第三方评测有个小插曲:Artificial Analysis 跑 GDPval-AA 和 AA-Briefcase 时用的预发布部署有个影响结构化输出的 bug(已修复),官方预计影响很小,而且只会让分数偏低
  • 安全防护会误拦:生物安全措施和 Sonnet 5 相同,官方说部分微生物学和病毒学请求可能被误判;网络安全高风险请求会回退给 Sonnet 5
  • 有几处退步:system card 说它在多轮测试里,跟踪监控、暴力极端主义、仇恨歧视几类比 Sonnet 5 退步;在电脑操作环境里拒绝有害任务的比例和 Opus 5.5 相当,但比部分更早的模型差
  • 对齐评估不是万能的:官方说它可能有尚未发现的倾向,所以才配合安全防护一起用
  • between_tools 只能配 high 及以下的档位,思考块又不能被别的模型读,经常在对话中途切换模型的应用要重新设计

洛洛写完这篇最大的感受是:这次没有什么惊天动地的新概念,就是同样的价钱,更快、更省、更强。对大多数人来说,这种「不用想就该换」的更新,可能比又一个刷新纪录的旗舰更实在。

数字都会过期,看到这篇的时候记得回官方页面对一眼。更多新模型速览在模型时讯,Haiku 5.5 来了洛洛再接着写。

参考来源

官方:

其它:

本站洛洛 AI 的模型列表来自站点配置记录,没有可公开引用的页面。

On this page