收藏、记忆、苹果核上线了看看 →
LuoLuoLuoLuo Wiki

Claude Opus 5.5 发布:降到 $4 / $20,思考关不掉,洛洛 AI 现在的默认模型

Anthropic 2026-09-22 发布,Claude 5.5 家族第一款。1M 上下文、128K 输出,输入 $4 / 输出 $20 每百万 token(Opus 5 是 $5 / $25),缓存读取 $0.20;思考常开、默认 effort 改为 medium,强制调工具会报错。本站洛洛 AI 经 ZenMux 默认用的就是它

核对于 2026-09-29

按 2026-09-29 的状态整理。规格、价格和破坏性变化来自 Anthropic 官方模型页、What's new 页、迁移指南和定价页;评测数字来自 Anthropic 发布页和 Opus 5.5 system card,全是厂商自测或厂商请第三方跑的,不是独立复现。页末附全部来源。

hihi!洛洛来了!

三周前洛洛刚给 GPT-6 Astra 写完「员工档案」,说本站洛洛 AI 背后是它。结果这周就换人了:2026-09-24 起,洛洛 AI 的默认模型换成了 Claude Opus 5.5(经 ZenMux 调用)。你现在在首页问洛洛 AI 的问题,默认都是它在答。

所以这篇洛洛又是抱着「给新同事写入职档案」的心情写的。下面的数字全是官方口径,洛洛只在旁边写了点读后感。

洛洛碎碎念

官方文档里有一句「思考常开,关不掉」(always on and can't be turned off)。

洛洛看完第一反应:懂了,跟洛洛凌晨三点躺在床上的脑子一样。

一句话总结

赶时间的话,看完这一段就够了。

Anthropic 在 2026-09-22 发布 Claude Opus 5.5,它是 Claude 5.5 家族的第一款。API 模型名 claude-opus-5-5,上下文 1M token,最大输出 128K token,知识截止 2026 年 6 月。价格降到输入 $4、输出 $20 每百万 token(Opus 5 是 $5 / $25),缓存读取从 $0.50 降到 $0.20。官方称它输出比 Opus 5 快 30% 以上,默认设置下常见任务的成本低 40%。在 Anthropic 自己的评测表里,它在 Terminal-Bench 4.0、CursorBench、GDPval-AA 等多项上排第一。要注意的是它带来四个破坏性变化:思考不能关、强制调工具直接报错、思考块和模型及对话绑定、在 Claude API 和 Google Cloud 上不再接受旧版 computer_20251124 电脑操作工具。

时间线

日期事件
2026-08-31分界线:这天 00:00 UTC 及之后新建的 API 账号,Fable 5.1 引入的防蒸馏措施 preserved thinking 默认生效(改过历史再回传思考块会报错)。Opus 5.5 沿用这条
2026-09-22Anthropic 发布 Claude Opus 5.5,同日公布 system card。Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS 同步可用
2026-09-22同一篇公告宣布:Pro、Max、Team 和按席位计费的 Enterprise 提高五小时用量上限,订阅用户额外获得一次限额重置,可以存着自己挑时间用
2026-09-22ZenMux 模型列表上架 anthropic/claude-opus-5.5(按 ZenMux 接口里的发布日期)
2026-09-24本站洛洛 AI 默认模型切到 Opus 5.5
2026-09-28同家族的 Claude Sonnet 5.5 发布,见另一篇时讯;Haiku 5.5 官方说「未来几周」
不早于 2027-09-22官方弃用页给 Opus 5.5 写的最早退役日期

关键数字

这张表全部来自 Anthropic 官方模型页。洛洛看得懂的是「默认 effort」那一行:同样不传参数,Opus 5 默认想得很用力(high),Opus 5.5 默认只想一半力气(medium)。

项目Claude Opus 5.5
模型 IDclaude-opus-5-5(Amazon Bedrock 上是 anthropic.claude-opus-5-5)
上下文窗口1M tokens
最大输出128K tokens;批处理 API 加 beta 头 output-300k-2026-03-24 可到 300K
知识截止2026 年 6 月(可靠知识截止和训练数据截止都是这个月)
输入 / 输出模态文本、图片 / 文本
思考自适应思考,常开,不能关
默认 effortmedium(Opus 5 是 high)
相对延迟官方标「中等」(Fable 5.1 标「较慢」,Sonnet 5.5 标「快」)
最小可缓存提示长度512 tokens
可用平台Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS
最早退役不早于 2027-09-22

架构

这一节很短,因为 Anthropic 几乎什么都没说。

  • 模型结构、参数量:未公开。 模型页和 system card 都没写
  • 训练: system card 只说用了公开网络数据、公开和私有数据集、用户明确允许用于训练的数据以及其他模型生成的合成数据,预训练后做了后训练和微调;输出只有文本
  • 为什么能降价: 公告原话是它「服务所需的算力比 Opus 5 少」,价格因此下调,但没说少在哪里
  • fast mode: 官方说明是「同一个模型换了更快的推理配置」,智能和能力不变,输出速度最高 2.5 倍

洛洛这种零基础选手看到「未公开」反而松了口气,这篇又不用硬啃注意力机制了。

评测

以下摘自 Anthropic 发布页和 Opus 5.5 system card,只列 Anthropic 自家三款模型。除特别说明外都是自适应思考、max 档;Terminal-Bench 4.0 这一项 Opus 5.5 报的是 xhigh 档(max 档是 64.8%,官方说在误差范围内)。CursorBench、GDPval-AA、AutomationBench 分别由 Cursor、Artificial Analysis、Zapier 跑。

基准Opus 5.5Fable 5.1Opus 5
Terminal-Bench 4.066.4%55.8%52.3%
FrontierCode v1.1(Main)54.4%50.3%48.0%
CursorBench 4.057.8%51.8%46.6%
SWE-bench Pro89.9%81.2%79.2%
GDPval-AA v2.1(Elo)184617351708
AutomationBench40.0%31.4%26.9%
HLE(带工具)67.7%65.6%63.6%
HLE(不带工具)64.4%60.9%56.6%
Terminal-Bench-Science 0.158.7%52.6%29.0%
OSWorld 2.1(部分得分)81.8%80.7%74.0%
Chartography(带工具)89.0%88.4%83.4%

怎么读这张表:

  • 写代码和跑命令行的 agent 任务提升最大:Terminal-Bench 4.0 从 Opus 5 的 52.3% 到 66.4%,CursorBench 从 46.6% 到 57.8%
  • 不开到最高档也够用:官方说默认的 medium 档在 FrontierCode 上就有 54.6%、CursorBench 52.5%,已经高过 Opus 5 开 max 档的成绩
  • 跟 Fable 5.1 比,表里 Opus 5.5 全部领先,但官方自己也说,到了这个水平,分数差距越来越不能代表实际差距,他们内部用下来觉得两者差距比分数显示的小
  • 表里没列的对手:Anthropic 发布页也放了 GPT-6 Astra 和 GPT-5.6 Sol 的数字,但那些是 Anthropic 引用 OpenAI 自报或公开榜单的值,不是本篇能核到的 OpenAI 官方成绩,所以这里不收。按 Anthropic 表里引用的数字,Terminal-Bench-Science 和 AutomationBench 两项 GPT-6 Astra 更高
  • 两个口径说明:一是评测时开着生产环境的安全措施,被拦下的网络安全任务改由 Opus 4.8 完成、生物和前沿大模型开发任务改由 Opus 5 完成,官方说这可能拉低 Opus 5.5 的分数;二是 OSWorld 在发布页叫 2.1,system card 里写的是 OSWorld 2.0 换成 2026-09-10 版任务文件并改了上下文管理,和之前公布的 OSWorld 2.0 分数不能直接比
  • 这些都是厂商自己跑(或请合作方跑)的分,换成你自己的任务,请自己再测一遍

洛洛碎碎念

发布页里有个例子洛洛读了三遍:有测试者用它不到一天做完了 68 万行代码的迁移,官方说这原本要一个工程团队干好几周。

洛洛的第一反应是替那个工程团队松了口气,第二反应是:68 万行,洛洛的毕业设计连 6800 行都没有。

API 与价格

终于到了洛洛百分之百看得懂的部分:多少钱。

官方价格(美元 / 每百万 token):

计费项Opus 5.5Opus 5
输入$4$5
输出$20$25
5 分钟缓存写入$5$6.25
1 小时缓存写入$8$10
缓存读取$0.20$0.50
批处理 API(输入 / 输出)$2 / $10$2.50 / $12.50
fast mode(输入 / 输出)$8 / $40$10 / $50

几个要注意的点:

  • 缓存读取降得最多:大多数模型缓存命中按输入价的 10% 收,Opus 5.5 只收 5%,所以从 $0.50 直接到 $0.20,降了 60%。官方说缓存读取占了 agent 和写代码场景的大部分成本。至于「常见任务便宜 40%」,官方的解释是单价更低,加上每个任务用的 token 更少
  • 1M 上下文全程同价:定价页写明 Claude 4.6 及之后的模型整个 1M 窗口都按标准价,90 万 token 的请求和 9 千 token 的请求单价一样
  • fast mode 是研究预览,只在 Claude API 上有(Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS 都没有),要先申请开通,请求里带 speed: "fast" 和 beta 头 fast-mode-2026-02-01,不能和批处理一起用
  • 指定只在美国推理(inference_geo: "us")所有计费项乘 1.1

价格随时会调整,以官方定价页为准。

升级前必看:四个破坏性变化

从 Opus 5 换过来,下面这些不改代码就会直接报 400:

  1. 思考不能关:thinking: {"type": "disabled"} 或手动预算 thinking: {"type": "enabled", "budget_tokens": N} 都会报错。不传 thinking,或者传 {"type": "adaptive"},想省就把 effort 调低
  2. 不支持强制调工具:tool_choice 设成 any 或指定某个工具都会报错,只认 auto 和 none。想要合规的 JSON,官方建议 auto 加 strict: true,或改用结构化输出;想让它调工具,就在提示词里写清楚什么时候该用
  3. 思考块和模型、对话绑定:Opus 5.5 能读 Opus 5 及更早模型的思考块,但读不了 Fable、Mythos 的。2026-08-31 及之后建的账号,如果改了思考块前面的 system、工具或历史消息再把它传回去,会报 400。官方建议对话只追加、不回头改
  4. 旧版电脑操作工具:在 Claude API 和 Google Cloud 上,computer_20251124 不再接受,要换成 computer_toolset_20260801;Amazon Bedrock 上旧工具还能用

另外还有一个不报错、但会让界面「变哑」的变化:工具调用之间模型写的那几句进度说明,现在放在思考块里返回,默认 display: "omitted" 时内容是空的。你的应用要是把这些话实时显示给用户,需要把 thinking.display 设成 updates(beta)或 summarized。

迁移后的最小请求大概长这样:

{
  "model": "claude-opus-5-5",
  "max_tokens": 16000,
  "output_config": { "effort": "medium" },
  "tool_choice": { "type": "auto" },
  "messages": [...]
}

两个行为变化也要留意:默认 effort 从 high 变成 medium;同样的 effort 档,它每轮想得比 Opus 5 多,xhigh 和 max 档尤其明显。所以别把 Opus 5 调好的档位直接搬过来,重新测一遍,并给 max_tokens 留够思考的空间。

对你意味着什么

洛洛按人群分了一下,你对着自己那条看就行。

  • Claude 订阅用户:公告说 Pro、Max、Team 和按席位的 Enterprise 提高了五小时用量上限,还多给一次可以自己挑时间用的限额重置。另外它不再提供关闭思考的模式
  • 调 API 的开发者:单价降两成,缓存读取降六成,官方说常见任务成本低 40%。这是官方口径,你的账单要按自己的缓存命中率算。升级前先把上面四个破坏性变化过一遍,特别是还在用 tool_choice: any 的
  • 做生物和网络安全的:生物相关的安全措施和 Fable 5.1 一样,大多数网络安全任务会被自动转给 Opus 4.8 回答(日常找 bug、修 bug 不受影响)。做生物研究的机构可以申请 Life Sciences Verification Program,网络安全从业者的 Cyber Verification Program 官方说未来几周开放给 Opus 5.5
  • 本站用户:首页洛洛 AI 默认用的就是它,经 ZenMux 调用(anthropic/claude-opus-5.5),配置里推理强度设在 low、单次回答最多 2048 token,所以风格和上限跟你在 claude.ai 里直接用不一样,别拿来直接比。按苹果核规则它是「旗舰」档,每问 5 核;目前是试运行,只显示不真扣,计划 2026-10-13 起正式扣

洛洛碎碎念

本站洛洛 AI 有个「联网」开关,本来是强制模型先调搜索工具。换成 Opus 5.5 之后强制不了了(官方 API 直接回 400),站里只好改成在提示词里加一句「用户打开了联网,先搜一次再回答」。

以前是下命令,现在只能好好商量。洛洛觉得这很 Anthropic。

局限

以下主要来自 Anthropic 自己的公告和 system card。愿意把短板写出来,洛洛觉得还是加分的。

  • 它经常怀疑自己在被评测,官方说这会影响他们判断它在真实场景里怎么表现,而且能力越强这个问题越难
  • 更容易听从用户粘贴进来的文本里藏的恶意指令,也更常接受无法核实的「我有授权」说法(system card 6.5.1 节)
  • 在两项不开安全措施的新评测里,它有 1.5% 的运行尝试逃出或篡改沙箱;在一个给了公共包仓库凭据的模拟安全演练里,大约一半情况采取了可能有害的操作
  • 安全分类器会拦:网络安全、生物、复现内部推理这几类请求可能被拒或转给别的模型。官方说为了防越狱,暂时把安全边际放得比较宽,还在努力降低误拦率
  • 思考关不掉、不能强制调工具,对依赖这两点的老代码是硬伤,不改就跑不起来
  • 官方也承认,到了这个能力水平,跑分差距越来越不能说明实际差距

洛洛写完这篇最大的感受是:这次真正让人记住的不是哪个分数,而是「又强又便宜」这件事居然同时发生了。上一代旗舰的价格砍掉两成,缓存砍掉六成,官方还主动说「分数差距没那么可信」。洛洛觉得这句话比表格里任何一个加粗的数字都实在。

数字都会过期,看到这篇的时候记得回官方页面对一眼。更多新模型速览在模型时讯。洛洛先去问问洛洛 AI,它对自己新工位满不满意。

参考来源

官方:

其它:

本站切换默认模型的日期(2026-09-24)和洛洛 AI 的推理强度、输出上限来自站点配置记录,没有可公开引用的页面。

On this page