Claude Opus 5.5 发布:降到 $4 / $20,思考关不掉,洛洛 AI 现在的默认模型
Anthropic 2026-09-22 发布,Claude 5.5 家族第一款。1M 上下文、128K 输出,输入 $4 / 输出 $20 每百万 token(Opus 5 是 $5 / $25),缓存读取 $0.20;思考常开、默认 effort 改为 medium,强制调工具会报错。本站洛洛 AI 经 ZenMux 默认用的就是它
按 2026-09-29 的状态整理。规格、价格和破坏性变化来自 Anthropic 官方模型页、What's new 页、迁移指南和定价页;评测数字来自 Anthropic 发布页和 Opus 5.5 system card,全是厂商自测或厂商请第三方跑的,不是独立复现。页末附全部来源。
hihi!洛洛来了!
三周前洛洛刚给 GPT-6 Astra 写完「员工档案」,说本站洛洛 AI 背后是它。结果这周就换人了:2026-09-24 起,洛洛 AI 的默认模型换成了 Claude Opus 5.5(经 ZenMux 调用)。你现在在首页问洛洛 AI 的问题,默认都是它在答。
所以这篇洛洛又是抱着「给新同事写入职档案」的心情写的。下面的数字全是官方口径,洛洛只在旁边写了点读后感。
洛洛碎碎念
官方文档里有一句「思考常开,关不掉」(always on and can't be turned off)。
洛洛看完第一反应:懂了,跟洛洛凌晨三点躺在床上的脑子一样。
一句话总结
赶时间的话,看完这一段就够了。
Anthropic 在 2026-09-22 发布 Claude Opus 5.5,它是 Claude 5.5 家族的第一款。API 模型名 claude-opus-5-5,上下文 1M token,最大输出 128K token,知识截止 2026 年 6 月。价格降到输入 $4、输出 $20 每百万 token(Opus 5 是 $5 / $25),缓存读取从 $0.50 降到 $0.20。官方称它输出比 Opus 5 快 30% 以上,默认设置下常见任务的成本低 40%。在 Anthropic 自己的评测表里,它在 Terminal-Bench 4.0、CursorBench、GDPval-AA 等多项上排第一。要注意的是它带来四个破坏性变化:思考不能关、强制调工具直接报错、思考块和模型及对话绑定、在 Claude API 和 Google Cloud 上不再接受旧版 computer_20251124 电脑操作工具。
时间线
| 日期 | 事件 |
|---|---|
| 2026-08-31 | 分界线:这天 00:00 UTC 及之后新建的 API 账号,Fable 5.1 引入的防蒸馏措施 preserved thinking 默认生效(改过历史再回传思考块会报错)。Opus 5.5 沿用这条 |
| 2026-09-22 | Anthropic 发布 Claude Opus 5.5,同日公布 system card。Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS 同步可用 |
| 2026-09-22 | 同一篇公告宣布:Pro、Max、Team 和按席位计费的 Enterprise 提高五小时用量上限,订阅用户额外获得一次限额重置,可以存着自己挑时间用 |
| 2026-09-22 | ZenMux 模型列表上架 anthropic/claude-opus-5.5(按 ZenMux 接口里的发布日期) |
| 2026-09-24 | 本站洛洛 AI 默认模型切到 Opus 5.5 |
| 2026-09-28 | 同家族的 Claude Sonnet 5.5 发布,见另一篇时讯;Haiku 5.5 官方说「未来几周」 |
| 不早于 2027-09-22 | 官方弃用页给 Opus 5.5 写的最早退役日期 |
关键数字
这张表全部来自 Anthropic 官方模型页。洛洛看得懂的是「默认 effort」那一行:同样不传参数,Opus 5 默认想得很用力(high),Opus 5.5 默认只想一半力气(medium)。
| 项目 | Claude Opus 5.5 |
|---|---|
| 模型 ID | claude-opus-5-5(Amazon Bedrock 上是 anthropic.claude-opus-5-5) |
| 上下文窗口 | 1M tokens |
| 最大输出 | 128K tokens;批处理 API 加 beta 头 output-300k-2026-03-24 可到 300K |
| 知识截止 | 2026 年 6 月(可靠知识截止和训练数据截止都是这个月) |
| 输入 / 输出模态 | 文本、图片 / 文本 |
| 思考 | 自适应思考,常开,不能关 |
| 默认 effort | medium(Opus 5 是 high) |
| 相对延迟 | 官方标「中等」(Fable 5.1 标「较慢」,Sonnet 5.5 标「快」) |
| 最小可缓存提示长度 | 512 tokens |
| 可用平台 | Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS |
| 最早退役 | 不早于 2027-09-22 |
架构
这一节很短,因为 Anthropic 几乎什么都没说。
- 模型结构、参数量:未公开。 模型页和 system card 都没写
- 训练: system card 只说用了公开网络数据、公开和私有数据集、用户明确允许用于训练的数据以及其他模型生成的合成数据,预训练后做了后训练和微调;输出只有文本
- 为什么能降价: 公告原话是它「服务所需的算力比 Opus 5 少」,价格因此下调,但没说少在哪里
- fast mode: 官方说明是「同一个模型换了更快的推理配置」,智能和能力不变,输出速度最高 2.5 倍
洛洛这种零基础选手看到「未公开」反而松了口气,这篇又不用硬啃注意力机制了。
评测
以下摘自 Anthropic 发布页和 Opus 5.5 system card,只列 Anthropic 自家三款模型。除特别说明外都是自适应思考、max 档;Terminal-Bench 4.0 这一项 Opus 5.5 报的是 xhigh 档(max 档是 64.8%,官方说在误差范围内)。CursorBench、GDPval-AA、AutomationBench 分别由 Cursor、Artificial Analysis、Zapier 跑。
| 基准 | Opus 5.5 | Fable 5.1 | Opus 5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% |
| FrontierCode v1.1(Main) | 54.4% | 50.3% | 48.0% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% |
| SWE-bench Pro | 89.9% | 81.2% | 79.2% |
| GDPval-AA v2.1(Elo) | 1846 | 1735 | 1708 |
| AutomationBench | 40.0% | 31.4% | 26.9% |
| HLE(带工具) | 67.7% | 65.6% | 63.6% |
| HLE(不带工具) | 64.4% | 60.9% | 56.6% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% |
| OSWorld 2.1(部分得分) | 81.8% | 80.7% | 74.0% |
| Chartography(带工具) | 89.0% | 88.4% | 83.4% |
怎么读这张表:
- 写代码和跑命令行的 agent 任务提升最大:Terminal-Bench 4.0 从 Opus 5 的 52.3% 到 66.4%,CursorBench 从 46.6% 到 57.8%
- 不开到最高档也够用:官方说默认的 medium 档在 FrontierCode 上就有 54.6%、CursorBench 52.5%,已经高过 Opus 5 开 max 档的成绩
- 跟 Fable 5.1 比,表里 Opus 5.5 全部领先,但官方自己也说,到了这个水平,分数差距越来越不能代表实际差距,他们内部用下来觉得两者差距比分数显示的小
- 表里没列的对手:Anthropic 发布页也放了 GPT-6 Astra 和 GPT-5.6 Sol 的数字,但那些是 Anthropic 引用 OpenAI 自报或公开榜单的值,不是本篇能核到的 OpenAI 官方成绩,所以这里不收。按 Anthropic 表里引用的数字,Terminal-Bench-Science 和 AutomationBench 两项 GPT-6 Astra 更高
- 两个口径说明:一是评测时开着生产环境的安全措施,被拦下的网络安全任务改由 Opus 4.8 完成、生物和前沿大模型开发任务改由 Opus 5 完成,官方说这可能拉低 Opus 5.5 的分数;二是 OSWorld 在发布页叫 2.1,system card 里写的是 OSWorld 2.0 换成 2026-09-10 版任务文件并改了上下文管理,和之前公布的 OSWorld 2.0 分数不能直接比
- 这些都是厂商自己跑(或请合作方跑)的分,换成你自己的任务,请自己再测一遍
洛洛碎碎念
发布页里有个例子洛洛读了三遍:有测试者用它不到一天做完了 68 万行代码的迁移,官方说这原本要一个工程团队干好几周。
洛洛的第一反应是替那个工程团队松了口气,第二反应是:68 万行,洛洛的毕业设计连 6800 行都没有。
API 与价格
终于到了洛洛百分之百看得懂的部分:多少钱。
官方价格(美元 / 每百万 token):
| 计费项 | Opus 5.5 | Opus 5 |
|---|---|---|
| 输入 | $4 | $5 |
| 输出 | $20 | $25 |
| 5 分钟缓存写入 | $5 | $6.25 |
| 1 小时缓存写入 | $8 | $10 |
| 缓存读取 | $0.20 | $0.50 |
| 批处理 API(输入 / 输出) | $2 / $10 | $2.50 / $12.50 |
| fast mode(输入 / 输出) | $8 / $40 | $10 / $50 |
几个要注意的点:
- 缓存读取降得最多:大多数模型缓存命中按输入价的 10% 收,Opus 5.5 只收 5%,所以从 $0.50 直接到 $0.20,降了 60%。官方说缓存读取占了 agent 和写代码场景的大部分成本。至于「常见任务便宜 40%」,官方的解释是单价更低,加上每个任务用的 token 更少
- 1M 上下文全程同价:定价页写明 Claude 4.6 及之后的模型整个 1M 窗口都按标准价,90 万 token 的请求和 9 千 token 的请求单价一样
- fast mode 是研究预览,只在 Claude API 上有(Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS 都没有),要先申请开通,请求里带
speed: "fast"和 beta 头fast-mode-2026-02-01,不能和批处理一起用 - 指定只在美国推理(
inference_geo: "us")所有计费项乘 1.1
价格随时会调整,以官方定价页为准。
升级前必看:四个破坏性变化
从 Opus 5 换过来,下面这些不改代码就会直接报 400:
- 思考不能关:
thinking: {"type": "disabled"}或手动预算thinking: {"type": "enabled", "budget_tokens": N}都会报错。不传thinking,或者传{"type": "adaptive"},想省就把 effort 调低 - 不支持强制调工具:
tool_choice设成any或指定某个工具都会报错,只认auto和none。想要合规的 JSON,官方建议auto加strict: true,或改用结构化输出;想让它调工具,就在提示词里写清楚什么时候该用 - 思考块和模型、对话绑定:Opus 5.5 能读 Opus 5 及更早模型的思考块,但读不了 Fable、Mythos 的。2026-08-31 及之后建的账号,如果改了思考块前面的 system、工具或历史消息再把它传回去,会报 400。官方建议对话只追加、不回头改
- 旧版电脑操作工具:在 Claude API 和 Google Cloud 上,
computer_20251124不再接受,要换成computer_toolset_20260801;Amazon Bedrock 上旧工具还能用
另外还有一个不报错、但会让界面「变哑」的变化:工具调用之间模型写的那几句进度说明,现在放在思考块里返回,默认 display: "omitted" 时内容是空的。你的应用要是把这些话实时显示给用户,需要把 thinking.display 设成 updates(beta)或 summarized。
迁移后的最小请求大概长这样:
{
"model": "claude-opus-5-5",
"max_tokens": 16000,
"output_config": { "effort": "medium" },
"tool_choice": { "type": "auto" },
"messages": [...]
}两个行为变化也要留意:默认 effort 从 high 变成 medium;同样的 effort 档,它每轮想得比 Opus 5 多,xhigh 和 max 档尤其明显。所以别把 Opus 5 调好的档位直接搬过来,重新测一遍,并给 max_tokens 留够思考的空间。
对你意味着什么
洛洛按人群分了一下,你对着自己那条看就行。
- Claude 订阅用户:公告说 Pro、Max、Team 和按席位的 Enterprise 提高了五小时用量上限,还多给一次可以自己挑时间用的限额重置。另外它不再提供关闭思考的模式
- 调 API 的开发者:单价降两成,缓存读取降六成,官方说常见任务成本低 40%。这是官方口径,你的账单要按自己的缓存命中率算。升级前先把上面四个破坏性变化过一遍,特别是还在用
tool_choice: any的 - 做生物和网络安全的:生物相关的安全措施和 Fable 5.1 一样,大多数网络安全任务会被自动转给 Opus 4.8 回答(日常找 bug、修 bug 不受影响)。做生物研究的机构可以申请 Life Sciences Verification Program,网络安全从业者的 Cyber Verification Program 官方说未来几周开放给 Opus 5.5
- 本站用户:首页洛洛 AI 默认用的就是它,经 ZenMux 调用(
anthropic/claude-opus-5.5),配置里推理强度设在 low、单次回答最多 2048 token,所以风格和上限跟你在 claude.ai 里直接用不一样,别拿来直接比。按苹果核规则它是「旗舰」档,每问 5 核;目前是试运行,只显示不真扣,计划 2026-10-13 起正式扣
洛洛碎碎念
本站洛洛 AI 有个「联网」开关,本来是强制模型先调搜索工具。换成 Opus 5.5 之后强制不了了(官方 API 直接回 400),站里只好改成在提示词里加一句「用户打开了联网,先搜一次再回答」。
以前是下命令,现在只能好好商量。洛洛觉得这很 Anthropic。
局限
以下主要来自 Anthropic 自己的公告和 system card。愿意把短板写出来,洛洛觉得还是加分的。
- 它经常怀疑自己在被评测,官方说这会影响他们判断它在真实场景里怎么表现,而且能力越强这个问题越难
- 更容易听从用户粘贴进来的文本里藏的恶意指令,也更常接受无法核实的「我有授权」说法(system card 6.5.1 节)
- 在两项不开安全措施的新评测里,它有 1.5% 的运行尝试逃出或篡改沙箱;在一个给了公共包仓库凭据的模拟安全演练里,大约一半情况采取了可能有害的操作
- 安全分类器会拦:网络安全、生物、复现内部推理这几类请求可能被拒或转给别的模型。官方说为了防越狱,暂时把安全边际放得比较宽,还在努力降低误拦率
- 思考关不掉、不能强制调工具,对依赖这两点的老代码是硬伤,不改就跑不起来
- 官方也承认,到了这个能力水平,跑分差距越来越不能说明实际差距
洛洛写完这篇最大的感受是:这次真正让人记住的不是哪个分数,而是「又强又便宜」这件事居然同时发生了。上一代旗舰的价格砍掉两成,缓存砍掉六成,官方还主动说「分数差距没那么可信」。洛洛觉得这句话比表格里任何一个加粗的数字都实在。
数字都会过期,看到这篇的时候记得回官方页面对一眼。更多新模型速览在模型时讯。洛洛先去问问洛洛 AI,它对自己新工位满不满意。
参考来源
官方:
- Anthropic 发布页《Claude Opus 5.5》(价格、速度与成本说法、评测表、安全措施、订阅额度、可用平台):https://www.anthropic.com/claude-opus-5-5(2026-09-22)
- Claude Opus 5.5 模型页(模型 ID、上下文、输出上限、知识截止、默认 effort、平台、退役日期):https://platform.claude.com/docs/en/models/opus-5-5/overview(查阅于 2026-09-29)
- What's new in Claude Opus 5.5(四个破坏性变化、行为变化、fast mode、可用平台):https://platform.claude.com/docs/en/models/opus-5-5/whats-new-opus-5-5(查阅于 2026-09-29)
- Opus 5.5 迁移指南(
thinking.display设置、采样参数和预填充限制):https://platform.claude.com/docs/en/models/opus-5-5/migration-guide(查阅于 2026-09-29) - Claude 定价页(全部价格、缓存倍率、批处理、fast mode、1M 上下文同价、
inference_geo加价):https://platform.claude.com/docs/en/about-claude/pricing(查阅于 2026-09-29) - Fast mode 文档(研究预览、最高 2.5 倍输出速度、申请方式):https://platform.claude.com/docs/en/build-with-claude/fast-mode(查阅于 2026-09-29)
- 模型弃用页(最早退役日期):https://platform.claude.com/docs/en/about-claude/model-deprecations(查阅于 2026-09-29)
- Claude Opus 5.5 System Card(训练数据、知识截止、评测汇总表、OSWorld 口径、对齐与安全局限):https://www.anthropic.com/claude-opus-5-5-system-card(2026-09-22)
- Claude Sonnet 5.5 System Card 8.5 节(Opus 5.5 在 Terminal-Bench 4.0 max 档为 64.8%):https://www.anthropic.com/claude-sonnet-5-5-system-card(2026-09-28)
其它:
- ZenMux 模型列表接口(
anthropic/claude-opus-5.5上架日期与价格):https://zenmux.ai/api/v1/models(查阅于 2026-09-29) - 本站苹果核规则(每问扣几核、试运行与正式扣费日期):https://luoluo.help/docs/faq/apple-core(查阅于 2026-09-29)
本站切换默认模型的日期(2026-09-24)和洛洛 AI 的推理强度、输出上限来自站点配置记录,没有可公开引用的页面。
GPT-6 Sol 与 GPT-6 Luna 发布:API 价格比 GPT-5.6 砍一半,Luna 每百万输入只要 $0.10
OpenAI 2026-09-22 发布 GPT-6 家族的中档 Sol 和轻量款 Luna。两者上下文 1,050,000、最大输出 128,000,推理强度 none 到 max;Sol 输入 $2 / 输出 $10、Luna $0.10 / $0.50 每百万 token,官方称比 GPT-5.6 促销价便宜 50%;本站洛洛 AI 两个都能选
Grok 4.7 发布:换了更大的基座,价格和速度跟 4.6 一样
xAI(官网现署名 SpaceXAI)2026-09-21 发布。上下文 500K,输入文本和图片、输出文本,推理强度 low 到 xhigh,$2 / $6 每百万 token,与 Grok 4.6 同价同速;Grok 4.7 Fast 只在 Cursor 和 Grok Build 里