Claude Opus 5.5:新功能、价格、基准测试和与 Opus 5 的比较

Avatar
Lisa Ernst · 26.09.2026 · 人工智能 · 11 分钟

Claude Opus 5.5 自 2026 年 9 月 22 日起可用,仅在约两个月后取代 Opus 5,成为 Anthropic 最强大的 Opus 模型。最显著的变化不仅仅是更高的基准测试性能:普通 API 价格从每百万个输入 token 的 5 美元降至 4 美元,每百万个输出 token 的 25 美元降至 20 美元。Anthropic 估计,与 Opus 5 相比,典型的 token 基于的负载成本甚至降低了约 40%,因为 Opus 5.5 还应更有效地处理 token。

本概述展示了 Opus 5.5 的实际新内容、与 Opus 5 相比的价格、上下文窗口和基准测试的变化、开发人员需要了解的迁移陷阱以及对谁来说值得升级。基准测试数据将被视为供应商数据,而不是通用排名。

简而言之

什么是 Claude Opus 5.5?

Opus 5.5 是 Anthropic 用于复杂的编码、代理和知识工作的新旗舰模型。Anthropic 将其定位为处理大型代码库中的长、多步任务、复杂的工具使用和专业工作流程。如果您想了解 Claude 的基本情况,可以在 Zerlo 的概述中找到关于 Anthropic、模型和使用机会的重要基础知识。 什么是 Claude AI?最重要的基础知识。

技术上,许多方面保持熟悉:Opus 5.5 可以处理文本和图像作为输入,并生成文本作为输出。根据当前的 Claude Platform 文档,上下文窗口为 100 万个 token,常规最大输出为 128,000 个 token。可靠的知识截止日期为 2026 年 6 月。因此,对于该日期之后的事件,模型仍需要最新的外部数据源或 Web/工具访问。

Opus 5.5 有哪些新功能?

1. 更低的 token 成本和更高的效率

与 Opus 5 相比,直接标价下降了 20%:输入从每百万 token 5 美元降至 4 美元,输出从 25 美元降至 20 美元。在提示缓存方面,差异更大。Opus 5.5 的缓存读取每百万 token 成本为 0.20 美元,而 Opus 5 为 0.50 美元。

尽管如此,Anthropic 仍表示,典型的 token 基于的负载成本降低了约 40%。原因:不仅 token 的价格更低,而且该模型在许多任务中需要的 token 也更少。因此,这 40% 不是一概而论的折扣保证。实际差异很大程度上取决于特定工作流程产生的输入、输出和缓存使用的量。

2. 自适应思维始终处于激活状态

在 Opus 5.5 中,Thinking 不再可以完全禁用。取而代之的是,Effort 参数控制模型需要为请求投入多少计算资源。Opus 5.5 的默认值为 medium;根据模型文档,Opus 5 的默认值为 high。这对于成本和延迟比较很重要,因为两种模型在不同的 Effort 级别下无法直接比较。

3. 更侧重于编码和代理

Anthropic 特别强调了长时间运行的软件任务。已发布的测试研究了大型代码迁移、重构、终端任务和多工具工作流程。这些示例部分来自 Anthropic 或早期测试客户,因此应被视为供应商或测试结果——而不是保证每个实际项目都能达到相同的节省时间。

一个人在多显示器的电脑房里工作。

来源: ctan.org

Opus 5.5 特别针对希望自动化长时间编码和代理工作流程的开发人员。至关重要的是不仅要考虑基准分数,还要考虑 token 消耗、工具使用以及许多工作步骤中的可靠性。

4. 扩展的安全和行为检查

Anthropic 报告称,Opus 5.5 在其自身的自动化行为测试中表现优于早期模型,并且比 Opus 5 更能抵抗提示注入。同时,该公司强调限制仍然存在。该模型还将启动与 Fable 5.1 类似的额外保护机制,包括网络安全、生物学和防止模型蒸馏。对于生产系统,这不能替代您自己的权限管理、输入验证或关键操作控制。

Claude Opus 5.5 vs. Opus 5:技术规格

特征 Claude Opus 5.5 Claude Opus 5
发布日期 22. September 2026 24. Juli 2026
API 模型 ID claude-opus-5-5 claude-opus-5
上下文窗口 1 百万 token 1 百万 token
最大常规输出 128.000 token 128.000 token
输入价格 4 USD / 1 百万 token 5 USD / 1 百万 token
输出价格 20 USD / 1 百万 token 25 USD / 1 百万 token
缓存读取 0,20 USD / 1 百万 token 0,50 USD / 1 百万 token
思维 自适应思维始终激活 自适应思维可配置
标准精力 中等 高
可靠的知识截止日期 Juni 2026 Mai 2026
状态 当前 Opus 模型 活跃,但已过时

Claude Opus 5.5:价格详情

对于开发人员来说,价格变动是最重要的改进之一。下表显示了 Claude 的常规 API 标价。云提供商可能有自己的计费详情;此处未考虑税费、区域附加费或特殊推理选项。

每 100 万 token 的 API 成本 Opus 5.5 Opus 5 变化
输入 4 USD 5 USD -20 %
输出 20 USD 25 USD -20 %
5 分钟缓存写入 5 USD 6,25 USD -20 %
缓存读取 0,20 USD 0,50 USD -60 %

一个简单的计算示例显示了基本效果:不使用缓存的情况下,1000 万个输入 token 加上 200 万个输出 token,Opus 5.5 总共花费 80 美元。使用 Opus 5 则需要 100 美元。这正好是 20% 的标价降幅。对于缓存密集型代理,差异可能会更大。

此外,Opus 5.5 还提供最高 2.5 倍速度的快速模式。其输入 token 每百万美元 8 美元,输出 token 每百万美元 40 美元。因此,那些更注重成本而不是最小延迟的人应该继续使用普通模式。对于适合的异步任务,批量 API 可以将输入和输出成本降低 50%。

Claude 订阅和 API 是分开的

Opus 5.5 在 Claude 的 Pro、Max、Team 和 Enterprise 用户产品中可用。但是,Claude API 的使用将根据 API 使用量单独计费,并且不包含在 Claude Pro 订阅中。对于公司来说,这种分离很重要,因为聊天使用和生产性 API 工作流程的成本可以独立发展。

基准测试:Opus 5.5 比 Opus 5 快或好多少?

Anthropic 发布了 Opus 5.5 的几项内部比较值。在以下选择中,仅将 Opus 5.5 与其直接前身 Opus 5 进行比较。百分比是绝对命中率或成功率;GDPval-AA 是一个分数。

基准测试 Opus 5.5 Opus 5 差异
Terminal-Bench 4.0 66,4 % 52,3 % +14,1 百分点
FrontierCode v1.1 Main 54,4 % 48,0 % +6,4 百分点
CursorBench 4.0 57,8 % 46,6 % +11,2 百分点
GDPval-AA v2.1 1846 1708 +138 分数
AutomationBench 40,0 % 26,9 % +13,1 百分点
人类的最后一场考试 67,7 % 63,6 % +4,1 百分点
Terminal-Bench-Science 0.1 58,7 % 29,0 % +29,7 百分点
OSWorld 2.0 81,8 % 74,0 % +7,8 百分点

重要提示: 这些是 Anthropic 发布 的基准测试结果。测试配置因基准测试而异;除非另有说明,否则 Anthropic 对 Opus 5.5 使用高或最大努力设置。保护机制和回退措施也可能影响结果。因此,基准测试只能表明其能力,但不能替代使用您自己的提示、数据集、工具设置和成本配置文件进行测试。

为了与其他大型模型提供商进行更广泛的比较,Zerlo 的文章 "Gemini vs. Claude" 也很有帮助。但在进行此类比较时,应始终注意具体的模型版本和测试时间。

Opus 5 迁移到 Opus 5.5

仅在 Claude 应用程序中使用 Opus 5 的用户通常需要注意的事项很少。但对于 API 集成,有几项更改在投入生产之前应进行测试。

  1. 调整模型 ID: API 使用 claude-opus-5-5。
  2. 不再关闭 Thinking: 对于 Opus 5.5,自适应 Thinking 始终处于活动状态。应用程序应通过 effort 来控制计算成本,而不是完全禁用 Thinking。
  3. 检查工具选择: 对于 Opus 5.5,强制变体(如 any 或硬编码选择的工具)可能导致 400 错误。Anthropic 建议使用 auto 结合严格的工具使用或结构化输出。
  4. 更新 Computer-Use 工具: 在 Claude API 和 Google Cloud 上,Opus 5.5 使用更新的 Computer-Use 工具集。在 Amazon Bedrock 上,出于兼容性原因,可能适用不同的要求。
  5. 不要重写 Thinking 块:自行处理对话历史记录的应用程序应根据 Thinking 块的类型进行处理,并保持不变地传递。
多个人在计算机房里使用台式电脑工作。

来源: ctan.org

对于现有的 API 工作流程,在模型切换之前进行有针对性的回归测试是值得的:特别是对于工具选择、计算机使用、结构化输出、长对话和成本控制。

Claude Opus 5.5 在哪里可用?

根据 Anthropic 的说法,Opus 5.5 对终端用户在 Claude 的 Pro、Max、Team 和 Enterprise 版本中可用。开发人员可以通过 Claude Platform 或 Claude API 使用该模型。此外,Anthropic 还提到了 Amazon Web Services、Google Cloud 和 Microsoft Foundry 作为支持的平台。

此外,Anthropic 在推出 Opus 5.5 时提高了 Pro、Max、Team 和基于席位的 Enterprise 计划的五小时使用限制。然而,实际可用使用量取决于具体计划、任务和令牌消耗。

谁适合从 Opus 5 迁移?

对于新的 API 项目,如果不存在特殊的兼容性要求,那么使用 Opus 5 启动的项目很少。Opus 5.5 每个令牌的价格更便宜,更新,并且在 Anthropic 发布 的测试中,在所考虑的基准测试中,其表现持续优于 Opus 5。

对于现有的编码和代理系统,如果缓存读取、长上下文和大量工具调用占了成本的大部分,那么迁移尤其有吸引力。在这种情况下,低列表价格、更便宜的缓存读取和潜在的令牌效率的组合可能比单纯的 20% 降价更有效。

对于具有硬编码工具控制的生产集成,迁移不应仅通过更换模型名称来完成。Thinking 和 Tool Choice 的变化可能导致行为或 API 错误。一个简短的测试清单,包含典型和关键的工作流程,比未经检查的部署更有意义。

限制和重要说明

FAQ

Claude Opus 5.5 是何时发布的?

Anthropic 于 2026 年 9 月 22 日发布了 Claude Opus 5.5。Opus 5 于 2026 年 7 月 24 日发布。

通过 API 使用 Claude Opus 5.5 的成本是多少?

常规列表价格为每百万个输入令牌 4 美元,每百万个输出令牌 20 美元。缓存读取每百万个令牌 0.20 美元。快速模式输入为每百万个令牌 8 美元,输出为每百万个令牌 40 美元。

Opus 5.5 比 Opus 5 便宜吗?

是的。常规输入和输出价格均降低 20%。缓存读取便宜 60%。Anthropic 估计,由于 Opus 5.5 在任务中消耗的令牌也更少,因此典型的基于令牌的工作负载总成本降低约 40%。

Claude Opus 5.5 的上下文窗口比 Opus 5 大吗?

否。在当前的 Claude Platform 文档中,这两个模型都具有高达 100 万个令牌的上下文窗口,常规最大输出为 128,000 个令牌。

Opus 5.5 在编程方面比 Opus 5 更好吗?

在 Anthropic 发布 的编码和终端基准测试中,Opus 5.5 优于 Opus 5,包括在 Terminal-Bench 4.0、FrontierCode 和 CursorBench 4.0 中。但对于实际项目,仍应使用自己的代码库、工具和提示设置来测试其质量。

我需要更改我的 API 集成以使用 Opus 5.5 吗?

至少需要更改模型 ID。根据集成情况,可能还需要更改 Thinking、Tool Choice 和 Computer Use。使用这些功能的用户应查看 Anthropic 的迁移说明,并在投入生产之前测试应用程序。

Claude Opus 5.5 是否包含在免费的 Claude 套餐中?

Anthropic 提到了 Pro、Max、Team 和 Enterprise 用户使用 Opus 5.5。免费的 Claude 套餐不包含在 Anthropic 列出的 Opus 5.5 套餐中。

结论

Claude Opus 5.5 不是一个小幅的中间更新。与 Opus 5 相比,Anthropic 将更高的发布基准测试结果与更低的 API 价格、更便宜的缓存读取以及对长编码和代理任务的更强关注结合起来。100 万个令牌的上下文窗口得以保留;主要的新增功能是效率、模型行为以及与 Thinking 和工具相关的 API 详细信息。

对于新的、要求苛刻的 Claude 项目,Opus 5.5 是显而易见的 Opus 版本。对于现有的 Opus 5 系统,迁移也值得考虑,但由于 Thinking、Tool Choice 和 Computer Use 的变化,应将其视为真正的迁移并进行测试。基准测试的优势令人鼓舞,但最终,在您自己的工作流程中的结果仍然至关重要——包括成本、延迟和错误率。

分享我们的文章!
来源