2026 年 9 月 22 日,Anthropic 发布 Claude Opus 5.5,作为 Claude 5.5 系列的首款模型。官方将它定位为面向复杂编码、知识工作与长时间运行智能体的主力选择,并称其在多数工作上达到 Claude Fable 5.1 的水平。更值得拆开看的,是单价下降与每项任务用量减少共同影响了总成本。
价格:单价降 20%,典型任务成本约降 40%
Claude API 的标准价格以每 100 万 token 计:Opus 5.5 输入 4 美元、输出 20 美元;上一代 Opus 5 分别为 5 美元、25 美元,输入和输出单价均下降 20%。缓存读取从 0.50 美元降至 0.20 美元,降幅为 60%;缓存写入则由 6.25 美元降至 5 美元。
Anthropic 所称“典型工作负载运行成本降低约 40%”,是结合更低单价和完成任务所需 token 减少得出的官方估计,不是每百万 token 单价都降了 40%。具体账单仍随输出长度、缓存命中、推理档位和工具调用变化。需要更快响应时,Fast mode 标价为每百万输入/输出 token 8/40 美元,官方称速度最高可达默认模式的约 2.5 倍。查看 Anthropic 官方价格与说明。
能力进展:长任务、编码和知识工作
发布材料把长时间的软件改造、复杂调试、跨工具工作流和专业文档作为重点。官方测试中,Opus 5.5 在 Terminal-Bench 4.0 得分 66.4%,Opus 5 为 52.3%;在 FrontierCode v1.1 主集分别为 54.4% 和 48.0%。知识工作评测 GDPval-AA v2.1 的 Elo 分数则为 1846 与 1708。Anthropic 还称新模型输出生成速度比 Opus 5 快逾 30%。这些结果反映特定测试设置,不代表任一真实项目都能等比例提速或省钱。
对使用者而言,更有价值的观察点是它能否在长任务里保持目标、核对中间结果,并减少来回修改。可挑选已有明确验收标准的代码修复或资料分析任务,对比完成率、人工修改时间和总账单。厂商演示和早期客户案例可提供线索,但不等于独立、普适的结论。查看官方评测与测试条件。
安全机制与适用边界
Anthropic 表示,Opus 5.5 在其近 2000 个模拟场景的自动行为审计中表现改善。在一项测试模型是否试图跨越隔离边界的新增评测里,尝试次数较 Opus 5 或 Mythos 5.1 约少 85%;这是特定评测指标,不能解读为现实风险整体下降 85%。官方也承认,模型可能意识到自己处于评测中,现有评估无法涵盖所有部署场景。
部署方面,Opus 5.5 在网络安全、生物和模型蒸馏相关请求上采用更严格的防护,部分请求会透明地转给其他模型。常规代码找错和修复仍可进行,但涉及更敏感领域的研究可能需要验证计划或受到路由限制。对企业智能体,权限边界、审核节点和日志仍然重要。查看安全与防护说明。
开放范围与使用建议
Opus 5.5 已在 Claude 的 Pro、Max、Team、Enterprise 方案开放;开发者可通过 Claude API 使用 claude-opus-5-5,官方也列出 AWS、Google Cloud 和 Microsoft Azure 等渠道。Anthropic 预告 Sonnet 5.5 与 Haiku 5.5 将随后推出。选型时,可以把 Opus 5.5 用于结果质量和长任务稳定性更重要的工作,再用更便宜的模型处理批量、易复核的环节。
本文依据 Anthropic 发布说明 与 Claude Opus 产品页 整理。配图为 AI 生成的原创示意插画,非 Anthropic 官方产品图。评测及成本估计主要来自发布方,本站尚未进行独立实测;最新价格与开放范围请以官方页面为准。
来都来了,留个言吧。
你的留言会在博主审核后显示。邮箱选填,仅博主可见。
留一段话
还没有公开留言。