Anthropic 在 2026 年 7 月 24 日发布了 Claude Opus 5。这个版本最值得看的地方,不是又多了几个“榜单第一”,而是 Anthropic 试图做一件更实际的事:保留 Opus 4.8 的 API 单价,同时把代码 Agent、工具调用和专业工作的能力往 Fable 5 靠近。

乍看之下,这是一次同价升级。可一旦按任务结算,事情就没那么简单了。Opus 5 默认会自行决定要不要思考,回答也往往更长;独立测试里,它的生成速度并不快。Token 单价没涨,不代表一次任务的费用、等待时间也原封不动。

我们核对了 Anthropic 的发布资料和价格页,也对照了 Artificial Analysis、ComputingForGeeks 的测试以及发布后两天的 Hacker News 讨论。厂商成绩、客户证言和独立评价会分开写,因为三者能回答的问题并不相同。文中数据核验于 2026 年 7 月 26 日

我们的判断:如果工作复杂、失败代价高,Opus 5 很值得进入测试名单;如果只是高频分类、简单改写或短代码补全,它通常太贵也太慢。1M 上下文和 128K 输出很亮眼,但真正决定是否升级的,仍是每个成功任务花多少钱、等多久。

核心结论

  • claude-opus-5 支持 1M 输入和 128K 输出,默认采用 adaptive thinking,可用 lowmax 调整 effort。
  • 标准 API 仍是输入 5 美元、输出 25 美元 / 百万 Token;Fast mode 约快 2.5 倍,单价也翻倍。
  • Opus 5 的 max-effort 配置在 Artificial Analysis 智能指数中暂列第一,但输出速度只有约 52.6 Token/秒,而且明显比同类模型更爱输出。
  • 一组只有三项任务的独立 DevOps 测试中,Opus 5 的总费用约为 Opus 4.8 的两倍。样本很小,却足以提醒我们:价格表相同,实际账单未必相同。

Claude Opus 5 是什么?

可以把 Opus 5 理解为 Anthropic 的“日常高难度模型”:能力目标接近 Fable 5,价格则留在 Opus 档。官方用 “thoughtful and proactive” 形容它,翻成实际行为,就是模型不急着交卷,而会检查环境、验证结果,失败后再换一种做法。

这种变化在普通问答里未必明显,在下面这些任务里更容易看出来:

  • 在大型代码库中定位问题、修改多个文件、运行测试并继续修复;
  • 使用终端、浏览器或业务工具完成多步骤流程;
  • 分析合同、金融材料、企业文档和复杂表格;
  • 处理需要反复验证的科学研究与数据分析任务;
  • 在 1M 长上下文中理解代码、日志、规范、图像和大量文档。

至于很多人搜索的“参数量”,Anthropic 依然没有给答案。总参数、激活参数、MoE 专家数和训练数据规模都未公开。现在能确认的,是上下文、输出上限、模态和推理方式;网上流传的权重规模只能算猜测。

Claude Opus 5 参数与功能一览

项目 Claude Opus 5 信息 信息性质
正式模型 ID claude-opus-5 Anthropic 官方发布页
发布时间 2026 年 7 月 24 日 Anthropic 官方发布记录
输入模态 文本、图片 Artificial Analysis 规格页交叉核对
输出模态 文本 Artificial Analysis 规格页交叉核对
最大输入 1,000,000 Token(1M) Models API 返回值的独立复核
最大输出 128,000 Token(128K) Models API 返回值的独立复核
默认思考 Adaptive thinking Models API 与独立实测复核
Effort lowmediumhighxhighmax Models API 返回值的独立复核
参数量 Anthropic 未公开 不采用社区推测
Prompt caching 支持 Anthropic 官方产品页
Batch processing 支持,Token 费用节省 50% Anthropic 官方产品页
Fast mode 约为默认速度的 2.5 倍,价格为基础价 2 倍 Anthropic 官方发布页
US-only inference 支持,输入输出均为标准价格的 1.1 倍 Anthropic 官方产品页

表里最容易被过度解读的是 1M 和 128K。1M 只说明请求装得下这么多内容,不保证埋在一百万 Token 里的每个细节都能被准确找回。长文档仍然要做检索、分块和引用校验;把整个知识库一次性塞进去,通常只是把检索问题藏进了模型里。

128K 也只是单次响应的硬上限。思考 Token 和最终答案共用这份额度,所以生产请求仍要设置合适的 max_tokens。否则一次跑偏的 Agent 任务,可能在你发现之前就写出一份昂贵的“长篇报告”。

迁移旧接口时还有一个容易踩的坑:Opus 5 使用 adaptive thinking,不再接受旧式的 thinking: {"type": "enabled"} 固定预算写法。禁用思考与高 effort 组合也有限制,不能只替换模型名就上线。

Claude Opus 5 价格是多少?

Opus 5 没有借发布之机提高基础单价。标准 API 价格如下:

计费项目 Claude Opus 5 说明
输入 Token $5 / 1M 与 Opus 4.8 相同
输出 Token $25 / 1M 思考 Token 按输出计费
5 分钟缓存写入 $6.25 / 1M Artificial Analysis 按 Anthropic 费率列示
缓存命中读取 $0.50 / 1M 相比普通输入节省 90%
Batch 输入 / 输出 $2.50 / $12.50 / 1M 官方称 Batch 节省 50%
Fast mode 输入 / 输出 $10 / $50 / 1M 约 2.5 倍速度,基础单价 2 倍
US-only 输入 / 输出 $5.50 / $27.50 / 1M 标准费率的 1.1 倍

以一次输入 100,000 Token、输出 10,000 Token 的标准请求为例,不计工具和重试:

0.10 × $5 + 0.01 × $25 = $0.75

如果 100,000 个输入 Token 全部命中缓存,同样输出下约为:

0.10 × $0.50 + 0.01 × $25 = $0.30

同一个请求如果走 Batch,费用约为 0.375 美元;换成 Fast mode,则会上升到约 1.50 美元。缓存是否命中、是否能异步处理、是否真的需要低延迟,往往比“新模型有没有涨价”更影响账单。

真正该算的是一次任务多少钱

输出 Token 的单价是输入的 5 倍。Opus 5 多思考一次、多调用一次工具,或为了保险写得更完整,都会让“同价”请求变贵。反过来,如果它一次做对、少让工程师返工,贵一点的推理又可能更划算。

所以评测时别只抄价格表。输入、缓存、思考、最终输出、工具调用、重试和人工修正,应该合并成每个成功任务的总成本。这才是能拿来做采购决策的数字。

升级重点不在聊天,而在把任务做完

代码 Agent:会不会自己检查结果

Anthropic 对 Opus 5 的描述里反复出现“验证”和“继续迭代”。对代码 Agent 来说,这比一次生成漂亮代码更重要:测试失败后,它能否读懂报错、回头检查假设,再把问题真正收尾?

代码迁移、跨文件重构和多工具自动化会从这种习惯里受益。不过,主动性也会带来更多步骤和 Token。生产环境仍要限制最大步数、总预算和可写范围,删除、发布、付款等操作必须留给人工确认。

专业工作:质量提高不等于免审核

GDPval-AA、AutomationBench 和 DeepSearchQA 都被放在发布页的显眼位置,说明 Anthropic 想争取的不只是程序员,还包括金融、法律和企业研究团队。

这类工作真正省下来的通常是检索、起草和交叉检查时间,而不是最后那道审核。合同条款、财务数字、医疗或安全结论仍要能追溯来源,也仍要有人负责签字。

科学任务和可视化

Anthropic 还报告了结构生物学、有机化学和生物信息学上的提升,并展示了交互式风洞和细胞可视化。这里的“视觉输出”容易引起误会:它指模型写代码做出可交互页面,并不是标准 API 可以直接生成图片。

Effort 和 Fast mode 怎么选

lowmax 并不是越高越好。格式转换、常规改写和小修小补,用低 effort 更省;棘手调试、架构决策和长周期 Agent,才值得把档位调高。Fast mode 的选择更直接:用双倍单价换约 2.5 倍推理速度。只有等待时间确实影响工作流时,这笔钱才花得值。

官方成绩很好看,但先看测试是谁做的

Anthropic 给 Opus 5 准备了一组很亮眼的发布数据。下面这些数字适合用来理解它想主攻什么,却不能直接当成第三方认证:测试项目、effort、工具和预算都由厂商选择或引用。

厂商披露的评测 Anthropic 对 Opus 5 的结论 需要保留的边界
Frontier-Bench v0.1 超过其他参测模型;相对 Opus 4.8 成绩超过 2 倍,单任务成本更低 结果受 Agent 框架、effort、工具和费用预算影响
CursorBench 3.2 max effort 距 Fable 5 峰值不足 0.5%,单任务成本约一半 “接近”只针对该版本与设置
ARC-AGI 3 得分约为下一个最佳模型的 3 倍 新颖问题评测不等于日常问答或生产通过率
Zapier AutomationBench 同等任务成本下,通过率约为下一个最佳模型的 1.5 倍 工具定义和流程预算会显著影响结果
OSWorld 2.0 在任意给定成本下优于其他参测模型;超过 Fable 5 最佳成绩时成本略高于其三分之一 Computer Use 仍需考虑界面变化与安全审批
内部有机化学评测 比 Opus 4.8 高 10.2 个百分点 Anthropic 内部测试,数据集未完全外部复现
内部蛋白质序列评测 比 Opus 4.8 高 7.7 个百分点 同上
自动化行为审计 “整体不一致行为”得分 2.3,为近期模型最低 安全评测不代表模型不会犯错或执行危险操作

发布页难得也写了一项落后结果:Opus 5 发现网络安全漏洞的能力已经接近受限模型 Mythos 5,但开发利用方法仍明显不如后者。这比又一个“第一名”更有参考价值,因为它划出了模型当前的能力边界。

客户说法值得看,但不能当独立评测

发布页一口气放了 24 条客户和合作伙伴反馈。最具体的是 Box:CTO Ben Kus 称,Opus 5 在公司内部评测中比 Opus 4.8 总体高 8%,其中数据分析提高 11%,尽职调查提高 17%。

其他发布页案例还提到:

  • 一家金融建模团队报告,跨 effort 平均准确率提高 9 个百分点,轮次与工具调用减少约三分之一,完成时间减少 60%;
  • 一家法律 Agent 团队称,在降低推理等级时仍能保持相近质量,平均生成 Token 比 Opus 4.8 max reasoning 少 26%;
  • Kiro 团队认为 Opus 5 更能维持长周期、多步骤编码任务,并更准确地明确功能与修复需求。

这些数字当然比“我们很喜欢它”有用,但它们仍是 Anthropic 从早期客户里挑出来的成功案例。完整数据集、失败样本和成本口径都没有公开。可以把它们当成值得试用的理由,不能当成已经复现的结论。

独立测试给出了另一面

Artificial Analysis:分数第一,速度只排第 121

截至 7 月 26 日,Artificial Analysis 给 Claude Opus 5 (Adaptive Reasoning, Max Effort) 的 Intelligence Index 打了 61 分,在同页 190 个模型中暂列第一。这个成绩很强,但页面往下看,代价也很清楚:输出约 52.6 Token/秒,速度只排第 121;整套测试生成了约 1 亿输出 Token,而同类中位数约为 6,300 万。

该机构完成整套 Intelligence Index 花了约 3,835.51 美元。换句话说,Opus 5 的 max-effort 配置确实站在能力前列,只是它靠的不是“又快又省”。这个第一名也只是 7 月 26 日、这一版测试和这一组模型的快照,后续很可能变化。

三项 DevOps 实测:代码更周全,账单也更高

ComputingForGeeks 在 7 月 25 日让 Opus 5 和 Opus 4.8 用相同默认设置完成三项工作:编写 OpenTofu VPC 模块、修复一个埋了 6 个错误的 Kubernetes Deployment,以及编写 Bash 日志轮转脚本。输出交给 tofu validatetflintkubeconformshellcheck,不是靠作者主观打分。

任务 Opus 5 结果 Opus 4.8 对照 Opus 5 / 4.8 费用
OpenTofu 模块 tofu validatetflint 均通过,301 行 可验证但有 2 条严格 CI 警告,194 行 $0.078 / $0.048
Kubernetes 修复 修复全部 6 个错误,但违反“不要 Markdown 围栏”的格式要求 修复全部 6 个错误并直接返回原始 YAML $0.010 / $0.007
Bash 脚本 shellcheck 零问题,150 行,保护措施更多 shellcheck 零问题,42 行,更简洁 $0.052 / $0.014

三项合计,Opus 5 花了约 0.14 美元,Opus 4.8 约 0.07 美元。新版写出的基础设施代码更周全,也更慢、更长;在 Kubernetes 任务中,它甚至没遵守“不要 Markdown 围栏”的明确要求。

三个任务当然不足以给模型定性,但这个测试抓住了价格页看不出来的差别:同样的 Token 单价,Opus 5 可能因为思考更多、写得更多,让一次任务的费用翻倍。

开发者认可什么,又在抱怨什么?

截至核验时,Hacker News 的发布讨论有约 1,747 分,Algolia API 能读到 1,266 条评论。这里没有严谨的满意度统计,不过能看到开发者最先碰到的问题。

正面反馈集中在难题上。一位评论者称,Sonnet 5 和 Opus 4.8 折腾数小时没解决的 Linux 内核问题,Opus 5 在半小时内完成了定位和修复;另一位试用数小时后,觉得它的编码甚至略好于 Fable 5。这些都是个人经历,无法复现,却解释了为什么有人愿意忍受更高费用。

抱怨则相当一致:慢。有用户说它比本来就不快的 Opus 4.8 还慢,也有人用了大半天后发现,连普通重构都要等很久。这一点和 Artificial Analysis 的速度数据对得上。

至于值不值,社区没有共识。比较务实的用法是让 Opus 处理真正棘手的规划和实现,把日常执行交给 Sonnet 或更便宜的模型。这样既能用到它的上限,也不至于让所有请求都承担 Opus 的价格和延迟。

什么工作适合交给 Opus 5?

值得优先试

  • 长周期代码 Agent:跨文件重构、复杂调试、迁移与测试修复;
  • 高价值专业工作:合同、财务、企业内容和研究材料的分析与起草;
  • 多工具自动化:需要规划、调用工具、检查结果并继续迭代的业务流程;
  • 大型代码库和文档:确实需要 1M 上下文,并能结合检索和验证;
  • 质量优先的离线任务:可以接受较长等待,或使用 Batch 降低费用;
  • 高价值实时任务:质量要求高且延迟敏感,可评估 Fast mode 是否值得双倍单价。

这些任务先别急着换

  • 简单分类、抽取、改写、客服问答等高并发低价值请求;
  • 严格要求低延迟、但不需要前沿推理能力的交互功能;
  • 输出很长却没有明确验收标准的 Agent;
  • 将生成的 YAML、脚本、SQL 或基础设施配置直接执行且没有校验;
  • 法律、医疗、金融或生产变更没有人工复核;
  • 仅因为 1M 上下文就把未筛选的全部资料塞进一次请求。

从 Opus 4.8 迁移时要注意什么?

迁移不难,但绝不是只换一个模型名。上线前至少检查下面八项:

  1. 将模型 ID 改为 claude-opus-5
  2. 删除旧式 thinking: {"type": "enabled"} 固定预算写法,按当前接口使用 adaptive thinking;
  3. 重新评估 max_tokens,因为思考 Token 与可见答案共同占用输出上限;
  4. 分别测试 lowmediumhighxhighmax,把每个 effort 当成独立配置;
  5. 记录 usage.output_tokens_details.thinking_tokens,观察推理开销;
  6. 保留 JSON Schema、语法校验、测试、Markdown 围栏清理和危险操作审批;
  7. 用单位成功任务成本比较,而不是只比较输入输出单价;
  8. 如果默认延迟不可接受,再用真实流量评估 Fast mode,不要把“2.5 倍速度”直接当作你的端到端加速比例。

Anthropic 同期还放出了两项 beta:对话中途可以更换工具而不让 prompt cache 失效;安全分类触发时,API 也可以自动回退到其他模型。对长对话 Agent 来说都很实用,不过上线前仍要确认账户是否开放,以及回退后到底用了哪个模型、如何计费。

通过 UnifyLLM 调用 Claude Opus 5

如果模型已对你的 UnifyLLM 账户开放,可以通过统一的 OpenAI-compatible 接口先做基础调用:

curl https://api.unifyllm.top/v1/chat/completions \
  -H "Authorization: Bearer <YOUR_UNIFYLLM_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "messages": [
      {
        "role": "user",
        "content": "审查这段变更计划,找出高风险依赖,并给出可验证的回滚步骤。"
      }
    ],
    "max_tokens": 4096
  }'

示例不预设 thinking 字段,因为不同兼容协议、SDK 和上游渠道的参数映射可能不同。要使用 effort、缓存或工具等高级能力,请同时核对 UnifyLLM API 参考 和 Anthropic 当前文档。模型是否对账户开放、分组倍率和实际费用,则以 模型价格页 与控制台为准。

测试时最好拿现有业务样本做盲测,不要临时编几道“看起来很难”的题。一次通过率、严重错误、格式合规、首 Token 延迟、总耗时、思考 Token、工具调用和实际费用,都是上线后会影响体验或账单的指标。首次接入可以从 快速开始工具集成指南 开始。

到底该不该从 Opus 4.8 升级?

如果一次失败会让工程师返工半天,或者任务需要模型在复杂环境里持续检查、修正并收尾,升级很可能值得。此时该比较的是省下多少人工,而不是每百万 Token 贵不贵。

如果任务规则清楚、可以自动验收、每天调用量又很大,就没有必要把所有流量都交给 Opus。让 Sonnet 或轻量模型处理普通请求,再把失败、低置信度和高价值任务升级到 Opus 5,通常更现实。异步任务用 Batch,重复的大上下文用 prompt caching;Fast mode 留给那些“等一分钟真的会影响业务”的场景。

我们不建议一键替换 Opus 4.8。先挑一组真实任务跑 A/B 测试,再按难度做路由,远比在发布当天根据榜单决定全量迁移可靠。

总结

Opus 5 是一次有分量的升级:Token 单价没变,难任务的上限更高,Agent 也更愿意把工作做完。问题在于,它会思考、会验证,也会因此花更多时间、写更多 Token。

这款模型最适合“做错一次很贵”的任务,而不是“每个请求都要最强模型”的想象。先用自己的任务测出成功率、等待时间和完整账单,再决定哪些流量值得交给它。对 Opus 5 来说,这比任何发布榜单都更重要。

常见问题

Claude Opus 5 已经正式发布了吗?

是。Anthropic 官方发布记录显示,Claude Opus 5 于 2026 年 7 月 24 日发布,并可通过 Claude API 使用,正式模型 ID 为 claude-opus-5。不同云平台、地区和账户的开放时间可能不同。

Claude Opus 5 的 API 价格是多少?

标准价格为输入 5 美元、输出 25 美元 / 百万 Token,与 Opus 4.8 相同。Prompt cache 命中输入可节省 90%,Batch 可节省 50%;Fast mode 单价为标准模式 2 倍,US-only 推理为 1.1 倍。

Claude Opus 5 的上下文和输出上限是多少?

输入上下文为 1,000,000 Token,单次输出上限为 128,000 Token。1M 容量不代表一百万 Token 内的每个细节都能无损召回,生产系统仍应结合检索、分块、引用与验证。

Claude Opus 5 的参数量是多少?

Anthropic 没有公布总参数量、激活参数量或 MoE 结构。公开可核验的是上下文、输出上限、模态、effort、thinking 和价格;不要把社区估算写成官方参数。

Adaptive thinking 会额外收费吗?

思考 Token 按输出 Token 计费,并会占用输出预算。它可能提高复杂任务成功率,也可能增加费用和等待时间,因此需要结合 thinking_tokens、最终通过率和总耗时评估。

Claude Opus 5 比 Opus 4.8 更便宜吗?

两者标准 Token 单价相同,但任务成本不一定相同。一个三任务独立小样本中,Opus 5 因思考和更长输出,合计费用约为 Opus 4.8 的两倍;在减少失败和返工的任务上,Opus 5 的单位成功任务成本也可能更低。

Claude Opus 5 是否比 Fable 5 更强?

有些任务上是,有些不是。Anthropic 的定位是用约一半价格接近 Fable 5;Opus 5 在部分代码、自动化和成本—性能测试中更占优势,网络安全等领域则仍有差距。两者要在相同 effort、工具和预算下比较,否则结论没有意义。

参考资料

事实核验日期:2026 年 7 月 26 日。Anthropic 文档站在本次核验环境中因地区限制重定向;发布日、定位、标准价格、Fast mode、缓存、Batch 与 US-only 费率通过 Anthropic 可直接访问的官方发布页和产品页复核,1M / 128K、adaptive thinking 与 effort 能力通过公开展示的实时 Models API 返回值和独立规格页交叉核对。