Anthropic 在 2026 年 7 月 24 日发布了 Claude Opus 5。这个版本最值得看的地方,不是又多了几个“榜单第一”,而是 Anthropic 试图做一件更实际的事:保留 Opus 4.8 的 API 单价,同时把代码 Agent、工具调用和专业工作的能力往 Fable 5 靠近。
乍看之下,这是一次同价升级。可一旦按任务结算,事情就没那么简单了。Opus 5 默认会自行决定要不要思考,回答也往往更长;独立测试里,它的生成速度并不快。Token 单价没涨,不代表一次任务的费用、等待时间也原封不动。
我们核对了 Anthropic 的发布资料和价格页,也对照了 Artificial Analysis、ComputingForGeeks 的测试以及发布后两天的 Hacker News 讨论。厂商成绩、客户证言和独立评价会分开写,因为三者能回答的问题并不相同。文中数据核验于 2026 年 7 月 26 日。
我们的判断:如果工作复杂、失败代价高,Opus 5 很值得进入测试名单;如果只是高频分类、简单改写或短代码补全,它通常太贵也太慢。1M 上下文和 128K 输出很亮眼,但真正决定是否升级的,仍是每个成功任务花多少钱、等多久。
核心结论
claude-opus-5支持 1M 输入和 128K 输出,默认采用 adaptive thinking,可用low到max调整 effort。- 标准 API 仍是输入 5 美元、输出 25 美元 / 百万 Token;Fast mode 约快 2.5 倍,单价也翻倍。
- Opus 5 的 max-effort 配置在 Artificial Analysis 智能指数中暂列第一,但输出速度只有约 52.6 Token/秒,而且明显比同类模型更爱输出。
- 一组只有三项任务的独立 DevOps 测试中,Opus 5 的总费用约为 Opus 4.8 的两倍。样本很小,却足以提醒我们:价格表相同,实际账单未必相同。
Claude Opus 5 是什么?
可以把 Opus 5 理解为 Anthropic 的“日常高难度模型”:能力目标接近 Fable 5,价格则留在 Opus 档。官方用 “thoughtful and proactive” 形容它,翻成实际行为,就是模型不急着交卷,而会检查环境、验证结果,失败后再换一种做法。
这种变化在普通问答里未必明显,在下面这些任务里更容易看出来:
- 在大型代码库中定位问题、修改多个文件、运行测试并继续修复;
- 使用终端、浏览器或业务工具完成多步骤流程;
- 分析合同、金融材料、企业文档和复杂表格;
- 处理需要反复验证的科学研究与数据分析任务;
- 在 1M 长上下文中理解代码、日志、规范、图像和大量文档。
至于很多人搜索的“参数量”,Anthropic 依然没有给答案。总参数、激活参数、MoE 专家数和训练数据规模都未公开。现在能确认的,是上下文、输出上限、模态和推理方式;网上流传的权重规模只能算猜测。
Claude Opus 5 参数与功能一览
| 项目 | Claude Opus 5 信息 | 信息性质 |
|---|---|---|
| 正式模型 ID | claude-opus-5 |
Anthropic 官方发布页 |
| 发布时间 | 2026 年 7 月 24 日 | Anthropic 官方发布记录 |
| 输入模态 | 文本、图片 | Artificial Analysis 规格页交叉核对 |
| 输出模态 | 文本 | Artificial Analysis 规格页交叉核对 |
| 最大输入 | 1,000,000 Token(1M) | Models API 返回值的独立复核 |
| 最大输出 | 128,000 Token(128K) | Models API 返回值的独立复核 |
| 默认思考 | Adaptive thinking | Models API 与独立实测复核 |
| Effort | low、medium、high、xhigh、max |
Models API 返回值的独立复核 |
| 参数量 | Anthropic 未公开 | 不采用社区推测 |
| Prompt caching | 支持 | Anthropic 官方产品页 |
| Batch processing | 支持,Token 费用节省 50% | Anthropic 官方产品页 |
| Fast mode | 约为默认速度的 2.5 倍,价格为基础价 2 倍 | Anthropic 官方发布页 |
| US-only inference | 支持,输入输出均为标准价格的 1.1 倍 | Anthropic 官方产品页 |
表里最容易被过度解读的是 1M 和 128K。1M 只说明请求装得下这么多内容,不保证埋在一百万 Token 里的每个细节都能被准确找回。长文档仍然要做检索、分块和引用校验;把整个知识库一次性塞进去,通常只是把检索问题藏进了模型里。
128K 也只是单次响应的硬上限。思考 Token 和最终答案共用这份额度,所以生产请求仍要设置合适的 max_tokens。否则一次跑偏的 Agent 任务,可能在你发现之前就写出一份昂贵的“长篇报告”。
迁移旧接口时还有一个容易踩的坑:Opus 5 使用 adaptive thinking,不再接受旧式的 thinking: {"type": "enabled"} 固定预算写法。禁用思考与高 effort 组合也有限制,不能只替换模型名就上线。
Claude Opus 5 价格是多少?
Opus 5 没有借发布之机提高基础单价。标准 API 价格如下:
| 计费项目 | Claude Opus 5 | 说明 |
|---|---|---|
| 输入 Token | $5 / 1M | 与 Opus 4.8 相同 |
| 输出 Token | $25 / 1M | 思考 Token 按输出计费 |
| 5 分钟缓存写入 | $6.25 / 1M | Artificial Analysis 按 Anthropic 费率列示 |
| 缓存命中读取 | $0.50 / 1M | 相比普通输入节省 90% |
| Batch 输入 / 输出 | $2.50 / $12.50 / 1M | 官方称 Batch 节省 50% |
| Fast mode 输入 / 输出 | $10 / $50 / 1M | 约 2.5 倍速度,基础单价 2 倍 |
| US-only 输入 / 输出 | $5.50 / $27.50 / 1M | 标准费率的 1.1 倍 |
以一次输入 100,000 Token、输出 10,000 Token 的标准请求为例,不计工具和重试:
0.10 × $5 + 0.01 × $25 = $0.75
如果 100,000 个输入 Token 全部命中缓存,同样输出下约为:
0.10 × $0.50 + 0.01 × $25 = $0.30
同一个请求如果走 Batch,费用约为 0.375 美元;换成 Fast mode,则会上升到约 1.50 美元。缓存是否命中、是否能异步处理、是否真的需要低延迟,往往比“新模型有没有涨价”更影响账单。
真正该算的是一次任务多少钱
输出 Token 的单价是输入的 5 倍。Opus 5 多思考一次、多调用一次工具,或为了保险写得更完整,都会让“同价”请求变贵。反过来,如果它一次做对、少让工程师返工,贵一点的推理又可能更划算。
所以评测时别只抄价格表。输入、缓存、思考、最终输出、工具调用、重试和人工修正,应该合并成每个成功任务的总成本。这才是能拿来做采购决策的数字。
升级重点不在聊天,而在把任务做完
代码 Agent:会不会自己检查结果
Anthropic 对 Opus 5 的描述里反复出现“验证”和“继续迭代”。对代码 Agent 来说,这比一次生成漂亮代码更重要:测试失败后,它能否读懂报错、回头检查假设,再把问题真正收尾?
代码迁移、跨文件重构和多工具自动化会从这种习惯里受益。不过,主动性也会带来更多步骤和 Token。生产环境仍要限制最大步数、总预算和可写范围,删除、发布、付款等操作必须留给人工确认。
专业工作:质量提高不等于免审核
GDPval-AA、AutomationBench 和 DeepSearchQA 都被放在发布页的显眼位置,说明 Anthropic 想争取的不只是程序员,还包括金融、法律和企业研究团队。
这类工作真正省下来的通常是检索、起草和交叉检查时间,而不是最后那道审核。合同条款、财务数字、医疗或安全结论仍要能追溯来源,也仍要有人负责签字。
科学任务和可视化
Anthropic 还报告了结构生物学、有机化学和生物信息学上的提升,并展示了交互式风洞和细胞可视化。这里的“视觉输出”容易引起误会:它指模型写代码做出可交互页面,并不是标准 API 可以直接生成图片。
Effort 和 Fast mode 怎么选
low 到 max 并不是越高越好。格式转换、常规改写和小修小补,用低 effort 更省;棘手调试、架构决策和长周期 Agent,才值得把档位调高。Fast mode 的选择更直接:用双倍单价换约 2.5 倍推理速度。只有等待时间确实影响工作流时,这笔钱才花得值。
官方成绩很好看,但先看测试是谁做的
Anthropic 给 Opus 5 准备了一组很亮眼的发布数据。下面这些数字适合用来理解它想主攻什么,却不能直接当成第三方认证:测试项目、effort、工具和预算都由厂商选择或引用。
| 厂商披露的评测 | Anthropic 对 Opus 5 的结论 | 需要保留的边界 |
|---|---|---|
| Frontier-Bench v0.1 | 超过其他参测模型;相对 Opus 4.8 成绩超过 2 倍,单任务成本更低 | 结果受 Agent 框架、effort、工具和费用预算影响 |
| CursorBench 3.2 | max effort 距 Fable 5 峰值不足 0.5%,单任务成本约一半 | “接近”只针对该版本与设置 |
| ARC-AGI 3 | 得分约为下一个最佳模型的 3 倍 | 新颖问题评测不等于日常问答或生产通过率 |
| Zapier AutomationBench | 同等任务成本下,通过率约为下一个最佳模型的 1.5 倍 | 工具定义和流程预算会显著影响结果 |
| OSWorld 2.0 | 在任意给定成本下优于其他参测模型;超过 Fable 5 最佳成绩时成本略高于其三分之一 | Computer Use 仍需考虑界面变化与安全审批 |
| 内部有机化学评测 | 比 Opus 4.8 高 10.2 个百分点 | Anthropic 内部测试,数据集未完全外部复现 |
| 内部蛋白质序列评测 | 比 Opus 4.8 高 7.7 个百分点 | 同上 |
| 自动化行为审计 | “整体不一致行为”得分 2.3,为近期模型最低 | 安全评测不代表模型不会犯错或执行危险操作 |
发布页难得也写了一项落后结果:Opus 5 发现网络安全漏洞的能力已经接近受限模型 Mythos 5,但开发利用方法仍明显不如后者。这比又一个“第一名”更有参考价值,因为它划出了模型当前的能力边界。
客户说法值得看,但不能当独立评测
发布页一口气放了 24 条客户和合作伙伴反馈。最具体的是 Box:CTO Ben Kus 称,Opus 5 在公司内部评测中比 Opus 4.8 总体高 8%,其中数据分析提高 11%,尽职调查提高 17%。
其他发布页案例还提到:
- 一家金融建模团队报告,跨 effort 平均准确率提高 9 个百分点,轮次与工具调用减少约三分之一,完成时间减少 60%;
- 一家法律 Agent 团队称,在降低推理等级时仍能保持相近质量,平均生成 Token 比 Opus 4.8 max reasoning 少 26%;
- Kiro 团队认为 Opus 5 更能维持长周期、多步骤编码任务,并更准确地明确功能与修复需求。
这些数字当然比“我们很喜欢它”有用,但它们仍是 Anthropic 从早期客户里挑出来的成功案例。完整数据集、失败样本和成本口径都没有公开。可以把它们当成值得试用的理由,不能当成已经复现的结论。
独立测试给出了另一面
Artificial Analysis:分数第一,速度只排第 121
截至 7 月 26 日,Artificial Analysis 给 Claude Opus 5 (Adaptive Reasoning, Max Effort) 的 Intelligence Index 打了 61 分,在同页 190 个模型中暂列第一。这个成绩很强,但页面往下看,代价也很清楚:输出约 52.6 Token/秒,速度只排第 121;整套测试生成了约 1 亿输出 Token,而同类中位数约为 6,300 万。
该机构完成整套 Intelligence Index 花了约 3,835.51 美元。换句话说,Opus 5 的 max-effort 配置确实站在能力前列,只是它靠的不是“又快又省”。这个第一名也只是 7 月 26 日、这一版测试和这一组模型的快照,后续很可能变化。
三项 DevOps 实测:代码更周全,账单也更高
ComputingForGeeks 在 7 月 25 日让 Opus 5 和 Opus 4.8 用相同默认设置完成三项工作:编写 OpenTofu VPC 模块、修复一个埋了 6 个错误的 Kubernetes Deployment,以及编写 Bash 日志轮转脚本。输出交给 tofu validate、tflint、kubeconform 和 shellcheck,不是靠作者主观打分。
| 任务 | Opus 5 结果 | Opus 4.8 对照 | Opus 5 / 4.8 费用 |
|---|---|---|---|
| OpenTofu 模块 | tofu validate 与 tflint 均通过,301 行 |
可验证但有 2 条严格 CI 警告,194 行 | $0.078 / $0.048 |
| Kubernetes 修复 | 修复全部 6 个错误,但违反“不要 Markdown 围栏”的格式要求 | 修复全部 6 个错误并直接返回原始 YAML | $0.010 / $0.007 |
| Bash 脚本 | shellcheck 零问题,150 行,保护措施更多 |
shellcheck 零问题,42 行,更简洁 |
$0.052 / $0.014 |
三项合计,Opus 5 花了约 0.14 美元,Opus 4.8 约 0.07 美元。新版写出的基础设施代码更周全,也更慢、更长;在 Kubernetes 任务中,它甚至没遵守“不要 Markdown 围栏”的明确要求。
三个任务当然不足以给模型定性,但这个测试抓住了价格页看不出来的差别:同样的 Token 单价,Opus 5 可能因为思考更多、写得更多,让一次任务的费用翻倍。
开发者认可什么,又在抱怨什么?
截至核验时,Hacker News 的发布讨论有约 1,747 分,Algolia API 能读到 1,266 条评论。这里没有严谨的满意度统计,不过能看到开发者最先碰到的问题。
正面反馈集中在难题上。一位评论者称,Sonnet 5 和 Opus 4.8 折腾数小时没解决的 Linux 内核问题,Opus 5 在半小时内完成了定位和修复;另一位试用数小时后,觉得它的编码甚至略好于 Fable 5。这些都是个人经历,无法复现,却解释了为什么有人愿意忍受更高费用。
抱怨则相当一致:慢。有用户说它比本来就不快的 Opus 4.8 还慢,也有人用了大半天后发现,连普通重构都要等很久。这一点和 Artificial Analysis 的速度数据对得上。
至于值不值,社区没有共识。比较务实的用法是让 Opus 处理真正棘手的规划和实现,把日常执行交给 Sonnet 或更便宜的模型。这样既能用到它的上限,也不至于让所有请求都承担 Opus 的价格和延迟。
什么工作适合交给 Opus 5?
值得优先试
- 长周期代码 Agent:跨文件重构、复杂调试、迁移与测试修复;
- 高价值专业工作:合同、财务、企业内容和研究材料的分析与起草;
- 多工具自动化:需要规划、调用工具、检查结果并继续迭代的业务流程;
- 大型代码库和文档:确实需要 1M 上下文,并能结合检索和验证;
- 质量优先的离线任务:可以接受较长等待,或使用 Batch 降低费用;
- 高价值实时任务:质量要求高且延迟敏感,可评估 Fast mode 是否值得双倍单价。
这些任务先别急着换
- 简单分类、抽取、改写、客服问答等高并发低价值请求;
- 严格要求低延迟、但不需要前沿推理能力的交互功能;
- 输出很长却没有明确验收标准的 Agent;
- 将生成的 YAML、脚本、SQL 或基础设施配置直接执行且没有校验;
- 法律、医疗、金融或生产变更没有人工复核;
- 仅因为 1M 上下文就把未筛选的全部资料塞进一次请求。
从 Opus 4.8 迁移时要注意什么?
迁移不难,但绝不是只换一个模型名。上线前至少检查下面八项:
- 将模型 ID 改为
claude-opus-5; - 删除旧式
thinking: {"type": "enabled"}固定预算写法,按当前接口使用 adaptive thinking; - 重新评估
max_tokens,因为思考 Token 与可见答案共同占用输出上限; - 分别测试
low、medium、high、xhigh与max,把每个 effort 当成独立配置; - 记录
usage.output_tokens_details.thinking_tokens,观察推理开销; - 保留 JSON Schema、语法校验、测试、Markdown 围栏清理和危险操作审批;
- 用单位成功任务成本比较,而不是只比较输入输出单价;
- 如果默认延迟不可接受,再用真实流量评估 Fast mode,不要把“2.5 倍速度”直接当作你的端到端加速比例。
Anthropic 同期还放出了两项 beta:对话中途可以更换工具而不让 prompt cache 失效;安全分类触发时,API 也可以自动回退到其他模型。对长对话 Agent 来说都很实用,不过上线前仍要确认账户是否开放,以及回退后到底用了哪个模型、如何计费。
通过 UnifyLLM 调用 Claude Opus 5
如果模型已对你的 UnifyLLM 账户开放,可以通过统一的 OpenAI-compatible 接口先做基础调用:
curl https://api.unifyllm.top/v1/chat/completions \
-H "Authorization: Bearer <YOUR_UNIFYLLM_API_KEY>" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-opus-5",
"messages": [
{
"role": "user",
"content": "审查这段变更计划,找出高风险依赖,并给出可验证的回滚步骤。"
}
],
"max_tokens": 4096
}'
示例不预设 thinking 字段,因为不同兼容协议、SDK 和上游渠道的参数映射可能不同。要使用 effort、缓存或工具等高级能力,请同时核对 UnifyLLM API 参考 和 Anthropic 当前文档。模型是否对账户开放、分组倍率和实际费用,则以 模型价格页 与控制台为准。
测试时最好拿现有业务样本做盲测,不要临时编几道“看起来很难”的题。一次通过率、严重错误、格式合规、首 Token 延迟、总耗时、思考 Token、工具调用和实际费用,都是上线后会影响体验或账单的指标。首次接入可以从 快速开始 和 工具集成指南 开始。
到底该不该从 Opus 4.8 升级?
如果一次失败会让工程师返工半天,或者任务需要模型在复杂环境里持续检查、修正并收尾,升级很可能值得。此时该比较的是省下多少人工,而不是每百万 Token 贵不贵。
如果任务规则清楚、可以自动验收、每天调用量又很大,就没有必要把所有流量都交给 Opus。让 Sonnet 或轻量模型处理普通请求,再把失败、低置信度和高价值任务升级到 Opus 5,通常更现实。异步任务用 Batch,重复的大上下文用 prompt caching;Fast mode 留给那些“等一分钟真的会影响业务”的场景。
我们不建议一键替换 Opus 4.8。先挑一组真实任务跑 A/B 测试,再按难度做路由,远比在发布当天根据榜单决定全量迁移可靠。
总结
Opus 5 是一次有分量的升级:Token 单价没变,难任务的上限更高,Agent 也更愿意把工作做完。问题在于,它会思考、会验证,也会因此花更多时间、写更多 Token。
这款模型最适合“做错一次很贵”的任务,而不是“每个请求都要最强模型”的想象。先用自己的任务测出成功率、等待时间和完整账单,再决定哪些流量值得交给它。对 Opus 5 来说,这比任何发布榜单都更重要。
常见问题
Claude Opus 5 已经正式发布了吗?
是。Anthropic 官方发布记录显示,Claude Opus 5 于 2026 年 7 月 24 日发布,并可通过 Claude API 使用,正式模型 ID 为 claude-opus-5。不同云平台、地区和账户的开放时间可能不同。
Claude Opus 5 的 API 价格是多少?
标准价格为输入 5 美元、输出 25 美元 / 百万 Token,与 Opus 4.8 相同。Prompt cache 命中输入可节省 90%,Batch 可节省 50%;Fast mode 单价为标准模式 2 倍,US-only 推理为 1.1 倍。
Claude Opus 5 的上下文和输出上限是多少?
输入上下文为 1,000,000 Token,单次输出上限为 128,000 Token。1M 容量不代表一百万 Token 内的每个细节都能无损召回,生产系统仍应结合检索、分块、引用与验证。
Claude Opus 5 的参数量是多少?
Anthropic 没有公布总参数量、激活参数量或 MoE 结构。公开可核验的是上下文、输出上限、模态、effort、thinking 和价格;不要把社区估算写成官方参数。
Adaptive thinking 会额外收费吗?
思考 Token 按输出 Token 计费,并会占用输出预算。它可能提高复杂任务成功率,也可能增加费用和等待时间,因此需要结合 thinking_tokens、最终通过率和总耗时评估。
Claude Opus 5 比 Opus 4.8 更便宜吗?
两者标准 Token 单价相同,但任务成本不一定相同。一个三任务独立小样本中,Opus 5 因思考和更长输出,合计费用约为 Opus 4.8 的两倍;在减少失败和返工的任务上,Opus 5 的单位成功任务成本也可能更低。
Claude Opus 5 是否比 Fable 5 更强?
有些任务上是,有些不是。Anthropic 的定位是用约一半价格接近 Fable 5;Opus 5 在部分代码、自动化和成本—性能测试中更占优势,网络安全等领域则仍有差距。两者要在相同 effort、工具和预算下比较,否则结论没有意义。
参考资料
- Anthropic:Introducing Claude Opus 5
- Anthropic:Claude Opus 产品页
- Anthropic Docs:Models overview
- Anthropic Docs:What’s new in Claude Opus 5
- Anthropic Docs:Pricing
- Artificial Analysis:Claude Opus 5 Performance & Price Analysis
- ComputingForGeeks:Claude Opus 5 Released — Benchmarks, Pricing and API Changes
- Hacker News:Claude Opus 5 发布讨论
- Hacker News Algolia API:讨论数据
事实核验日期:2026 年 7 月 26 日。Anthropic 文档站在本次核验环境中因地区限制重定向;发布日、定位、标准价格、Fast mode、缓存、Batch 与 US-only 费率通过 Anthropic 可直接访问的官方发布页和产品页复核,1M / 128K、adaptive thinking 与 effort 能力通过公开展示的实时 Models API 返回值和独立规格页交叉核对。