当前位置:首页>文章>使用指南>Claude发了新模型,但整场发布会没提”最聪明”

Claude发了新模型,但整场发布会没提”最聪明”

文本是《AI咨询(共106篇)》专题的第 106 篇。阅读本文前,建议先阅读前面的文章:

Claude Opus 5发布:AI模型开始比拼“能连续干多久”

过去,AI模型争的是一次回答有多聪明;现在,行业开始争夺另一项更难的能力:能不能在复杂任务里持续工作、反复检查,并真正把事情做完。

2026年7月24日,Anthropic正式发布Claude Opus 5。

如果只看发布节奏,这似乎只是又一次模型更新。但Anthropic这次反复强调的,并不是聊天速度,也不是某一道测试题的得分,而是一个更接近真实工作的关键词:

长时间、多步骤、可持续执行。

这意味着AI模型的竞争,正在从“回答一个问题”,转向“接手一项任务”。


一、Claude Opus 5到底更新了什么?

Claude发了新模型,但整场发布会没提”最聪明”
Anthropic将Opus 5定位为新一代Opus旗舰模型。

官方称,它在编程、知识工作和多步骤智能体任务上相比Opus 4.8有明显提升,并且在不少领域接近更高阶的Claude Fable 5,但价格只有Fable 5的一半。

Opus 5目前已经在Claude各个平台和API中开放,标准价格为:

  • 每百万输入Token 5美元;
  • 每百万输出Token 25美元;
  • 与上一代Opus 4.8保持一致。

Anthropic还提供了Fast mode,速度约为默认模式的2.5倍,但价格也会提高到基础价格的两倍。

从产品定位看,Anthropic没有把Opus 5描述成“所有任务都最强”的模型。

官方给出的选择逻辑更像是:

  • 日常复杂编程、办公和专业知识工作,优先使用Opus 5;
  • 真正连续数天、需要高度自主执行的项目,仍然更适合Fable 5。

所以,“能连续干多久”并不是说Opus 5已经可以无人监管地工作几天,而是说明模型竞争的评价标准正在变化。


二、AI模型为什么开始比拼“持续工作能力”?

早期的大语言模型更像一个知识丰富的聊天对象。

你提出一个问题,它生成一段答案,任务就结束了。

但真实工作通常没有这么简单。

例如,让AI开发一个完整功能,可能包括:

  1. 阅读已有代码;
  2. 理解需求;
  3. 制定修改方案;
  4. 调用工具;
  5. 编写代码;
  6. 运行测试;
  7. 发现错误;
  8. 修改方案;
  9. 再次验证;
  10. 最后整理结果。

只要其中一个步骤出错,前面的推理就可能全部失效。

因此,真正决定AI能否进入企业核心流程的,不只是“第一遍回答得对不对”,而是它能否做到:

  • 在长任务中保持上下文;
  • 发现自己的错误;
  • 根据结果调整计划;
  • 正确使用浏览器、终端和其他工具;
  • 在交付前主动检查成果;
  • 知道什么时候应该停下来询问人类。

这类能力,通常被称为智能体能力,或者长程任务能力。


三、Opus 5最值得关注的变化:开始主动验证自己的工作

Anthropic在官方案例中重点展示了Opus 5的自我验证能力。

在一个测试中,模型需要根据一张机械零件图编写代码,并在FreeCAD中重建三维模型。但模型没有被直接提供查看图像的工具。

Opus 5没有停在“无法完成”,而是自行编写了一套计算机视觉处理流程,从像素中提取几何信息,再重建完整零件。

在另一个软件缺陷任务中,Opus 5不仅修改了表面问题,还继续追查根本原因,并发现了社区已有补丁遗漏的边缘情况。

还有一个案例中,模型为新的交易所开发市场数据接口。由于没有实时数据源供它验证,Opus 5又自行构建测试工具,检查代码是否能正确解析数据。

这些案例反映出一个明显变化:

模型不再只负责“生成结果”,而是开始负责“证明结果能够工作”。

这才是AI从助手走向执行者的关键一步。

不过需要注意,这些案例主要来自Anthropic官方评估和早期合作客户,不能直接等同于所有用户在所有任务中都能获得相同表现。官方披露的部分测试还使用了特定运行环境,并可能在安全分类器拒绝请求时回退到旧模型,因此测试数字仍需要更多独立评测验证。


四、未来模型竞争,不再只是看排行榜

Claude发了新模型,但整场发布会没提”最聪明”

过去发布新模型时,最受关注的通常是数学、代码和知识测试成绩。

但这些分数越来越难完整代表真实使用体验。

一个模型即使单次回答很强,也可能在长任务中出现以下问题:

  • 做到一半忘记最初目标;
  • 调用工具后无法正确读取结果;
  • 错误地认为任务已经完成;
  • 修改一个问题,却制造新的问题;
  • 输出大量内容,却没有真正交付可用成果;
  • 多次运行结果波动很大。

对于企业而言,真正重要的问题是:

这个模型能不能稳定完成工作?

因此,未来的AI评估可能会越来越关注:

  • 一项任务最终是否完成;
  • 完成任务需要多少次人工干预;
  • 总共调用了多少工具;
  • 消耗了多少Token;
  • 花费了多长时间;
  • 不同运行之间是否稳定;
  • 出错后能否自主恢复。

Anthropic公布的合作案例也在强调这些指标。有合作方称,Opus 5在部分金融建模任务中使用更少的交互轮次和工具调用;另有开发平台表示,相比上一代,它在复杂智能体编程任务中的波动更小。

这说明模型厂商正在从“展示最高分”,转向证明“能够持续交付”。


五、长时间运行,不等于完全不需要人类

“长程智能体”很容易让人联想到一个AI独自工作数小时甚至数天,人类只需要等待最终结果。

但现实远没有这么简单。

任务持续时间越长,错误累积的风险通常也越高。

一个早期判断出现偏差,可能导致模型在错误方向上持续调用工具、修改文件或消耗大量Token。模型越主动,它能够造成的影响也越大。

因此,真正可靠的AI智能体,不应该只是“更少询问人类”,还需要具备:

  • 权限边界;
  • 操作日志;
  • 阶段性检查点;
  • 预算限制;
  • 文件版本管理;
  • 高风险操作确认;
  • 失败后的回滚机制。

Anthropic表示,Opus 5在部署前测试中更少出现欺骗性行为,也更不容易被诱导用于不当目的。与此同时,其网络安全防护仍会拦截渗透测试、漏洞利用生成等部分请求,开发者还可以设置在触发安全分类器时自动回退到其他模型。

这说明“能力更强”和“权限更大”不能被混为一谈。

未来企业部署AI时,真正成熟的方式可能不是把所有权限一次性交给模型,而是让模型在可审计、可暂停、可恢复的工作流中运行。


六、Opus 5真正挑战的,不只是GPT

表面上看,Claude Opus 5的竞争对手是OpenAI、Google和其他模型厂商。

但从更长远的角度看,它真正挑战的是传统软件的使用方式。

过去,软件需要人类逐个操作按钮。

未来,用户可能只需要描述目标:

帮我检查这个项目,找到问题,完成修改,运行测试,并给出交付说明。

模型会在后台调用代码工具、浏览器、数据库和企业系统,将一个目标拆解成完整流程。

这时,模型本身不再只是一个聊天窗口,而会逐渐成为软件之间的调度层。

谁能够更稳定地完成长任务,谁就更有机会成为未来数字工作的入口。


七、这对普通用户意味着什么?

Claude发了新模型,但整场发布会没提”最聪明”

对于普通用户来说,Opus 5的发布并不意味着必须立即更换模型。

它更值得关注的意义是:

以后选择AI,不能只问“哪个模型最聪明”,而要问“哪个模型最适合这项任务”。

简单改写、摘要和日常问答,可能不需要调用最昂贵的旗舰模型。

但对于复杂代码修改、长篇研究、数据分析、方案制作和多工具协作,更稳定的长程能力可能显著减少返工。

未来更合理的使用方式,可能是:

  • 简单任务交给速度快、成本低的模型;
  • 复杂任务交给推理和验证能力更强的模型;
  • 高风险操作由人类确认;
  • 重要结论通过多个模型或外部资料交叉验证。

这也解释了为什么AI聚合平台开始具备现实价值。

用户未必需要永远押注某一个模型,而是需要一个统一入口,根据任务在不同模型之间灵活切换。对于类似一步API这样的聚合平台,真正有价值的方向也不只是“模型多”,而是能否帮助用户建立清晰、稳定、成本可控的多模型工作流。


八、AI模型的下一场比赛:不是更会说,而是更能做

Claude Opus 5的发布,代表了一个越来越清晰的行业趋势。

大模型正在经历三次变化:

第一次,是从补全文字变成回答问题;

第二次,是从回答问题变成调用工具;

第三次,则是从调用一次工具,变成持续执行完整任务。

到了第三阶段,模型是否能在一个小时后仍然记得目标,是否会检查自己的结果,是否能在失败后调整方案,可能比一次生成多么惊艳更加重要。

未来真正拉开差距的,不一定是某个模型在排行榜上领先几分。

而是当用户把一项复杂工作交出去之后:

它能不能持续做下去,少犯错误,并最终交付一个真正可用的结果。

这才是“AI能连续干多久”背后,真正值得关注的问题。


结语

Claude Opus 5并没有宣布“人类可以彻底退出工作流程”。

恰恰相反,它让行业开始更认真地思考:

当AI能够持续执行更复杂的任务,人类应该在哪些节点介入?哪些权限可以开放?哪些结果必须复核?如何衡量一次任务真正的成本?

模型竞争已经从“谁回答得更像人”,逐渐走向“谁更像一个可靠的工作伙伴”。

而下一代AI的分水岭,也许不是智商,而是耐力、稳定性和责任边界。

欢迎关注 一步API,我们还会持续分享更多 AI 资讯、AI 工具、实战经验、踩坑记录,助力你高效玩转 AI 开发、避开行业弯路。

Claude发了新模型,但整场发布会没提”最聪明”

想了解更多细节、获取专属支持,可添加客服微信:xuexiv5876 / YibuDev,随时咨询交流

给TA打赏
共{{data.count}}人
人已打赏
使用指南工具配置

GPT-5.4没了,刚调好的提示词又白费了?

2026-7-24 17:11:24

文章

小米 MiMo-V2.5 全面接棒:AI 不再只会聊天,国产大模型开始卷“办事能力”了

2026-7-8 10:56:53

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索