• 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

专家对Claude Opus 5首次独立测试结果意见不一

2026-07-25 18:21:33
收藏

独立测试者对Anthropic新模型Claude Opus 5给出评分

独立测试者将Anthropic新发布的Claude Opus 5在能力指数上评为159分,仅比Claude Fable 5低2分,但在代码审查记录方面存在明显分歧。

关键要点

Epoch AI将Claude Opus 5的能力指数评为159分,而Claude Fable 5为161分,两者在软件工程领域持平。CodeRabbit记录的可操作审查评论精确率为39.3%,高于35.2%的基准线,但琐碎评论数量增加了四倍。来自Cognition和Zapier的企业测试者报告称,该模型在调试和端到端业务自动化方面取得了进展。

Claude Opus 5基准测试面临早期审视

Anthropic于上周五发布了该模型,并表示其智能水平接近Fable 5,但价格仅为后者的一半,定位为日常工具而非专业模型。外部评分者大多认同这一评价,但在边际上存在分歧。Epoch AI将Opus 5的能力指数评为159分,而Fable 5为161分,并在软件工程领域将两者评为持平。Artificial Analysis将该模型排在其智能知识工作基准测试的首位,比Fable 5高出近150个Elo分,同时将每项任务成本降低了20%。部分开发者对能力指数提出了异议,他们认为相比旧版Opus 4.8仅提升一个百分点,这严重低估了他们在日常使用中的实际体验。一位评估者发现,在编码测试中,中等努力设置反而优于更高设置。

代码审查结论引发测试者分歧

CodeRabbit对Opus 5进行了测试,使用了约100个来自真实开源拉取请求的错误模式,每种配置运行三次,测量出可操作评论的精确率为39.3%。这超过了其生产审查器设定的35.2%基准线,但该模型捕获的已知错误更少,且产生的琐碎评论数量增加了四倍——这些低价值注释需要工程师手动分类。在默认努力设置下,精确率降至26.4%。该公司得出结论,团队应将Opus 5视为第二个注重精确度的审查器,而非直接升级现有运行良好的流水线。Claire Vo负责为产品团队进行七模型评估,她称该模型“出色但令人恼火”,并指出其存在神经质倾向,以及坚决拒绝处理合并冲突的问题。

Anthropic客户报告智能体能力提升

Cognition首席执行官Scott Wu表示,Opus 5在Devin内以一半的成本实现了接近Fable级别的性能,尤其在调试和根本原因分析方面表现出色。Zapier负责人Wade Foster称,该模型在公司的自动化排行榜上名列前茅,且消耗的令牌数并未超过此前定价相同的Claude版本(每百万输入令牌5美元)。这些赞誉也存在局限性。Anthropic指出,Opus 5在网络安全攻击工作方面落后于其Mythos 5模型,且被公司安全分类器标记的请求会自动回退至Opus 4.8。这一谨慎态度源于顶级模型近期的波折——Fable 5于六月发布,仅数日后便暂停服务,直至七月初才重新向用户开放。

免责声明:

本网站、超链接、相关应用程序、论坛、博客等媒体账户以及其他平台和用户发布的所有内容均来源于第三方平台及平台用户。百亿财经对于网站及其内容不作任何类型的保证,网站所有区块链相关数据以及其他内容资料仅供用户学习及研究之用,不构成任何投资、法律等其他领域的建议和依据。百亿财经用户以及其他第三方平台在本网站发布的任何内容均由其个人负责,与百亿财经无关。百亿财经不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。强烈建议您独自对内容进行研究、审查、分析和验证。

展开阅读全文
更多新闻
自选
我的自选
查看全部
市值 价格 24h%