独立测试者对Anthropic新模型Claude Opus 5给出评分
独立测试者将Anthropic新发布的Claude Opus 5在能力指数上评为159分,仅比Claude Fable 5低2分,但在代码审查记录方面存在明显分歧。
关键要点
Epoch AI将Claude Opus 5的能力指数评为159分,而Claude Fable 5为161分,两者在软件工程领域持平。CodeRabbit记录的可操作审查评论精确率为39.3%,高于35.2%的基准线,但琐碎评论数量增加了四倍。来自Cognition和Zapier的企业测试者报告称,该模型在调试和端到端业务自动化方面取得了进展。
Claude Opus 5基准测试面临早期审视
Anthropic于上周五发布了该模型,并表示其智能水平接近Fable 5,但价格仅为后者的一半,定位为日常工具而非专业模型。外部评分者大多认同这一评价,但在边际上存在分歧。Epoch AI将Opus 5的能力指数评为159分,而Fable 5为161分,并在软件工程领域将两者评为持平。Artificial Analysis将该模型排在其智能知识工作基准测试的首位,比Fable 5高出近150个Elo分,同时将每项任务成本降低了20%。部分开发者对能力指数提出了异议,他们认为相比旧版Opus 4.8仅提升一个百分点,这严重低估了他们在日常使用中的实际体验。一位评估者发现,在编码测试中,中等努力设置反而优于更高设置。
代码审查结论引发测试者分歧
CodeRabbit对Opus 5进行了测试,使用了约100个来自真实开源拉取请求的错误模式,每种配置运行三次,测量出可操作评论的精确率为39.3%。这超过了其生产审查器设定的35.2%基准线,但该模型捕获的已知错误更少,且产生的琐碎评论数量增加了四倍——这些低价值注释需要工程师手动分类。在默认努力设置下,精确率降至26.4%。该公司得出结论,团队应将Opus 5视为第二个注重精确度的审查器,而非直接升级现有运行良好的流水线。Claire Vo负责为产品团队进行七模型评估,她称该模型“出色但令人恼火”,并指出其存在神经质倾向,以及坚决拒绝处理合并冲突的问题。
Anthropic客户报告智能体能力提升
Cognition首席执行官Scott Wu表示,Opus 5在Devin内以一半的成本实现了接近Fable级别的性能,尤其在调试和根本原因分析方面表现出色。Zapier负责人Wade Foster称,该模型在公司的自动化排行榜上名列前茅,且消耗的令牌数并未超过此前定价相同的Claude版本(每百万输入令牌5美元)。这些赞誉也存在局限性。Anthropic指出,Opus 5在网络安全攻击工作方面落后于其Mythos 5模型,且被公司安全分类器标记的请求会自动回退至Opus 4.8。这一谨慎态度源于顶级模型近期的波折——Fable 5于六月发布,仅数日后便暂停服务,直至七月初才重新向用户开放。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注