Anthropic 发布 Claude Sonnet 5.5:性能飞跃与成本优势并存
周一,Anthropic 正式发布了 Claude Sonnet 5.5,这是对今年6月推出的 Sonnet 5 的一次重大升级。Anthropic 表示,这款中级模型的速度比其前代产品快了 30% 以上。
“Sonnet 5.5 在日常范围明确的任务、修复代码漏洞以及制作精美的文档、演示文稿和电子表格方面表现最为出色。它还具备敏锐的设计眼光。” Anthropic 在官方声明中写道。
价格策略与综合性价比
Sonnet 5.5 的定价保持不变:输入令牌(input tokens)每百万个 2 美元,输出令牌每百万个 10 美元。令牌是 AI 读取和写入的文本片段,长度略短于一个单词,企业通常按百万为单位计费。这一价格是 Opus 5.5 的一半。然而,由于 Sonnet 5.5 在完成每项任务时消耗的令牌量减少了近三分之一,因此其实际运行成本低于 Sonnet 5。
编程能力卓越
该模型在编程领域表现尤为突出。在 Terminal-Bench 4.0 测试中——该测试旨在评估 AI 代理能否通过自行键入命令来完成复杂的职业任务,得分以完成任务的比例计算——Sonnet 5.5 取得了 70.6% 的成绩。相比之下,Opus 5.5 得分为 66.4%,而上一代的 Sonnet 5 仅为 10.3%。
简而言之,这款更便宜的模型完成了更多的工作。独立测试机构 Artificial Analysis 进行了自己的测试并证实了这一点:Sonnet 5.5 得分为 63.6%,Opus 5.5 为 59.6%,而 OpenAI 的 GPT-6 Astra 为 59.1%。
不同设置下的表现对比
评分还取决于“努力程度”(effort setting),这是一个调节器,允许模型花费更多时间思考以获得更好的答案,但也会导致费用增加。Anthropic 表示,在高努力模式下,Sonnet 5.5 在 FrontierCode 基准测试中的表现与 GPT-6 Sol 相当,但每项任务的成本仅为后者的五分之一。
在 GDPval-AA 基准测试中——该测试使用类似国际象棋 Elo 等级的系统,对跨 44 个职业的现实世界专业工作进行评级——Sonnet 5.5 得分为 1844,Opus 5.5 得分为 1846,两者几乎持平。而 GPT-6 Sol 的得分为 1487。
市场竞争格局
竞争对手也在匹配价格。上周,OpenAI 将 GPT-6 Sol 的价格降至 2 美元和 10 美元,其中级模型 GPT-5.6 Terra 的标价分别为 2 美元和 12 美元。Anthropic 未公布针对 Terra 模型的基准测试结果。
生成内容与成本分析
Sonnet 5.5 是一个“话痨”模型。在最大努力模式下,它每个测试任务生成了约 193,000 个令牌,这是 Artificial Analysis 测得的最高值,比 Opus 5.5 高出约 60%。这导致每项任务的成本达到 7.60 美元,比 Sonnet 5 高出约 50%,这与 Anthropic 声称的可节省高达 30% 成本的论点相矛盾。
Anthropic 的成本节约主要体现在较低的设置上:在其应用程序中默认的中等努力模式下,该公司表示 Sonnet 5.5 能以不到十分之一的成本超越 Sonnet 5 的最佳编程成绩。Artificial Analysis 认为高努力模式具有最高的性价比。对于日常用户而言,只要保持低设置,就能以极低的成本获得接近旗舰级的编程体验。
数据来源说明与未来展望
Anthropic 的数据表为自我报告数据,而 Artificial Analysis 测试的是一个预发布版本,其中存在一个 Bug,Anthropic 预计该 Bug 对结果影响很小或略微低估了其分数。Anthropic 指出,在处理需要持续判断力的复杂工作时,Opus 5.5 仍然明显更强。
此外,专为高容量、对成本敏感的应用程序设计的 Claude Haiku 5.5 将在未来几周内推出。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注