SpaceX AI 发布 Grok 4.7:定价亲民,但在多项基准测试中仍落后于 Claude Fable 5.1
周一,SpaceX AI 正式发布了其最新大语言模型 Grok 4.7。该模型的输入代币价格为每百万个代币 2 美元。尽管 SpaceX AI 自身的基准测试数据显示,Anthropic 的 Claude Fable 5.1 在大多数测试项目中依然占据领先地位。
核心要点
- SpaceX AI 以与 Grok 4.6 相同的价格推出了 Grok 4.7,其中输出代币的价格为每百万个 6 美元。
- 在公司进行的对比中,Claude Fable 5.1 在 GDPval、CursorBench 和 Terminal-Bench 等评测中保持领先。
- Grok 4.7 经历了多次推迟后终于上线,并在电气工程和法律工作领域取得了胜利。
Grok 4.7 的推出详情
该公司于周一宣布了这一模型,称其为目前最强大的编码和知识工作模型。目前,Grok 4.7 已在 Cursor、Grok Build、Grok API 以及第三方代码工具包中上线使用。此外,还有一个速度更快的变体版本,其价格翻倍。输出代币价格维持在每百万个 6 美元,这与一个多月前发布的 Grok 4.6 保持一致。
SpaceX AI 表示,Grok 4.7 基于一个更大规模的基础模型运行,该模型经过更长时间的强化学习训练,重点解决需要数小时才能完成的复杂问题,并配备了重新构建的安全防护栈。马斯克此前曾声称,该模型拥有 2.1 万亿个参数,高于之前的 1.5 万亿,并且利用了 SpaceX 的工程数据进行补充训练,但这一细节并未在官方发布帖文中提及。
Claude Fable 5.1 的优势
在评估律师、护士和金融分析师工作的 GDPval 基准测试中,Grok 4.7 的 Elo 评级为 1,695,而 Claude Fable 5.1 则为 1,735。在多小时办公任务测试 AA Briefcase 中,Grok 4.7 再次落后。在 Terminal-Bench 测试中,两者的差距扩大了近 20 分。
不过,新模型在某些领域也取得了突破,在电气工程测试中以 64% 对 56.4% 的成绩击败了 Fable 5.1,并在 Harvey 的法律代理基准测试中将对手的成绩提高了三倍。Grok 4.7 在公司发布的每一项测试中均优于 Grok 4.6,其在终端工作方面的得分几乎翻了一番。
值得注意的是,上述所有数据均来自 SpaceX AI 自身。CursorBench 是由 Cursor(SpaceX 上个月完成收购的代码编辑器)开发的编码测试,在该测试中,Grok 4.7 以 51.8% 对 46.3% 的成绩落败。Grok 4.7 唯一具备明显优势的是价格,其输入代币费用仅为 Fable 5.1 的五分之一。
马斯克的延期风波
此次发布结束了一个充满错失目标的夏季。马斯克在 7 月底曾表示该模型将在四周内推出,但随后反复推迟发布日期。9 月 1 日,他将时间窗口缩小至 10 天;而在 9 月 11 日,他承认模型还需要几天的训练时间。
在发货前几天,他再次降低了预期,将 Grok 4.7 的性能对标为 Claude Opus 5.0,而非更新的 Opus 5.1,且多模态功能尚未完善。此后,马斯克称 Grok 4.8 将是显著的升级,并暗示 Grok 5 可能会引领整个行业,但目前这两个模型均未公布具体的发布日期。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注