• 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

Grok 4.7 终于上线,但 Claude 仍在大多数基准测试中占据优势

2026-09-22 03:06:06
收藏

SpaceX AI 发布 Grok 4.7:定价亲民,但在多项基准测试中仍落后于 Claude Fable 5.1

周一,SpaceX AI 正式发布了其最新大语言模型 Grok 4.7。该模型的输入代币价格为每百万个代币 2 美元。尽管 SpaceX AI 自身的基准测试数据显示,Anthropic 的 Claude Fable 5.1 在大多数测试项目中依然占据领先地位。

核心要点

  • SpaceX AI 以与 Grok 4.6 相同的价格推出了 Grok 4.7,其中输出代币的价格为每百万个 6 美元。
  • 在公司进行的对比中,Claude Fable 5.1 在 GDPval、CursorBench 和 Terminal-Bench 等评测中保持领先。
  • Grok 4.7 经历了多次推迟后终于上线,并在电气工程和法律工作领域取得了胜利。

Grok 4.7 的推出详情

该公司于周一宣布了这一模型,称其为目前最强大的编码和知识工作模型。目前,Grok 4.7 已在 Cursor、Grok Build、Grok API 以及第三方代码工具包中上线使用。此外,还有一个速度更快的变体版本,其价格翻倍。输出代币价格维持在每百万个 6 美元,这与一个多月前发布的 Grok 4.6 保持一致。

SpaceX AI 表示,Grok 4.7 基于一个更大规模的基础模型运行,该模型经过更长时间的强化学习训练,重点解决需要数小时才能完成的复杂问题,并配备了重新构建的安全防护栈。马斯克此前曾声称,该模型拥有 2.1 万亿个参数,高于之前的 1.5 万亿,并且利用了 SpaceX 的工程数据进行补充训练,但这一细节并未在官方发布帖文中提及。

Claude Fable 5.1 的优势

在评估律师、护士和金融分析师工作的 GDPval 基准测试中,Grok 4.7 的 Elo 评级为 1,695,而 Claude Fable 5.1 则为 1,735。在多小时办公任务测试 AA Briefcase 中,Grok 4.7 再次落后。在 Terminal-Bench 测试中,两者的差距扩大了近 20 分。

不过,新模型在某些领域也取得了突破,在电气工程测试中以 64% 对 56.4% 的成绩击败了 Fable 5.1,并在 Harvey 的法律代理基准测试中将对手的成绩提高了三倍。Grok 4.7 在公司发布的每一项测试中均优于 Grok 4.6,其在终端工作方面的得分几乎翻了一番。

值得注意的是,上述所有数据均来自 SpaceX AI 自身。CursorBench 是由 Cursor(SpaceX 上个月完成收购的代码编辑器)开发的编码测试,在该测试中,Grok 4.7 以 51.8% 对 46.3% 的成绩落败。Grok 4.7 唯一具备明显优势的是价格,其输入代币费用仅为 Fable 5.1 的五分之一。

马斯克的延期风波

此次发布结束了一个充满错失目标的夏季。马斯克在 7 月底曾表示该模型将在四周内推出,但随后反复推迟发布日期。9 月 1 日,他将时间窗口缩小至 10 天;而在 9 月 11 日,他承认模型还需要几天的训练时间。

在发货前几天,他再次降低了预期,将 Grok 4.7 的性能对标为 Claude Opus 5.0,而非更新的 Opus 5.1,且多模态功能尚未完善。此后,马斯克称 Grok 4.8 将是显著的升级,并暗示 Grok 5 可能会引领整个行业,但目前这两个模型均未公布具体的发布日期。

免责声明:

本网站、超链接、相关应用程序、论坛、博客等媒体账户以及其他平台和用户发布的所有内容均来源于第三方平台及平台用户。百亿财经对于网站及其内容不作任何类型的保证,网站所有区块链相关数据以及其他内容资料仅供用户学习及研究之用,不构成任何投资、法律等其他领域的建议和依据。百亿财经用户以及其他第三方平台在本网站发布的任何内容均由其个人负责,与百亿财经无关。百亿财经不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。强烈建议您独自对内容进行研究、审查、分析和验证。

展开阅读全文
更多新闻
自选
我的自选
查看全部
市值 价格 24h%