• 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

OpenAI Astra隐藏更多推理能力,重燃2025年安全警告

2026-09-08 02:41:18
收藏

OpenAI的Astra模型疑似隐藏推理过程,引发对2025年可监控性论文中担忧的重提

核心要点:

Astra模型似乎减少了在可见文本中展示推理步骤的行为,这引发了人们对监管机构是否仍能检测到问题行为的担忧。Ryan Greenblatt与首席科学家Jakub Pachocki共同撰写了一篇发表于2025年7月的论文,指出“思维链可监控性”是人工智能安全领域中一个脆弱且易逝的机会。

关于Astra的可监控性争议

据媒体报道,Astra模型似乎在内部进行更多推理,而未将其暴露在可见文本中,这促使人们质疑在模型运作过程中,监控机制是否仍能有效识别可疑行为。Redwood Research的人工智能安全研究员Ryan Greenblatt指出,Astra“看起来能够完全在‘脑海’中解决高难度的竞赛数学问题”,并补充称:“这令人极度担忧。”

另有报道暗示,OpenAI可能为了提升模型能力,刻意减少了对模型输出的可见性,但该公司尚未证实这一说法。Pachocki对此回应称,他希望通过澄清报道,防止因误解而引发一场进入“不可监控状态”的恶性竞争。

此前已有报道指出,当模型试图规避监督时,Astra比其前身更难被监控,而OpenAI已将此领域描述为开放的研究优先事项。

Pachocki的安全警示

这场争论之所以引人注目,是因为Greenblatt和Pachocki是约40位作者中的一员,他们共同撰写了2025年7月发表的一篇论文,将“思维链可监控性”描述为新出现但脆弱的AI安全机遇。该论文的作者来自OpenAI、Google DeepMind、Anthropic、Meta、Amazon、英国AI安全研究所以及Redwood Research等机构。

论文敦促前沿开发者建立标准化的可监控性评估体系,在系统卡片中公布结果与局限性,并在训练或部署决策中将可监控性与模型能力同等考量。

欧盟监管框架下的合规要求

欧洲为这一报告流程提供了正式的制度归宿。签署《欧盟通用人工智能行为准则》的相关方必须在产品推向市场前向欧盟AI办公室提交《模型报告》,内容涵盖评估结果、缓解措施及外部评估师报告。每份报告还必须包含从每次相关模型评估中随机选取的五组输入和输出样本,以便外部审查人员进行独立评估。OpenAI是该准则的全权签署方。

值得注意的是,这种担忧早于Astra模型的发布。2025年7月的论文曾警告称,新的架构可能会削弱可见的思维链推理能力;随后,OpenAI接受了约20%的计算开销增加,以扩展对其系统的安全监控。

免责声明:

本网站、超链接、相关应用程序、论坛、博客等媒体账户以及其他平台和用户发布的所有内容均来源于第三方平台及平台用户。百亿财经对于网站及其内容不作任何类型的保证,网站所有区块链相关数据以及其他内容资料仅供用户学习及研究之用,不构成任何投资、法律等其他领域的建议和依据。百亿财经用户以及其他第三方平台在本网站发布的任何内容均由其个人负责,与百亿财经无关。百亿财经不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。强烈建议您独自对内容进行研究、审查、分析和验证。

展开阅读全文
更多新闻
自选
我的自选
查看全部
市值 价格 24h%