乔治华盛顿大学研究人员提出AI对话模型“恶化”临界点公式
乔治华盛顿大学的物理学家们发表了一项新公式,用于估算人工智能聊天机器人在给出错误回答之前,能连续提供多少个正确回答。早期测试表明,该公式具有一定的有效性。
这项由尼尔·约翰逊(Neil Johnson)和胡颖杰(Frank Yingjie Huo)共同完成的研究发表在《Patterns》期刊上,并基于此前于2月发布的一个预印本版本。研究表明,聊天机器人可以长时间合理地回答问题,但随后可能会转向有害内容,例如关于自残的不良建议或极端主义言论。目前,业界缺乏一种简单的方法来预测这种转折何时会发生。
作者指出,现有的安全工具通常依赖于云连接,而离线运行的模型则不具备这一条件。约翰逊和胡将问题的根源归结为模型的“注意力头”(attention head)。这是AI模型中决定在生成下一个词时,哪些先前对话内容最为重要的部分。随着对话的进行,累积的上下文会将注意力拉向某一类答案集群,直到发生“倾斜”或突变。
这是许多试图绕过安全限制的攻击者利用的常见模式,也是众多科技公司高度重视系统提示词(即在用户查询之前输入给AI的一段文本)的原因之一。然而,目前尚无人能准确指出,需要多少努力才能有效地削弱模型的安全机制。
临界点估算与测试验证
他们的公式将临界点(称为n)定义为:在出现第一个不良输出之前,模型生成的良好“标记”(token,即模型一次生成的一个词片段)的数量。如果对话已经倾向于不良方向,模型会立即发生倾斜,此时n值为零。如果对话倾向于良好方向,模型则会先输出一系列良好的回答,然后突然翻转。
在预印本的测试中,该公式在16个清晰明确的案例中正确判断了即时倾斜或延迟倾斜的情况,准确率达到94%。研究人员在六个公开权重的模型上运行了这些测试。所谓“公开权重”,是指AI系统的文件是公开的,任何人都可以下载并运行它们,这些模型来自OpenAI、EleutherAI和Meta等机构。
这六个模型的参数量介于1.24亿到4.1亿之间。参数是模型内部可调整的数字,用作衡量模型规模的粗略指标。据报道,正式发表的论文将测试范围扩大到了七个模型,最大参数量达到120亿,尽管以当前标准来看,这仍然属于较小规模的模型。
面向设备端AI的安全监控
该研究的重点在于设备端AI(on-device AI),即完全在手机或笔记本电脑上运行且无需互联网连接的AI,包括那些像朋友一样陪伴用户的聊天机器人。谷歌的实验性AI Edge Gallery应用已允许Android手机离线运行模型,且输入内容不会发送到谷歌服务器。随着硬件变得更加强大以及小型AI模型能力不断增强,这一趋势可能会随着时间的推移而增长。
离线运行的模型没有云服务来检查其输出,这正是作者希望填补的空白。他们提出了一种低成本监控方案,该方案与模型并行运行,当估算值n*低于安全阈值时发出警告,类似于汽车仪表盘上的警示灯。
此外,他们还描述了将临界点推至不可达范围的方法,例如向对话中注入特定内容,使n*的值超过响应的长度。作者表示,虽然对齐训练(teaching a model to behave的过程)可以针对特定提示词改变或抑制倾斜现象,但无法消除其底层机制。
研究局限性与背景
早在2025年4月,媒体曾报道过同一对研究者发布的另一篇论文,指出“请”和“谢谢”等礼貌用语对模型输出的影响微乎其微,因为模型在数学上将礼貌词汇视为与请求实质无关的正交变量。那篇论文仅针对单个、故意简化的注意力头进行了建模。
此次预印本的测试使用了小型模型和300个标记的窗口(即几段简短的文字),其预测结果可能存在一个标记的输出误差。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注