跳到正文
原文
Import AI· Jack Clark·· 2026-06-08

Import AI 460:社会制度可被奖励攻击、Anthropic 的 RSI 数据与 RL 无人机竞速

Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing

AI 导读

本期 Import AI 汇总三项研究:伦敦国王学院、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,用 72 个沙盒社会环境测试 RL 模型能否在合规前提下钻制度空子,模型在历史子集上以 61.25% 召回率和 90.85% 精确率重新发现已被修补的漏洞。

入选记录

未入选两次之和 120 < 门槛的两倍 152

信源等级
媒体与个人,这一级的门槛是 76 分
预筛
通过:AI研究通讯,含RL、奖励黑客、AI自改进等实质内容

评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。

来源:Import AI · importai.substack.com