Import AI· Jack Clark·· 2026-06-08
Import AI 460:社会制度可被奖励攻击、Anthropic 的 RSI 数据与 RL 无人机竞速
Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing
AI 导读
本期 Import AI 汇总三项研究:伦敦国王学院、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,用 72 个沙盒社会环境测试 RL 模型能否在合规前提下钻制度空子,模型在历史子集上以 61.25% 召回率和 90.85% 精确率重新发现已被修补的漏洞。
入选记录
门槛 76媒体与个人第一次 58第二次 62
未入选两次之和 120 < 门槛的两倍 152
- 信源等级
- 媒体与个人,这一级的门槛是 76 分
- 预筛
- 通过:AI研究通讯,含RL、奖励黑客、AI自改进等实质内容
评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。
来源:Import AI · importai.substack.com