Berkeley AI Research·· 2026-07-26
Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互
Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction
AI 导读
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
入选记录
门槛 60官方一手第一次 38第二次 38
未入选两次之和 76 < 门槛的两倍 120
- 信源等级
- 官方一手,这一级的门槛是 60 分
- 预筛
- 通过:LLM信念更新与长程交互研究
评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。
来源:Berkeley AI Research · bair.berkeley.edu