Google Research·· 2026-08-12
Google Research 研究:召回而非编码是大模型事实性瓶颈
Empty shelves or lost keys? Recall is the bottleneck for parametric factuality
AI 导读
Google Research 提出知识画像框架,用 2,150 条 Wikipedia 事实的 WikiProfile 基准评测 13 个 LLM,发现 Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却仍有 26–34% 无法直接召回,开启思考后仍有 11–12% 失败。研究认为前沿模型的事实错误更多源于知识可及性不足,而非知识缺失,瓶颈正从知识获取转向知识利用。
入选记录
门槛 60官方一手第一次 38第二次 38
未入选两次之和 76 < 门槛的两倍 120
- 信源等级
- 官方一手,这一级的门槛是 60 分
- 预筛
- 通过:研究LLM事实编码与召回瓶颈
评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。
来源:Google Research · research.google