跳到正文
原文
Google Research·· 2026-08-12

Google Research 研究:召回而非编码是大模型事实性瓶颈

Empty shelves or lost keys? Recall is the bottleneck for parametric factuality

AI 导读

Google Research 提出知识画像框架,用 2,150 条 Wikipedia 事实的 WikiProfile 基准评测 13 个 LLM,发现 Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却仍有 26–34% 无法直接召回,开启思考后仍有 11–12% 失败。研究认为前沿模型的事实错误更多源于知识可及性不足,而非知识缺失,瓶颈正从知识获取转向知识利用。

入选记录

未入选两次之和 76 < 门槛的两倍 120

信源等级
官方一手,这一级的门槛是 60 分
预筛
通过:研究LLM事实编码与召回瓶颈

评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。

来源:Google Research · research.google