Google Research·· 2026-08-12
Google Research、大型モデルの事実の難点は記憶より想起と報告
Empty shelves or lost keys? Recall is the bottleneck for parametric factuality
AI による要約
Google ResearchはWikipedia事実2150件のWikiProfileで13モデルを評価した。Gemini-3-ProとGPT-5は95~98%を記憶していたが26~34%を直接想起できず、思考ありでも11~12%失敗した。最先端モデルの誤りは知識不足よりアクセス不足によるとし、難点が知識獲得から活用へ移ると指摘する。
入選の記録
基準 60公式・一次情報1 回目 382 回目 38
入選せず二回の合計 76 < 基準の 2 倍 120
- 情報源の区分
- 公式・一次情報、この区分の基準は 60 点
- 予備審査
- 通過:研究LLM事实编码与召回瓶颈
採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。
情報源:Google Research · research.google