本文へ移動
評価の出典

FACTS Parametric

Google DeepMind / Kaggle / 知識 · 検索ツールを使わずに世界の事実問題に回答し、モデル自身の知識の正確さを検証する。

公式の評価
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません

何をどう測るか

固定タスクバージョンのScoreのみを考慮し、公開セット、非公開セット、信頼区間を検証用に保持する。三つの関連スコアを重複して投票してはならない。FACTSはAA v4.3の十項目の基盤評価には含まれない。

この根拠の使い方

観察中:公式のプロトコルとライセンスは確認済みだが、完了した問題数や完全性の表示はない。一部の行の区間は著しく広く、総合スコアと公開セット・非公開セットの集計口径にも確認待ちの状況がある。評価側の説明を待ち、異常な行を削除して無理に接続せず、スコアリング予算を消費しない。

評価の限界とデータの出典

審判と評価の実施主体はいずれもGoogleであり、他機関の証拠と組み合わせる必要がある。エクスポートは一部の結果が同じ問題セットを完了したか説明しておらず、部分的な結果を完全な評価と見なせない。区間から逆算したサンプル数は公式に確認された事実ではない。

データのライセンス:Apache 2.0 · 公式 benchmark と Score task ページで明示。Kaggle ドキュメントは公共リーダーボードのログイン不要 JSON ダウンロードを提供。

スコアは Google DeepMind / Kaggle が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。