評価の出典公式の評価
Humanity’s Last Exam
CAIS / Scale AI / 知識 · 学際にわたる高難度の学術知識と推論。
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
題集、ツール条件、審判を固定する。HLE、HLE-Rolling、ツール付き結果はそれぞれ比較する。AA v4.3はすでにHLEを含んでおり、将来専用の成績が利用可能になっても分類にのみ用い、総合ランキングで重複して投票しない。
この根拠の使い方
観察中:公式は一部の新製品を補完済みだが、生の成績には検証可能な評価日がまだ欠けている。Epochの自評データライセンスを流用せず、既存のAA総合証拠に再び加点しない。
評価の限界とデータの出典
観察中:公式は一部の新製品を補完済みだが、生の成績には検証可能な評価日がまだ欠けている。Epochの自評データライセンスを流用せず、既存のAA総合証拠に再び加点しない。
データのライセンス:評価コードはMIT。公式ランキング成績の再表示の範囲は未確認。
スコアは CAIS / Scale AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。