本文へ移動
評価の出典

FrontierMath v2 · Tier 4

Epoch AI / 推論 · より高難度の数学研究問題

公式の評価
News での扱い順位に反映
根拠の配分1.2%
元データの時点09/30 06:00
最後に同期に成功10/01 20:05

何をどう測るか

Tier 4 を独立して保存し、Tiers 1–3 と数学的証拠の予算を共有する。標本誤差は保持する。

この根拠の使い方

正式に採点。同一問題ファミリーは固定予算を共有する。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gpt-6.1-sol_max—100.0%Max 推論
2gpt-6-astra_maxOpenAI97.6%Max 推論
6claude-opus-5-5_maxAnthropic95.0%Max 推論
7claude-fable-5_maxAnthropic90.2%Max 推論
8gpt-6-sol_maxOpenAI90.0%Max 推論
9claude-fable-5-1_maxAnthropic87.8%Max 推論
11gpt-5.6-sol_maxOpenAI82.9%Max 推論
13claude-sonnet-5-5_maxanthropic80.5%Max 推論
15gpt-5.5-pro_xhighOpenAI78.0%xHigh 推論
17claude-opus-5_maxAnthropic73.2%Max 推論
18gpt-5.5_xhighOpenAI72.5%xHigh 推論
19gpt-5.6-terra_maxOpenAI70.7%Max 推論
20gpt-5.6-luna_maxOpenAI61.0%Max 推論
21gpt-5.4-pro-2026-03-05_xhighOpenAI58.5%xHigh 推論
22gpt-6-luna_maxOpenAI56.1%Max 推論
22claude-opus-4-8_maxAnthropic56.1%Max 推論
24gpt-5.4-2026-03-05_xhighOpenAI49.0%xHigh 推論
25muse-spark-1.3_maxMeta46.3%Max 推論
25qwen3.8-max_xhighAlibaba46.3%xHigh 推論
27gpt-5.2-pro-2025-12-11_xhighOpenAI46.0%xHigh 推論
29kimi-k3_maxMoonshot AI39.0%Max 推論
30gemini-3.7-flash_highGoogle36.6%High 推論
31qwen3.8-max-0902_xhighAlibaba34.1%xHigh 推論
31qwen3.7-maxAlibaba34.1%情報源のデフォルト構成
33claude-opus-4-7_maxAnthropic31.7%Max 推論
33grok-4.6_xhighxAI31.7%xHigh 推論
35gpt-5.2-2025-12-11_xhighOpenAI31.7%xHigh 推論
36claude-sonnet-5_maxAnthropic29.3%Max 推論
36glm-5.3_maxZ.ai29.3%Max 推論
36glm-5.2_maxZ.ai29.3%Max 推論
評価の限界とデータの出典

正式に採点。同一問題ファミリーは固定予算を共有する。

データのライセンス:CC BY 4.0 · Epoch AI 独自評価データ

スコアは Epoch AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。