本文へ移動
評価の出典

FrontierMath v2 · Tiers 1–3

Epoch AI / 推論 · 研究レベルの数学的推論

公式の評価
News での扱い順位に反映
根拠の配分3.6%
元データの時点09/30 06:00
最後に同期に成功10/01 20:05

何をどう測るか

v2のTiers 1–3のみを用いる。旧版の問題とTier 4を同一指標に混入させない。

この根拠の使い方

正式に採点。同一問題ファミリーは固定予算を共有する。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gpt-6.1-sol_max—93.7%Max 推論
1gpt-6-astra_maxOpenAI93.7%Max 推論
3claude-opus-5-5_maxAnthropic91.2%Max 推論
4claude-fable-5-1_maxAnthropic90.2%Max 推論
5gpt-6-sol_maxOpenAI89.8%Max 推論
6gpt-5.6-sol_maxOpenAI89.1%Max 推論
7claude-sonnet-5-5_maxanthropic88.8%Max 推論
8gpt-5.5-pro_xhighOpenAI87.7%xHigh 推論
9claude-fable-5_maxAnthropic87.0%Max 推論
10gpt-5.6-terra_maxOpenAI86.0%Max 推論
11claude-opus-5_maxAnthropic85.6%Max 推論
12gpt-5.5_xhighOpenAI85.3%xHigh 推論
13gpt-5.4-pro-2026-03-05_xhighOpenAI82.5%xHigh 推論
14gpt-5.6-luna_maxOpenAI82.1%Max 推論
15claude-opus-4-8_maxAnthropic80.0%Max 推論
16gpt-6-luna_maxOpenAI78.9%Max 推論
17gpt-5.4-2026-03-05_xhighOpenAI78.6%xHigh 推論
18qwen3.8-max_xhighAlibaba74.7%xHigh 推論
20muse-spark-1.3_maxMeta74.0%Max 推論
21gpt-5.2-pro-2025-12-11_xhighOpenAI74.0%xHigh 推論
22kimi-k3_maxMoonshot AI72.2%Max 推論
23gemini-3.7-flash_highGoogle71.6%High 推論
24claude-opus-4-7_maxAnthropic70.2%Max 推論
25glm-5.3_maxZ.ai68.8%Max 推論
26gemini-3.8-flash_highGoogle68.4%High 推論
27gpt-5.2-2025-12-11_xhighOpenAI67.4%xHigh 推論
28claude-opus-4-6_maxAnthropic66.0%Max 推論
28grok-4.6_xhighxAI66.0%xHigh 推論
30claude-sonnet-5_maxAnthropic65.6%Max 推論
30qwen3.8-max-0902_xhighAlibaba65.6%xHigh 推論
評価の限界とデータの出典

正式に採点。同一問題ファミリーは固定予算を共有する。

データのライセンス:CC BY 4.0 · Epoch AI 独自評価データ

スコアは Epoch AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。