評価の出典公式の評価
FrontierMath v2 · Tier 4
Epoch AI / 推論 · より高難度の数学研究問題
News での扱い順位に反映
根拠の配分1.2%
元データの時点09/30 06:00
最後に同期に成功10/01 20:05
何をどう測るか
Tier 4 を独立して保存し、Tiers 1–3 と数学的証拠の予算を共有する。標本誤差は保持する。
この根拠の使い方
正式に採点。同一問題ファミリーは固定予算を共有する。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | gpt-6.1-sol_max— | 100.0% | Max 推論 |
| 2 | gpt-6-astra_maxOpenAI | 97.6% | Max 推論 |
| 6 | claude-opus-5-5_maxAnthropic | 95.0% | Max 推論 |
| 7 | claude-fable-5_maxAnthropic | 90.2% | Max 推論 |
| 8 | gpt-6-sol_maxOpenAI | 90.0% | Max 推論 |
| 9 | claude-fable-5-1_maxAnthropic | 87.8% | Max 推論 |
| 11 | gpt-5.6-sol_maxOpenAI | 82.9% | Max 推論 |
| 13 | claude-sonnet-5-5_maxanthropic | 80.5% | Max 推論 |
| 15 | gpt-5.5-pro_xhighOpenAI | 78.0% | xHigh 推論 |
| 17 | claude-opus-5_maxAnthropic | 73.2% | Max 推論 |
| 18 | gpt-5.5_xhighOpenAI | 72.5% | xHigh 推論 |
| 19 | gpt-5.6-terra_maxOpenAI | 70.7% | Max 推論 |
| 20 | gpt-5.6-luna_maxOpenAI | 61.0% | Max 推論 |
| 21 | gpt-5.4-pro-2026-03-05_xhighOpenAI | 58.5% | xHigh 推論 |
| 22 | gpt-6-luna_maxOpenAI | 56.1% | Max 推論 |
| 22 | claude-opus-4-8_maxAnthropic | 56.1% | Max 推論 |
| 24 | gpt-5.4-2026-03-05_xhighOpenAI | 49.0% | xHigh 推論 |
| 25 | muse-spark-1.3_maxMeta | 46.3% | Max 推論 |
| 25 | qwen3.8-max_xhighAlibaba | 46.3% | xHigh 推論 |
| 27 | gpt-5.2-pro-2025-12-11_xhighOpenAI | 46.0% | xHigh 推論 |
| 29 | kimi-k3_maxMoonshot AI | 39.0% | Max 推論 |
| 30 | gemini-3.7-flash_highGoogle | 36.6% | High 推論 |
| 31 | qwen3.8-max-0902_xhighAlibaba | 34.1% | xHigh 推論 |
| 31 | qwen3.7-maxAlibaba | 34.1% | 情報源のデフォルト構成 |
| 33 | claude-opus-4-7_maxAnthropic | 31.7% | Max 推論 |
| 33 | grok-4.6_xhighxAI | 31.7% | xHigh 推論 |
| 35 | gpt-5.2-2025-12-11_xhighOpenAI | 31.7% | xHigh 推論 |
| 36 | claude-sonnet-5_maxAnthropic | 29.3% | Max 推論 |
| 36 | glm-5.3_maxZ.ai | 29.3% | Max 推論 |
| 36 | glm-5.2_maxZ.ai | 29.3% | Max 推論 |
評価の限界とデータの出典
正式に採点。同一問題ファミリーは固定予算を共有する。
データのライセンス:CC BY 4.0 · Epoch AI 独自評価データ
スコアは Epoch AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。