評価の出典公式の評価
GPQA Diamond
Epoch AI / 知識 · 大学院レベルの物理、化学、生物の知識
News での扱い順位に反映
根拠の配分2%
元データの時点09/30 06:00
最後に同期に成功10/01 20:05
何をどう測るか
Epochが独自に再実行したmean_scoreのみを採用し、推論ティアと標準誤差を保持する。198問の科学知識問題は推論を要するが、世界知識全体を代表するものではない。
この根拠の使い方
正式に採点。同一問題ファミリーは固定予算を共有する。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | gpt-6-astra_maxOpenAI | 95.8% | Max 推論 |
| 2 | claude-sonnet-5-5_maxanthropic | 95.6% | Max 推論 |
| 3 | gpt-6.1-sol_max— | 95.4% | Max 推論 |
| 3 | gemini-3.8-flash_highGoogle | 95.4% | High 推論 |
| 5 | gemini-3.7-flash_highGoogle | 94.8% | High 推論 |
| 6 | gpt-5.4-pro-2026-03-05_xhighOpenAI | 94.6% | xHigh 推論 |
| 7 | gemini-3.1-pro-preview_highGoogle | 94.4% | High 推論 |
| 8 | gpt-6-sol_maxOpenAI | 94.3% | Max 推論 |
| 9 | gemini-3.6-flash_highGoogle | 94.1% | High 推論 |
| 14 | claude-opus-5_maxAnthropic | 93.9% | Max 推論 |
| 15 | gpt-5.6-sol_maxOpenAI | 93.5% | Max 推論 |
| 16 | grok-4.5_highxAI | 93.4% | High 推論 |
| 17 | gpt-5.6-terra_maxOpenAI | 93.3% | Max 推論 |
| 18 | gpt-5.4-2026-03-05_xhighOpenAI | 93.3% | xHigh 推論 |
| 19 | grok-4.6_xhighxAI | 93.2% | xHigh 推論 |
| 20 | kimi-k3_maxMoonshot AI | 93.1% | Max 推論 |
| 22 | gemini-3.5-flash_highGoogle | 92.8% | High 推論 |
| 23 | qwen3.8-max_xhighAlibaba | 92.7% | xHigh 推論 |
| 24 | gemini-3-pro-previewGoogle | 92.6% | 情報源のデフォルト構成 |
| 25 | qwen3.8-max-0902_xhighAlibaba | 92.3% | xHigh 推論 |
| 27 | glm-5.2_maxZ.ai | 91.9% | Max 推論 |
| 28 | deepseek-v4-pro-0813_maxDeepSeek | 91.7% | Max 推論 |
| 29 | gpt-5.6-luna_maxOpenAI | 91.6% | Max 推論 |
| 30 | gpt-5.2-2025-12-11_xhighOpenAI | 91.4% | xHigh 推論 |
| 31 | claude-opus-4-8_maxAnthropic | 91.0% | Max 推論 |
| 31 | deepseek-v4-flash-0731_maxDeepSeek | 91.0% | Max 推論 |
| 33 | glm-5.3_maxZ.ai | 90.9% | Max 推論 |
| 33 | MiniMax-M3MiniMax | 90.9% | 情報源のデフォルト構成 |
| 33 | qwen3.7-maxAlibaba | 90.9% | 情報源のデフォルト構成 |
| 37 | kimi-k2.6Moonshot AI | 90.8% | 情報源のデフォルト構成 |
評価の限界とデータの出典
正式に採点。同一問題ファミリーは固定予算を共有する。
データのライセンス:CC BY 4.0 · Epoch AI 独自評価データ
スコアは Epoch AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。