本文へ移動
評価の出典

GPQA Diamond

Epoch AI / 知識 · 大学院レベルの物理、化学、生物の知識

公式の評価
News での扱い順位に反映
根拠の配分2%
元データの時点09/30 06:00
最後に同期に成功10/01 20:05

何をどう測るか

Epochが独自に再実行したmean_scoreのみを採用し、推論ティアと標準誤差を保持する。198問の科学知識問題は推論を要するが、世界知識全体を代表するものではない。

この根拠の使い方

正式に採点。同一問題ファミリーは固定予算を共有する。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gpt-6-astra_maxOpenAI95.8%Max 推論
2claude-sonnet-5-5_maxanthropic95.6%Max 推論
3gpt-6.1-sol_max—95.4%Max 推論
3gemini-3.8-flash_highGoogle95.4%High 推論
5gemini-3.7-flash_highGoogle94.8%High 推論
6gpt-5.4-pro-2026-03-05_xhighOpenAI94.6%xHigh 推論
7gemini-3.1-pro-preview_highGoogle94.4%High 推論
8gpt-6-sol_maxOpenAI94.3%Max 推論
9gemini-3.6-flash_highGoogle94.1%High 推論
14claude-opus-5_maxAnthropic93.9%Max 推論
15gpt-5.6-sol_maxOpenAI93.5%Max 推論
16grok-4.5_highxAI93.4%High 推論
17gpt-5.6-terra_maxOpenAI93.3%Max 推論
18gpt-5.4-2026-03-05_xhighOpenAI93.3%xHigh 推論
19grok-4.6_xhighxAI93.2%xHigh 推論
20kimi-k3_maxMoonshot AI93.1%Max 推論
22gemini-3.5-flash_highGoogle92.8%High 推論
23qwen3.8-max_xhighAlibaba92.7%xHigh 推論
24gemini-3-pro-previewGoogle92.6%情報源のデフォルト構成
25qwen3.8-max-0902_xhighAlibaba92.3%xHigh 推論
27glm-5.2_maxZ.ai91.9%Max 推論
28deepseek-v4-pro-0813_maxDeepSeek91.7%Max 推論
29gpt-5.6-luna_maxOpenAI91.6%Max 推論
30gpt-5.2-2025-12-11_xhighOpenAI91.4%xHigh 推論
31claude-opus-4-8_maxAnthropic91.0%Max 推論
31deepseek-v4-flash-0731_maxDeepSeek91.0%Max 推論
33glm-5.3_maxZ.ai90.9%Max 推論
33MiniMax-M3MiniMax90.9%情報源のデフォルト構成
33qwen3.7-maxAlibaba90.9%情報源のデフォルト構成
37kimi-k2.6Moonshot AI90.8%情報源のデフォルト構成
評価の限界とデータの出典

正式に採点。同一問題ファミリーは固定予算を共有する。

データのライセンス:CC BY 4.0 · Epoch AI 独自評価データ

スコアは Epoch AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。