本文へ移動
評価の出典

SimpleQA Verified

Epoch AI / 知識 · 短い問題の事実正確性

公式の評価
News での扱い順位に反映
根拠の配分4%
元データの時点09/30 06:00
最後に同期に成功10/01 20:05

何をどう測るか

Epochが独自に再実行したmean_scoreのみを採用し、固定の推論ティアを用いる。ECIやBest scoreの集約列は参照しない。

この根拠の使い方

正式に採点。同一問題ファミリーは固定予算を共有する。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gpt-6-astra_maxOpenAI75.6%Max 推論
2gpt-6.1-sol_max—73.9%Max 推論
3gemini-3.1-pro-preview_highGoogle73.5%High 推論
4claude-opus-5-5_maxAnthropic72.2%Max 推論
5claude-fable-5-1_maxAnthropic70.8%Max 推論
6claude-fable-5_xhighAnthropic70.7%xHigh 推論
7gemini-3.8-flash_highGoogle69.7%High 推論
7gpt-5.6-sol_maxOpenAI69.7%Max 推論
9gemini-3.7-flash_highGoogle69.2%High 推論
10gemini-3-flash-preview_highGoogle66.8%High 推論
11gemini-3.6-flash_highGoogle66.2%High 推論
11gemini-3.5-flash_highGoogle66.2%High 推論
13gpt-5.5_xhighOpenAI63.0%xHigh 推論
14gpt-6-sol_maxOpenAI60.7%Max 推論
15muse-spark-1.2_xhighMeta60.3%xHigh 推論
16claude-opus-5_maxAnthropic59.9%Max 推論
17muse-spark-1.1Meta57.8%情報源のデフォルト構成
18qwen3.7-maxAlibaba55.8%情報源のデフォルト構成
19claude-opus-4-8_maxAnthropic53.0%Max 推論
20deepseek-v4-pro-0813_maxDeepSeek52.9%Max 推論
21qwen3.6-max-previewAlibaba52.0%情報源のデフォルト構成
22claude-opus-4-7_xhighAnthropic51.7%xHigh 推論
23kimi-k3_maxMoonshot AI50.6%Max 推論
24gpt-5-2025-08-07_highOpenAI50.1%High 推論
25o3-2025-04-16_highOpenAI49.4%High 推論
27grok-4.6_xhighxAI48.9%xHigh 推論
28qwen3-max-2025-09-23Alibaba48.7%情報源のデフォルト構成
29grok-4.5_highxAI48.3%High 推論
30gpt-5.1-2025-11-13_highOpenAI48.0%High 推論
31qwen3.8-max-0902_xhighAlibaba47.3%xHigh 推論
評価の限界とデータの出典

正式に採点。同一問題ファミリーは固定予算を共有する。

データのライセンス:CC BY 4.0 · Epoch AI 独自評価データ

スコアは Epoch AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。