本文へ移動
評価の出典

Mystery Game Puzzles

Epoch AI / 推論 · 未知のルールから正しい行動を導出

公式の評価
News での扱い順位に反映
根拠の配分1.2%
元データの時点09/30 06:00
最後に同期に成功10/01 20:05

何をどう測るか

Epoch標準プロトコルのmean_scoreのみを採用。問題を非公開とする制限は明確に維持する。

この根拠の使い方

正式に採点。同一問題ファミリーは固定予算を共有する。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gpt-6-astra_maxOpenAI84.0%Max 推論
2gpt-6.1-sol_max—80.0%Max 推論
3claude-opus-5-5_maxAnthropic71.0%Max 推論
4claude-sonnet-5-5_maxanthropic65.0%Max 推論
5claude-opus-5_maxAnthropic59.0%Max 推論
6gpt-5.6-sol_maxOpenAI58.0%Max 推論
6claude-fable-5-1_maxAnthropic58.0%Max 推論
8gpt-5.5_xhighOpenAI56.0%xHigh 推論
8gpt-6-sol_maxOpenAI56.0%Max 推論
10claude-fable-5_maxAnthropic52.0%Max 推論
12gemini-3.8-flash_highGoogle47.0%High 推論
13deepseek-v4-pro-0813_maxDeepSeek43.0%Max 推論
14qwen3.8-max_xhighAlibaba38.0%xHigh 推論
15gemini-3.7-flash_highGoogle37.0%High 推論
15gpt-5.4-2026-03-05_xhighOpenAI37.0%xHigh 推論
18claude-opus-4-8_maxAnthropic36.0%Max 推論
19claude-sonnet-5_maxAnthropic35.0%Max 推論
19gpt-5.6-terra_maxOpenAI35.0%Max 推論
21deepseek-v4-flash-0731_maxDeepSeek34.0%Max 推論
21gemini-3.1-pro-preview_highGoogle34.0%High 推論
21grok-4.6_xhighxAI34.0%xHigh 推論
24glm-5.3_maxZ.ai33.0%Max 推論
26qwen3.7-maxAlibaba32.0%情報源のデフォルト構成
26gemini-3.5-flash_highGoogle32.0%High 推論
30gemini-3.6-flash_highGoogle30.0%High 推論
31o3-2025-04-16_highOpenAI29.0%High 推論
33claude-opus-4-7_maxAnthropic28.0%Max 推論
37kimi-k3_maxMoonshot AI26.0%Max 推論
41claude-opus-4-6_maxAnthropic25.0%Max 推論
41muse-spark-1.3_maxMeta25.0%Max 推論
評価の限界とデータの出典

正式に採点。同一問題ファミリーは固定予算を共有する。

データのライセンス:CC BY 4.0 · Epoch AI 独自評価データ

スコアは Epoch AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。