評価の出典公式の評価
LiveBench · 推論と数学
LiveBench / 推論 · Reasoning と Mathematics の 2 項目の平均点で、各 50%。
News での扱い順位に反映
根拠の配分4.2%
元データの時点09/30 03:01
最後に同期に成功10/01 20:05
何をどう測るか
まず Reasoning、Mathematics のカテゴリ成績をそれぞれ計算し、各 50% で平均して最後に小数第 1 位を残す。両者の平均は公式サイトで単独にいずれかのカテゴリを選んだ成績とは異なる。
この根拠の使い方
2 項目の平均点を 1 つの証拠としてランキングに参加させ、各専項は LiveBench の証拠ファミリーを共有する。Global Average は参考のみで、票を重複計上しない。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | gpt-6.1-sol-max— | 94.7% | Max 推論 |
| 2 | gpt-6-astra-maxOpenAI | 94.7% | Max 推論 |
| 3 | claude-opus-5-5-max-effortAnthropic | 94.6% | Max 推論 |
| 4 | claude-fable-5-1-max-effortAnthropic | 94.3% | Max 推論 |
| 6 | gpt-5.6-sol-maxOpenAI | 93.9% | Max 推論 |
| 7 | claude-sonnet-5-5-max-effortanthropic | 93.9% | Max 推論 |
| 9 | claude-opus-5-max-effortAnthropic | 93.5% | Max 推論 |
| 10 | claude-fable-5-max-effortAnthropic | 92.8% | Max 推論 |
| 11 | muse-spark-1.3-xhighMeta | 92.8% | xHigh 推論 |
| 12 | gpt-5.6-terra-maxOpenAI | 92.8% | Max 推論 |
| 13 | gpt-5.5-xhighOpenAI | 92.8% | xHigh 推論 |
| 14 | gpt-6-sol-maxOpenAI | 92.5% | Max 推論 |
| 15 | claude-opus-4-8-max-effortAnthropic | 91.8% | Max 推論 |
| 17 | grok-4.6xAI | 91.5% | 情報源のデフォルト構成 |
| 18 | gpt-5.4-xhighOpenAI | 91.1% | xHigh 推論 |
| 19 | claude-sonnet-5-xhigh-effortAnthropic | 90.8% | xHigh 推論 |
| 20 | gemini-3.7-flash-highGoogle | 90.6% | High 推論 |
| 21 | muse-spark-1.2-xhighMeta | 90.6% | xHigh 推論 |
| 22 | deepseek-v4-pro-0813DeepSeek | 90.5% | 情報源のデフォルト構成 |
| 23 | gemini-3.8-flash-highGoogle | 90.4% | High 推論 |
| 24 | claude-opus-4-7-xhigh-effortAnthropic | 90.0% | xHigh 推論 |
| 25 | deepseek-v4.1-flash-maxDeepSeek | 90.0% | 情報源のデフォルト構成 |
| 26 | qwen3.8-maxAlibaba | 89.8% | 情報源のデフォルト構成 |
| 27 | grok-4.7-xhighxAI | 89.2% | xHigh 推論 |
| 28 | grok-4.5xAI | 89.0% | 情報源のデフォルト構成 |
| 29 | claude-opus-4-6-thinking-auto-high-effortAnthropic | 89.0% | High 推論 |
| 30 | gpt-5.2-2025-12-11-highOpenAI | 88.2% | High 推論 |
| 31 | smaug-flashAbacus.AI | 88.1% | 情報源のデフォルト構成 |
| 32 | kimi-k3Moonshot AI | 87.6% | 情報源のデフォルト構成 |
| 33 | gemini-3.1-pro-preview-highGoogle | 87.5% | High 推論 |
評価の限界とデータの出典
2 項目の平均点は組み合わせの成績を測るもので、Reasoning 単項の成績としてはならない。公式ページで分類を切り替えたり、微調整モデルを含めるかで、スコアと順位は変わる。組織の参加者 Abacus.AI は Smaug モデルも開発しており、その独自成績は他の独立した情報源による補完が必要である。
データのライセンス:Apache 2.0
項目別成績は LiveBench が発表し、News は上記二類を等権で集計して並べ替える。両者の平均と News コンセンサススコアは異なる尺度を用いるため、直接加算できない。