本文へ移動
評価の出典

LiveBench · 推論と数学

LiveBench / 推論 · Reasoning と Mathematics の 2 項目の平均点で、各 50%。

公式の評価
News での扱い順位に反映
根拠の配分4.2%
元データの時点09/30 03:01
最後に同期に成功10/01 20:05

何をどう測るか

まず Reasoning、Mathematics のカテゴリ成績をそれぞれ計算し、各 50% で平均して最後に小数第 1 位を残す。両者の平均は公式サイトで単独にいずれかのカテゴリを選んだ成績とは異なる。

この根拠の使い方

2 項目の平均点を 1 つの証拠としてランキングに参加させ、各専項は LiveBench の証拠ファミリーを共有する。Global Average は参考のみで、票を重複計上しない。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gpt-6.1-sol-max—94.7%Max 推論
2gpt-6-astra-maxOpenAI94.7%Max 推論
3claude-opus-5-5-max-effortAnthropic94.6%Max 推論
4claude-fable-5-1-max-effortAnthropic94.3%Max 推論
6gpt-5.6-sol-maxOpenAI93.9%Max 推論
7claude-sonnet-5-5-max-effortanthropic93.9%Max 推論
9claude-opus-5-max-effortAnthropic93.5%Max 推論
10claude-fable-5-max-effortAnthropic92.8%Max 推論
11muse-spark-1.3-xhighMeta92.8%xHigh 推論
12gpt-5.6-terra-maxOpenAI92.8%Max 推論
13gpt-5.5-xhighOpenAI92.8%xHigh 推論
14gpt-6-sol-maxOpenAI92.5%Max 推論
15claude-opus-4-8-max-effortAnthropic91.8%Max 推論
17grok-4.6xAI91.5%情報源のデフォルト構成
18gpt-5.4-xhighOpenAI91.1%xHigh 推論
19claude-sonnet-5-xhigh-effortAnthropic90.8%xHigh 推論
20gemini-3.7-flash-highGoogle90.6%High 推論
21muse-spark-1.2-xhighMeta90.6%xHigh 推論
22deepseek-v4-pro-0813DeepSeek90.5%情報源のデフォルト構成
23gemini-3.8-flash-highGoogle90.4%High 推論
24claude-opus-4-7-xhigh-effortAnthropic90.0%xHigh 推論
25deepseek-v4.1-flash-maxDeepSeek90.0%情報源のデフォルト構成
26qwen3.8-maxAlibaba89.8%情報源のデフォルト構成
27grok-4.7-xhighxAI89.2%xHigh 推論
28grok-4.5xAI89.0%情報源のデフォルト構成
29claude-opus-4-6-thinking-auto-high-effortAnthropic89.0%High 推論
30gpt-5.2-2025-12-11-highOpenAI88.2%High 推論
31smaug-flashAbacus.AI88.1%情報源のデフォルト構成
32kimi-k3Moonshot AI87.6%情報源のデフォルト構成
33gemini-3.1-pro-preview-highGoogle87.5%High 推論
評価の限界とデータの出典

2 項目の平均点は組み合わせの成績を測るもので、Reasoning 単項の成績としてはならない。公式ページで分類を切り替えたり、微調整モデルを含めるかで、スコアと順位は変わる。組織の参加者 Abacus.AI は Smaug モデルも開発しており、その独自成績は他の独立した情報源による補完が必要である。

データのライセンス:Apache 2.0

項目別成績は LiveBench が発表し、News は上記二類を等権で集計して並べ替える。両者の平均と News コンセンサススコアは異なる尺度を用いるため、直接加算できない。