評価の出典公式の評価
LiveBench Global Average
LiveBench · 問題集は継続的に入れ替わり、答えは自動で照合できる。モデルが問題を替えても通用するかを見る。
News での扱い照合用
根拠の配分採点に使わない
元データの時点09/30 03:01
最後に同期に成功10/01 20:05
何をどう測るか
公式の Global Average は全体参考として残す。正式スコアには重複しない専項タスクを用いる。
この根拠の使い方
元の Global Average は参考として残す。正式な票は重複しない専項タスクに切り替える。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | claude-fable-5-1-max-effortAnthropic | 83.4% | Max 推論 |
| 2 | claude-opus-5-5-max-effortAnthropic | 83.2% | Max 推論 |
| 3 | claude-fable-5-max-effortAnthropic | 83.0% | Max 推論 |
| 4 | gpt-6-astra-maxOpenAI | 82.2% | Max 推論 |
| 6 | gpt-6.1-sol-max— | 81.6% | Max 推論 |
| 7 | muse-spark-1.3-xhighMeta | 81.6% | xHigh 推論 |
| 9 | deepseek-v4.1-flash-maxDeepSeek | 81.1% | 情報源のデフォルト構成 |
| 10 | gpt-5.6-sol-maxOpenAI | 81.1% | Max 推論 |
| 11 | gpt-5.5-xhighOpenAI | 80.2% | xHigh 推論 |
| 12 | claude-opus-5-max-effortAnthropic | 80.1% | Max 推論 |
| 13 | smaug-agenticAbacus.AI | 79.5% | 情報源のデフォルト構成 |
| 14 | gpt-6-sol-maxOpenAI | 79.2% | Max 推論 |
| 15 | kimi-k3Moonshot AI | 79.2% | 情報源のデフォルト構成 |
| 16 | gemini-3.7-flash-highGoogle | 78.8% | High 推論 |
| 17 | qwen3.8-maxAlibaba | 78.5% | 情報源のデフォルト構成 |
| 18 | grok-4.6xAI | 78.0% | 情報源のデフォルト構成 |
| 19 | gpt-5.4-xhighOpenAI | 78.0% | xHigh 推論 |
| 20 | muse-spark-1.2-xhighMeta | 78.0% | xHigh 推論 |
| 21 | gpt-5.6-terra-maxOpenAI | 77.9% | Max 推論 |
| 23 | deepseek-v4-pro-0813DeepSeek | 77.4% | 情報源のデフォルト構成 |
| 24 | smaug-flashAbacus.AI | 77.4% | 情報源のデフォルト構成 |
| 25 | grok-4.7-xhighxAI | 77.4% | xHigh 推論 |
| 26 | gemini-3.1-pro-preview-highGoogle | 77.0% | High 推論 |
| 27 | smaug-miniAbacus.AI | 76.9% | 情報源のデフォルト構成 |
| 28 | deepseek-v4-flash-vision-expDeepSeek | 76.8% | 情報源のデフォルト構成 |
| 29 | claude-opus-4-7-xhigh-effortAnthropic | 76.5% | xHigh 推論 |
| 30 | claude-opus-4-8-max-effortAnthropic | 76.2% | Max 推論 |
| 31 | qwen3.8-flash-nextAlibaba | 76.2% | 情報源のデフォルト構成 |
| 32 | glm-5.3Z.ai | 76.1% | 情報源のデフォルト構成 |
| 33 | claude-sonnet-5-xhigh-effortAnthropic | 76.0% | xHigh 推論 |
評価の限界とデータの出典
総合平均は特定能力の変化を希釈する。交差参考のみで、重複計票はしない。組織参加者 Abacus.AI は同時に Smaug モデルを開発しており、その独占成績は他の独立した来源で補う必要がある。
データのライセンス:Apache 2.0
スコアは LiveBench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。