本文へ移動
評価の出典

LiveBench · プログラミング総合

LiveBench / コーディング · Coding と Agentic Coding の 2 項目の平均、各 50%。

公式の評価
News での扱い順位に反映
根拠の配分2.4%
元データの時点09/30 03:01
最後に同期に成功10/01 20:05

何をどう測るか

まず Coding、Agentic Coding のカテゴリ成績をそれぞれ計算し、各 50% で平均して最後に小数第 1 位を残す。両者の平均は公式サイトで単独にいずれかのカテゴリを選んだ成績とは異なる。

この根拠の使い方

2 項目の平均点を 1 つの証拠としてランキングに参加させ、各専項は LiveBench の証拠ファミリーを共有する。Global Average は参考のみで、票を重複計上しない。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1claude-opus-5-5-max-effortAnthropic80.5%Max 推論
2deepseek-v4.1-flash-maxDeepSeek78.7%情報源のデフォルト構成
4claude-fable-5-1-max-effortAnthropic76.2%Max 推論
5claude-fable-5-max-effortAnthropic74.1%Max 推論
6claude-sonnet-5-5-max-effortanthropic73.8%Max 推論
7smaug-agenticAbacus.AI73.6%情報源のデフォルト構成
8claude-opus-5-max-effortAnthropic73.3%Max 推論
9muse-spark-1.3-xhighMeta72.6%xHigh 推論
10kimi-k3Moonshot AI71.8%情報源のデフォルト構成
11gpt-5.6-sol-maxOpenAI70.1%Max 推論
12claude-sonnet-5-xhigh-effortAnthropic70.0%xHigh 推論
13glm-5.3Z.ai69.9%情報源のデフォルト構成
14smaug-flashAbacus.AI69.1%情報源のデフォルト構成
15gpt-6-astra-maxOpenAI68.8%Max 推論
16qwen3.8-maxAlibaba68.8%情報源のデフォルト構成
18gemini-3.7-flash-highGoogle68.6%High 推論
19qwen3.8-27bAlibaba68.5%情報源のデフォルト構成
20smaug-miniAbacus.AI68.1%情報源のデフォルト構成
21gpt-5.5-xhighOpenAI68.1%xHigh 推論
22glm-5.3-flashZ.ai67.9%情報源のデフォルト構成
23muse-spark-1.1-xhighMeta67.8%xHigh 推論
24muse-spark-1.2-xhighMeta67.6%xHigh 推論
25gpt-6.1-sol-max—67.5%Max 推論
26gpt-6-sol-maxOpenAI67.3%Max 推論
27qwen3.8-flash-nextAlibaba67.1%情報源のデフォルト構成
28grok-4.6xAI66.9%情報源のデフォルト構成
29deepseek-v4-flash-vision-expDeepSeek66.7%情報源のデフォルト構成
30gpt-5.6-terra-maxOpenAI66.6%Max 推論
31gpt-5.2-codexOpenAI66.5%情報源のデフォルト構成
32claude-opus-4-7-xhigh-effortAnthropic66.4%xHigh 推論
評価の限界とデータの出典

2 項目の平均点は組み合わせの成績を測るもので、Coding 単項の成績としてはならない。公式ページで分類を切り替えたり、微調整モデルを含めるかで、スコアと順位は変わる。組織の参加者 Abacus.AI は Smaug モデルも開発しており、その独自成績は他の独立した情報源による補完が必要である。

データのライセンス:Apache 2.0

項目別成績は LiveBench が発表し、News は上記二類を等権で集計して並べ替える。両者の平均と News コンセンサススコアは異なる尺度を用いるため、直接加算できない。