本文へ移動
評価の出典

LiveBench · 言語と指示

LiveBench · Language と IF の 2 項目の平均、各 50%。

公式の評価
News での扱い順位に反映
根拠の配分3%
元データの時点09/30 03:01
最後に同期に成功10/01 20:05

何をどう測るか

まず Language、IF のカテゴリ成績をそれぞれ計算し、各 50% で平均して最後に小数第 1 位を残す。両者の平均は公式サイトで単独にいずれかのカテゴリを選んだ成績とは異なる。Language は言語理解、IF は指示と形式の制約を測るもので、これに基づき小説の文章力を評価するものではない。

この根拠の使い方

総合ランキングのライティングと表現予算のうち 3% を残す。文学創作のライティングカテゴリには算入しない。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gemini-3.8-flash-highGoogle84.6%High 推論
2claude-fable-5-max-effortAnthropic83.2%Max 推論
3gemini-3.7-flash-highGoogle82.7%High 推論
4gpt-6-astra-maxOpenAI82.5%Max 推論
5gemini-3.1-pro-preview-highGoogle82.2%High 推論
6gpt-6.1-sol-max—82.1%Max 推論
7claude-fable-5-1-max-effortAnthropic81.2%Max 推論
8muse-spark-1.3-xhighMeta80.4%xHigh 推論
9gemini-3.5-flash-highGoogle80.1%High 推論
11gpt-5.6-sol-maxOpenAI79.8%Max 推論
12gemini-3.6-flash-highGoogle79.6%High 推論
13gpt-5.5-xhighOpenAI79.0%xHigh 推論
14kimi-k3Moonshot AI78.4%情報源のデフォルト構成
15grok-4.6xAI77.8%情報源のデフォルト構成
16grok-4.7-xhighxAI77.7%xHigh 推論
17smaug-agenticAbacus.AI77.7%情報源のデフォルト構成
18grok-4.5xAI77.2%情報源のデフォルト構成
20gpt-6-sol-maxOpenAI76.9%Max 推論
21qwen3.7-maxAlibaba76.9%情報源のデフォルト構成
22qwen3.8-maxAlibaba76.9%情報源のデフォルト構成
23muse-spark-1.2-xhighMeta76.4%xHigh 推論
24gpt-5.4-xhighOpenAI76.4%xHigh 推論
26claude-opus-5-max-effortAnthropic76.2%Max 推論
27claude-opus-5-5-max-effortAnthropic76.0%Max 推論
28qwen3.8-flash-nextAlibaba75.9%情報源のデフォルト構成
29claude-opus-4-8-max-effortAnthropic75.8%Max 推論
30deepseek-v4-flash-vision-expDeepSeek75.7%情報源のデフォルト構成
31deepseek-v4.1-flash-maxDeepSeek75.6%情報源のデフォルト構成
32smaug-miniAbacus.AI75.5%情報源のデフォルト構成
33deepseek-v4-pro-0813DeepSeek74.9%情報源のデフォルト構成
評価の限界とデータの出典

2 項目の平均点は組み合わせの成績を測るもので、Language 単項の成績としてはならない。公式ページで分類を切り替えたり、微調整モデルを含めるかで、スコアと順位は変わる。組織の参加者 Abacus.AI は Smaug モデルも開発しており、その独自成績は他の独立した情報源による補完が必要である。

データのライセンス:Apache 2.0

項目別成績は LiveBench が発表し、News は上記二類を等権で集計して並べ替える。両者の平均と News コンセンサススコアは異なる尺度を用いるため、直接加算できない。