Skip to content
Evaluation sources

LiveBench Global Average

LiveBench · The question bank is continually replaced and answers can be checked automatically. Used to see whether a model still holds up after the questions change.

Official evaluation
In NewsCross-reference
Evidence budgetNot scored
Upstream data as of09/30 03:01
Last synced10/01 20:05

What it measures, and how

Keeps the official Global Average as an overall reference; official scores use non-overlapping specialist tasks.

How this evidence is used

The original Global Average is kept for reference; official votes switch to non-overlapping specialist tasks.

Results

Under fixed rules, each public model uses one representative configuration. Anonymous test variants are not shown, original leaderboard ranks are kept, and each item lists at most 30.

Rank thereModel thereRaw scoreRepresentative configuration
1claude-fable-5-1-max-effortAnthropic83.4%Max reasoning
2claude-opus-5-5-max-effortAnthropic83.2%Max reasoning
3claude-fable-5-max-effortAnthropic83.0%Max reasoning
4gpt-6-astra-maxOpenAI82.2%Max reasoning
6gpt-6.1-sol-max—81.6%Max reasoning
7muse-spark-1.3-xhighMeta81.6%xHigh reasoning
9deepseek-v4.1-flash-maxDeepSeek81.1%Source default configuration
10gpt-5.6-sol-maxOpenAI81.1%Max reasoning
11gpt-5.5-xhighOpenAI80.2%xHigh reasoning
12claude-opus-5-max-effortAnthropic80.1%Max reasoning
13smaug-agenticAbacus.AI79.5%Source default configuration
14gpt-6-sol-maxOpenAI79.2%Max reasoning
15kimi-k3Moonshot AI79.2%Source default configuration
16gemini-3.7-flash-highGoogle78.8%High reasoning
17qwen3.8-maxAlibaba78.5%Source default configuration
18grok-4.6xAI78.0%Source default configuration
19gpt-5.4-xhighOpenAI78.0%xHigh reasoning
20muse-spark-1.2-xhighMeta78.0%xHigh reasoning
21gpt-5.6-terra-maxOpenAI77.9%Max reasoning
23deepseek-v4-pro-0813DeepSeek77.4%Source default configuration
24smaug-flashAbacus.AI77.4%Source default configuration
25grok-4.7-xhighxAI77.4%xHigh reasoning
26gemini-3.1-pro-preview-highGoogle77.0%High reasoning
27smaug-miniAbacus.AI76.9%Source default configuration
28deepseek-v4-flash-vision-expDeepSeek76.8%Source default configuration
29claude-opus-4-7-xhigh-effortAnthropic76.5%xHigh reasoning
30claude-opus-4-8-max-effortAnthropic76.2%Max reasoning
31qwen3.8-flash-nextAlibaba76.2%Source default configuration
32glm-5.3Z.ai76.1%Source default configuration
33claude-sonnet-5-xhigh-effortAnthropic76.0%xHigh reasoning
Limits and data attribution

The overall average dilutes changes in specific abilities; it is for cross-reference only and is not double-counted. Organisational participant Abacus.AI also develops the Smaug model, so its exclusive results need supplementing from other independent sources.

Data licence: Apache 2.0

Scores published by LiveBench. Raw scores and the News consensus score use different scales and cannot be added directly.