Skip to content
Evaluation sources

Longform Writing

EQ-Bench · Coherence and completeness of long-form stories

Official evaluation
In NewsRanked
Evidence budget2.4%
Upstream data as of09/24 15:57
Last synced10/01 20:05

What it measures, and how

Uses overall_score_100; scoring of plot and expression in an eight-chapter long text, with judge preference disclosed as a limitation.

How this evidence is used

Officially scored; the two writing leaderboards together account for 6%, with no added weight by question or model count.

Results

Under fixed rules, each public model uses one representative configuration. Anonymous test variants are not shown, original leaderboard ranks are kept, and each item lists at most 30.

Rank thereModel thereRaw scoreRepresentative configuration
1claude-opus-5Anthropic86.3Source default configuration
2claude-fable-5-1Anthropic85.3Source default configuration
3claude-opus-5-5Anthropic84.6Source default configuration
4claude-fable-5Anthropic83Source default configuration
4grok-4.7xAI83Source default configuration
6gpt-6-solOpenAI82.8Source default configuration
6gpt-6-astraOpenAI82.8Source default configuration
6muse-spark-1.3Meta82.8Source default configuration
9aion-3.5aion-labs82.1Source default configuration
10claude-opus-4-7Anthropic81.8Source default configuration
10GLM-5.3Z.ai81.8Source default configuration
12gpt-5.6-solOpenAI81.7Source default configuration
13muse-spark-1.2Meta81.5Source default configuration
14claude-opus-4-8Anthropic80.8Source default configuration
15ox-alpha—79.9Source default configuration
15claude-sonnet-4-6Anthropic79.9Source default configuration
17kimi-k3Moonshot AI79.6Source default configuration
18moonshotai/Kimi-K2.6Moonshot AI78.5Source default configuration
19claude-sonnet-5Anthropic78.3Source default configuration
19gpt-5.4OpenAI78.3Source default configuration
21gpt-5.5OpenAI78.2Source default configuration
22gpt-5.6-terraOpenAI78Source default configuration
23zai-org/GLM-5.2Z.ai77.9Source default configuration
24claude-opus-4-6Anthropic77.7Source default configuration
25gemini-3.8-flashGoogle76.8Source default configuration
26deepseek-ai/DeepSeek-V4-ProDeepSeek75.6Source default configuration
27gpt-5.6-lunaOpenAI75.5Source default configuration
28moonshotai/Kimi-K2.5Moonshot AI74.9Source default configuration
29Altworld/Hemmingway-1—74.2Source default configuration
30deepseek-v4.1-flashDeepSeek74Source default configuration
Limits and data attribution

Mainly English writing, relying on a model judge; the same judge and related tasks share a budget and do not represent Chinese prose quality.

Data licence: MIT · EQ-bench-site README metadata statement

Scores published by EQ-Bench. Raw scores and the News consensus score use different scales and cannot be added directly.