Longform Writing
EQ-Bench · Coherence and completeness of long-form stories
What it measures, and how
Uses overall_score_100; scoring of plot and expression in an eight-chapter long text, with judge preference disclosed as a limitation.
How this evidence is used
Officially scored; the two writing leaderboards together account for 6%, with no added weight by question or model count.
Results
Under fixed rules, each public model uses one representative configuration. Anonymous test variants are not shown, original leaderboard ranks are kept, and each item lists at most 30.
| Rank there | Model there | Raw score | Representative configuration |
|---|---|---|---|
| 1 | claude-opus-5Anthropic | 86.3 | Source default configuration |
| 2 | claude-fable-5-1Anthropic | 85.3 | Source default configuration |
| 3 | claude-opus-5-5Anthropic | 84.6 | Source default configuration |
| 4 | claude-fable-5Anthropic | 83 | Source default configuration |
| 4 | grok-4.7xAI | 83 | Source default configuration |
| 6 | gpt-6-solOpenAI | 82.8 | Source default configuration |
| 6 | gpt-6-astraOpenAI | 82.8 | Source default configuration |
| 6 | muse-spark-1.3Meta | 82.8 | Source default configuration |
| 9 | aion-3.5aion-labs | 82.1 | Source default configuration |
| 10 | claude-opus-4-7Anthropic | 81.8 | Source default configuration |
| 10 | GLM-5.3Z.ai | 81.8 | Source default configuration |
| 12 | gpt-5.6-solOpenAI | 81.7 | Source default configuration |
| 13 | muse-spark-1.2Meta | 81.5 | Source default configuration |
| 14 | claude-opus-4-8Anthropic | 80.8 | Source default configuration |
| 15 | ox-alpha— | 79.9 | Source default configuration |
| 15 | claude-sonnet-4-6Anthropic | 79.9 | Source default configuration |
| 17 | kimi-k3Moonshot AI | 79.6 | Source default configuration |
| 18 | moonshotai/Kimi-K2.6Moonshot AI | 78.5 | Source default configuration |
| 19 | claude-sonnet-5Anthropic | 78.3 | Source default configuration |
| 19 | gpt-5.4OpenAI | 78.3 | Source default configuration |
| 21 | gpt-5.5OpenAI | 78.2 | Source default configuration |
| 22 | gpt-5.6-terraOpenAI | 78 | Source default configuration |
| 23 | zai-org/GLM-5.2Z.ai | 77.9 | Source default configuration |
| 24 | claude-opus-4-6Anthropic | 77.7 | Source default configuration |
| 25 | gemini-3.8-flashGoogle | 76.8 | Source default configuration |
| 26 | deepseek-ai/DeepSeek-V4-ProDeepSeek | 75.6 | Source default configuration |
| 27 | gpt-5.6-lunaOpenAI | 75.5 | Source default configuration |
| 28 | moonshotai/Kimi-K2.5Moonshot AI | 74.9 | Source default configuration |
| 29 | Altworld/Hemmingway-1— | 74.2 | Source default configuration |
| 30 | deepseek-v4.1-flashDeepSeek | 74 | Source default configuration |
Limits and data attribution
Mainly English writing, relying on a model judge; the same judge and related tasks share a budget and do not represent Chinese prose quality.
Data licence: MIT · EQ-bench-site README metadata statement
Scores published by EQ-Bench. Raw scores and the News consensus score use different scales and cannot be added directly.