Creative Writing v3
EQ-Bench · Short-form creation and expression
What it measures, and how
The official CSV is embedded in the data script and uses Elo; Sonnet 4.6 judges wins and losses, and style, repetition rate and rubric are not counted twice.
How this evidence is used
Officially scored; the two writing leaderboards together account for 6%, with no added weight by question or model count.
Results
Under fixed rules, each public model uses one representative configuration. Anonymous test variants are not shown, original leaderboard ranks are kept, and each item lists at most 30.
| Rank there | Model there | Raw score | Representative configuration |
|---|---|---|---|
| 1 | gpt-6-astraOpenAI | 2,173.3 | Source default configuration |
| 2 | claude-fable-5-1Anthropic | 2,162 | Source default configuration |
| 3 | claude-opus-5Anthropic | 2,132.6 | Source default configuration |
| 4 | gpt-6-solOpenAI | 2,124.7 | Source default configuration |
| 5 | kimi-k3Moonshot AI | 2,082.3 | Source default configuration |
| 6 | GLM-5.3Z.ai | 2,075 | Source default configuration |
| 7 | claude-opus-5-5Anthropic | 2,050.1 | Source default configuration |
| 8 | grok-4.7xAI | 2,006.7 | Source default configuration |
| 9 | ox-alpha— | 1,971.7 | Source default configuration |
| 10 | gpt-5.6-solOpenAI | 1,971.6 | Source default configuration |
| 11 | claude-fable-5Anthropic | 1,943.1 | Source default configuration |
| 12 | aion-3.5aion-labs | 1,929.3 | Source default configuration |
| 13 | muse-spark-1.1Meta | 1,927.1 | Source default configuration |
| 14 | claude-opus-4-7Anthropic | 1,914.3 | Source default configuration |
| 15 | Altworld/Hemmingway-1— | 1,906.4 | Source default configuration |
| 16 | muse-spark-1.3Meta | 1,905.9 | Source default configuration |
| 17 | gpt-5.6-terraOpenAI | 1,854.9 | Source default configuration |
| 18 | gpt-5.5OpenAI | 1,843.9 | Source default configuration |
| 19 | Qwen/Qwen3.8-2.4T-A95BAlibaba | 1,842.5 | Source default configuration |
| 20 | muse-spark-1.2Meta | 1,840.4 | Source default configuration |
| 21 | claude-opus-4-8Anthropic | 1,839.8 | Source default configuration |
| 22 | gpt-5.4OpenAI | 1,839.7 | Source default configuration |
| 23 | gpt-5.6-lunaOpenAI | 1,828.7 | Source default configuration |
| 24 | claude-sonnet-4-6Anthropic | 1,810.4 | Source default configuration |
| 25 | claude-opus-4-6Anthropic | 1,809.1 | Source default configuration |
| 26 | meta-models/Muse-Glimmer-30BMeta | 1,798.3 | Source default configuration |
| 27 | claude-sonnet-5Anthropic | 1,794 | Source default configuration |
| 28 | space-bunny-alphastealth | 1,784.3 | Source default configuration |
| 29 | zai-org/GLM-5.2Z.ai | 1,756.5 | Source default configuration |
| 30 | gemini-3.8-flashGoogle | 1,747.9 | Source default configuration |
Limits and data attribution
Mainly English writing, relying on a model judge; the same judge and related tasks share a budget and do not represent Chinese prose quality.
Data licence: MIT · EQ-bench-site README metadata statement
Scores published by EQ-Bench. Raw scores and the News consensus score use different scales and cannot be added directly.