Skip to content
Evaluation sources

Creative Writing v3

EQ-Bench · Short-form creation and expression

Official evaluation
In NewsRanked
Evidence budget3.6%
Upstream data as of09/24 15:57
Last synced10/01 20:05

What it measures, and how

The official CSV is embedded in the data script and uses Elo; Sonnet 4.6 judges wins and losses, and style, repetition rate and rubric are not counted twice.

How this evidence is used

Officially scored; the two writing leaderboards together account for 6%, with no added weight by question or model count.

Results

Under fixed rules, each public model uses one representative configuration. Anonymous test variants are not shown, original leaderboard ranks are kept, and each item lists at most 30.

Rank thereModel thereRaw scoreRepresentative configuration
1gpt-6-astraOpenAI2,173.3Source default configuration
2claude-fable-5-1Anthropic2,162Source default configuration
3claude-opus-5Anthropic2,132.6Source default configuration
4gpt-6-solOpenAI2,124.7Source default configuration
5kimi-k3Moonshot AI2,082.3Source default configuration
6GLM-5.3Z.ai2,075Source default configuration
7claude-opus-5-5Anthropic2,050.1Source default configuration
8grok-4.7xAI2,006.7Source default configuration
9ox-alpha—1,971.7Source default configuration
10gpt-5.6-solOpenAI1,971.6Source default configuration
11claude-fable-5Anthropic1,943.1Source default configuration
12aion-3.5aion-labs1,929.3Source default configuration
13muse-spark-1.1Meta1,927.1Source default configuration
14claude-opus-4-7Anthropic1,914.3Source default configuration
15Altworld/Hemmingway-1—1,906.4Source default configuration
16muse-spark-1.3Meta1,905.9Source default configuration
17gpt-5.6-terraOpenAI1,854.9Source default configuration
18gpt-5.5OpenAI1,843.9Source default configuration
19Qwen/Qwen3.8-2.4T-A95BAlibaba1,842.5Source default configuration
20muse-spark-1.2Meta1,840.4Source default configuration
21claude-opus-4-8Anthropic1,839.8Source default configuration
22gpt-5.4OpenAI1,839.7Source default configuration
23gpt-5.6-lunaOpenAI1,828.7Source default configuration
24claude-sonnet-4-6Anthropic1,810.4Source default configuration
25claude-opus-4-6Anthropic1,809.1Source default configuration
26meta-models/Muse-Glimmer-30BMeta1,798.3Source default configuration
27claude-sonnet-5Anthropic1,794Source default configuration
28space-bunny-alphastealth1,784.3Source default configuration
29zai-org/GLM-5.2Z.ai1,756.5Source default configuration
30gemini-3.8-flashGoogle1,747.9Source default configuration
Limits and data attribution

Mainly English writing, relying on a model judge; the same judge and related tasks share a budget and do not represent Chinese prose quality.

Data licence: MIT · EQ-bench-site README metadata statement

Scores published by EQ-Bench. Raw scores and the News consensus score use different scales and cannot be added directly.