本文へ移動
評価の出典

Creative Writing v3

EQ-Bench · 短編創作と表現

公式の評価
News での扱い順位に反映
根拠の配分3.6%
元データの時点09/24 15:57
最後に同期に成功10/01 20:05

何をどう測るか

公式CSVはデータスクリプトに埋め込まれ、Eloを採用。Sonnet 4.6が勝敗を判定し、スタイル、重複率、rubricは重複して票を数えない。

この根拠の使い方

正式に採点。2つのライティングランキングを合わせて6%を占め、問題数やモデル数に応じてウェイトを増やさない。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gpt-6-astraOpenAI2,173.3情報源のデフォルト構成
2claude-fable-5-1Anthropic2,162情報源のデフォルト構成
3claude-opus-5Anthropic2,132.6情報源のデフォルト構成
4gpt-6-solOpenAI2,124.7情報源のデフォルト構成
5kimi-k3Moonshot AI2,082.3情報源のデフォルト構成
6GLM-5.3Z.ai2,075情報源のデフォルト構成
7claude-opus-5-5Anthropic2,050.1情報源のデフォルト構成
8grok-4.7xAI2,006.7情報源のデフォルト構成
9ox-alpha—1,971.7情報源のデフォルト構成
10gpt-5.6-solOpenAI1,971.6情報源のデフォルト構成
11claude-fable-5Anthropic1,943.1情報源のデフォルト構成
12aion-3.5aion-labs1,929.3情報源のデフォルト構成
13muse-spark-1.1Meta1,927.1情報源のデフォルト構成
14claude-opus-4-7Anthropic1,914.3情報源のデフォルト構成
15Altworld/Hemmingway-1—1,906.4情報源のデフォルト構成
16muse-spark-1.3Meta1,905.9情報源のデフォルト構成
17gpt-5.6-terraOpenAI1,854.9情報源のデフォルト構成
18gpt-5.5OpenAI1,843.9情報源のデフォルト構成
19Qwen/Qwen3.8-2.4T-A95BAlibaba1,842.5情報源のデフォルト構成
20muse-spark-1.2Meta1,840.4情報源のデフォルト構成
21claude-opus-4-8Anthropic1,839.8情報源のデフォルト構成
22gpt-5.4OpenAI1,839.7情報源のデフォルト構成
23gpt-5.6-lunaOpenAI1,828.7情報源のデフォルト構成
24claude-sonnet-4-6Anthropic1,810.4情報源のデフォルト構成
25claude-opus-4-6Anthropic1,809.1情報源のデフォルト構成
26meta-models/Muse-Glimmer-30BMeta1,798.3情報源のデフォルト構成
27claude-sonnet-5Anthropic1,794情報源のデフォルト構成
28space-bunny-alphastealth1,784.3情報源のデフォルト構成
29zai-org/GLM-5.2Z.ai1,756.5情報源のデフォルト構成
30gemini-3.8-flashGoogle1,747.9情報源のデフォルト構成
評価の限界とデータの出典

主に英語ライティングで、モデル審判に依存する。同一審判と関連タスクは予算を共有し、中国語の文章力を示すものではない。

データのライセンス:MIT · EQ-bench-site README メタデータの声明

スコアは EQ-Bench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。