評価の出典公式の評価
Longform Writing
EQ-Bench · 長編物語の一貫性と完全性
News での扱い順位に反映
根拠の配分2.4%
元データの時点09/24 15:57
最後に同期に成功10/01 20:05
何をどう測るか
overall_score_100を採用。八章からなる長文の筋と表現の評価で、審査員の選好は限界として開示する。
この根拠の使い方
正式に採点。2つのライティングランキングを合わせて6%を占め、問題数やモデル数に応じてウェイトを増やさない。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | claude-opus-5Anthropic | 86.3 | 情報源のデフォルト構成 |
| 2 | claude-fable-5-1Anthropic | 85.3 | 情報源のデフォルト構成 |
| 3 | claude-opus-5-5Anthropic | 84.6 | 情報源のデフォルト構成 |
| 4 | claude-fable-5Anthropic | 83 | 情報源のデフォルト構成 |
| 4 | grok-4.7xAI | 83 | 情報源のデフォルト構成 |
| 6 | gpt-6-solOpenAI | 82.8 | 情報源のデフォルト構成 |
| 6 | gpt-6-astraOpenAI | 82.8 | 情報源のデフォルト構成 |
| 6 | muse-spark-1.3Meta | 82.8 | 情報源のデフォルト構成 |
| 9 | aion-3.5aion-labs | 82.1 | 情報源のデフォルト構成 |
| 10 | claude-opus-4-7Anthropic | 81.8 | 情報源のデフォルト構成 |
| 10 | GLM-5.3Z.ai | 81.8 | 情報源のデフォルト構成 |
| 12 | gpt-5.6-solOpenAI | 81.7 | 情報源のデフォルト構成 |
| 13 | muse-spark-1.2Meta | 81.5 | 情報源のデフォルト構成 |
| 14 | claude-opus-4-8Anthropic | 80.8 | 情報源のデフォルト構成 |
| 15 | ox-alpha— | 79.9 | 情報源のデフォルト構成 |
| 15 | claude-sonnet-4-6Anthropic | 79.9 | 情報源のデフォルト構成 |
| 17 | kimi-k3Moonshot AI | 79.6 | 情報源のデフォルト構成 |
| 18 | moonshotai/Kimi-K2.6Moonshot AI | 78.5 | 情報源のデフォルト構成 |
| 19 | claude-sonnet-5Anthropic | 78.3 | 情報源のデフォルト構成 |
| 19 | gpt-5.4OpenAI | 78.3 | 情報源のデフォルト構成 |
| 21 | gpt-5.5OpenAI | 78.2 | 情報源のデフォルト構成 |
| 22 | gpt-5.6-terraOpenAI | 78 | 情報源のデフォルト構成 |
| 23 | zai-org/GLM-5.2Z.ai | 77.9 | 情報源のデフォルト構成 |
| 24 | claude-opus-4-6Anthropic | 77.7 | 情報源のデフォルト構成 |
| 25 | gemini-3.8-flashGoogle | 76.8 | 情報源のデフォルト構成 |
| 26 | deepseek-ai/DeepSeek-V4-ProDeepSeek | 75.6 | 情報源のデフォルト構成 |
| 27 | gpt-5.6-lunaOpenAI | 75.5 | 情報源のデフォルト構成 |
| 28 | moonshotai/Kimi-K2.5Moonshot AI | 74.9 | 情報源のデフォルト構成 |
| 29 | Altworld/Hemmingway-1— | 74.2 | 情報源のデフォルト構成 |
| 30 | deepseek-v4.1-flashDeepSeek | 74 | 情報源のデフォルト構成 |
評価の限界とデータの出典
主に英語ライティングで、モデル審判に依存する。同一審判と関連タスクは予算を共有し、中国語の文章力を示すものではない。
データのライセンス:MIT · EQ-bench-site README メタデータの声明
スコアは EQ-Bench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。