本文へ移動
評価の出典

Longform Writing

EQ-Bench · 長編物語の一貫性と完全性

公式の評価
News での扱い順位に反映
根拠の配分2.4%
元データの時点09/24 15:57
最後に同期に成功10/01 20:05

何をどう測るか

overall_score_100を採用。八章からなる長文の筋と表現の評価で、審査員の選好は限界として開示する。

この根拠の使い方

正式に採点。2つのライティングランキングを合わせて6%を占め、問題数やモデル数に応じてウェイトを増やさない。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1claude-opus-5Anthropic86.3情報源のデフォルト構成
2claude-fable-5-1Anthropic85.3情報源のデフォルト構成
3claude-opus-5-5Anthropic84.6情報源のデフォルト構成
4claude-fable-5Anthropic83情報源のデフォルト構成
4grok-4.7xAI83情報源のデフォルト構成
6gpt-6-solOpenAI82.8情報源のデフォルト構成
6gpt-6-astraOpenAI82.8情報源のデフォルト構成
6muse-spark-1.3Meta82.8情報源のデフォルト構成
9aion-3.5aion-labs82.1情報源のデフォルト構成
10claude-opus-4-7Anthropic81.8情報源のデフォルト構成
10GLM-5.3Z.ai81.8情報源のデフォルト構成
12gpt-5.6-solOpenAI81.7情報源のデフォルト構成
13muse-spark-1.2Meta81.5情報源のデフォルト構成
14claude-opus-4-8Anthropic80.8情報源のデフォルト構成
15ox-alpha—79.9情報源のデフォルト構成
15claude-sonnet-4-6Anthropic79.9情報源のデフォルト構成
17kimi-k3Moonshot AI79.6情報源のデフォルト構成
18moonshotai/Kimi-K2.6Moonshot AI78.5情報源のデフォルト構成
19claude-sonnet-5Anthropic78.3情報源のデフォルト構成
19gpt-5.4OpenAI78.3情報源のデフォルト構成
21gpt-5.5OpenAI78.2情報源のデフォルト構成
22gpt-5.6-terraOpenAI78情報源のデフォルト構成
23zai-org/GLM-5.2Z.ai77.9情報源のデフォルト構成
24claude-opus-4-6Anthropic77.7情報源のデフォルト構成
25gemini-3.8-flashGoogle76.8情報源のデフォルト構成
26deepseek-ai/DeepSeek-V4-ProDeepSeek75.6情報源のデフォルト構成
27gpt-5.6-lunaOpenAI75.5情報源のデフォルト構成
28moonshotai/Kimi-K2.5Moonshot AI74.9情報源のデフォルト構成
29Altworld/Hemmingway-1—74.2情報源のデフォルト構成
30deepseek-v4.1-flashDeepSeek74情報源のデフォルト構成
評価の限界とデータの出典

主に英語ライティングで、モデル審判に依存する。同一審判と関連タスクは予算を共有し、中国語の文章力を示すものではない。

データのライセンス:MIT · EQ-bench-site README メタデータの声明

スコアは EQ-Bench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。