本文へ移動
評価の出典

Arena Creative Writing

LMArena · 人間が物語、詩、その他の創作的表現をブラインドで選び、作品が読者を引きつけるかを観察する。

公式の評価
News での扱い順位に反映
根拠の配分5%
元データの時点09/30 08:00
最後に同期に成功10/01 20:05

何をどう測るか

公式データセットtext_style_controlのcreative_writing分類を読み、スタイル制御後のBradley–Terryスコアと信頼区間を採用する。全体テキストや職業ライティング分類の成績は借用しない。

この根拠の使い方

正式に採点。従来の人間の嗜好10%から5%を分割し、全体テキストは5%を維持し、総予算は増やさない。他の Arena タスクと証拠ファミリーを共有する。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gemini-4-argon-highGoogle1,521.8High 推論
2claude-opus-5.5-highAnthropic1,515High 推論
3claude-fable-5-highAnthropic1,503High 推論
4claude-opus-4-6-highAnthropic1,501.2High 推論
5gemini-3.7-flash-highGoogle1,495.6High 推論
6claude-opus-4-7-highAnthropic1,489.3High 推論
7gemini-3-proGoogle1,484.4情報源のデフォルト構成
8gemini-3.8-flash-highGoogle1,484.4High 推論
10claude-fable-5.1-maxAnthropic1,481.6Max 推論
11gemini-3.1-pro-previewGoogle1,480.3情報源のデフォルト構成
14gemini-3.6-flash-highGoogle1,471.8High 推論
15claude-opus-5-maxAnthropic1,469.5Max 推論
16claude-opus-4-8-highAnthropic1,469.4High 推論
18claude-opus-4-5-20251101-high-32kAnthropic1,469.1High 推論 · 32k
19gpt-5.6-sol-xhighOpenAI1,468.9xHigh 推論
20qwen3.8-maxAlibaba1,467.8情報源のデフォルト構成
21muse-sparkMeta1,464.9情報源のデフォルト構成
22gemini-3.5-flash-highGoogle1,463.8High 推論
24grok-4.20-beta1xAI1,462.5情報源のデフォルト構成
26kimi-k3-maxMoonshot AI1,459.7情報源のデフォルト構成
27muse-spark-1.3-maxMeta1,458.6Max 推論
28gemini-3-flashGoogle1,456.5情報源のデフォルト構成
29gpt-5.5-instantOpenAI1,456.3情報源のデフォルト構成
30glm-5.2-maxZ.ai1,455.3情報源のデフォルト構成
31glm-5.3-maxZ.ai1,455.3情報源のデフォルト構成
33muse-spark-1.2 (xHigh)Meta1,452.7xHigh 推論
34gpt-5.5-highOpenAI1,451.4High 推論
35grok-4.5xAI1,450.9情報源のデフォルト構成
36claude-sonnet-4-5-20250929-high-32kAnthropic1,450.1High 推論 · 32k
37claude-sonnet-4-6Anthropic1,449.4情報源のデフォルト構成
評価の限界とデータの出典

オープンユーザープロンプトは分類器で分類され、すべてが長編小説や中国語創作ではない。投票には個人の選好が含まれる。Arena全体のテキストおよび職業ライティング分類と重複し、追加の独立機関とはできない。

データのライセンス:CC BY 4.0 · Arena 公式 Hugging Face leaderboard-dataset。帰属表示、出典リンクを保持し、集計の変更を説明。

スコアは LMArena が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。