評価の出典公式の評価
Arena Creative Writing
LMArena · 人間が物語、詩、その他の創作的表現をブラインドで選び、作品が読者を引きつけるかを観察する。
News での扱い順位に反映
根拠の配分5%
元データの時点09/30 08:00
最後に同期に成功10/01 20:05
何をどう測るか
公式データセットtext_style_controlのcreative_writing分類を読み、スタイル制御後のBradley–Terryスコアと信頼区間を採用する。全体テキストや職業ライティング分類の成績は借用しない。
この根拠の使い方
正式に採点。従来の人間の嗜好10%から5%を分割し、全体テキストは5%を維持し、総予算は増やさない。他の Arena タスクと証拠ファミリーを共有する。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | gemini-4-argon-highGoogle | 1,521.8 | High 推論 |
| 2 | claude-opus-5.5-highAnthropic | 1,515 | High 推論 |
| 3 | claude-fable-5-highAnthropic | 1,503 | High 推論 |
| 4 | claude-opus-4-6-highAnthropic | 1,501.2 | High 推論 |
| 5 | gemini-3.7-flash-highGoogle | 1,495.6 | High 推論 |
| 6 | claude-opus-4-7-highAnthropic | 1,489.3 | High 推論 |
| 7 | gemini-3-proGoogle | 1,484.4 | 情報源のデフォルト構成 |
| 8 | gemini-3.8-flash-highGoogle | 1,484.4 | High 推論 |
| 10 | claude-fable-5.1-maxAnthropic | 1,481.6 | Max 推論 |
| 11 | gemini-3.1-pro-previewGoogle | 1,480.3 | 情報源のデフォルト構成 |
| 14 | gemini-3.6-flash-highGoogle | 1,471.8 | High 推論 |
| 15 | claude-opus-5-maxAnthropic | 1,469.5 | Max 推論 |
| 16 | claude-opus-4-8-highAnthropic | 1,469.4 | High 推論 |
| 18 | claude-opus-4-5-20251101-high-32kAnthropic | 1,469.1 | High 推論 · 32k |
| 19 | gpt-5.6-sol-xhighOpenAI | 1,468.9 | xHigh 推論 |
| 20 | qwen3.8-maxAlibaba | 1,467.8 | 情報源のデフォルト構成 |
| 21 | muse-sparkMeta | 1,464.9 | 情報源のデフォルト構成 |
| 22 | gemini-3.5-flash-highGoogle | 1,463.8 | High 推論 |
| 24 | grok-4.20-beta1xAI | 1,462.5 | 情報源のデフォルト構成 |
| 26 | kimi-k3-maxMoonshot AI | 1,459.7 | 情報源のデフォルト構成 |
| 27 | muse-spark-1.3-maxMeta | 1,458.6 | Max 推論 |
| 28 | gemini-3-flashGoogle | 1,456.5 | 情報源のデフォルト構成 |
| 29 | gpt-5.5-instantOpenAI | 1,456.3 | 情報源のデフォルト構成 |
| 30 | glm-5.2-maxZ.ai | 1,455.3 | 情報源のデフォルト構成 |
| 31 | glm-5.3-maxZ.ai | 1,455.3 | 情報源のデフォルト構成 |
| 33 | muse-spark-1.2 (xHigh)Meta | 1,452.7 | xHigh 推論 |
| 34 | gpt-5.5-highOpenAI | 1,451.4 | High 推論 |
| 35 | grok-4.5xAI | 1,450.9 | 情報源のデフォルト構成 |
| 36 | claude-sonnet-4-5-20250929-high-32kAnthropic | 1,450.1 | High 推論 · 32k |
| 37 | claude-sonnet-4-6Anthropic | 1,449.4 | 情報源のデフォルト構成 |
評価の限界とデータの出典
オープンユーザープロンプトは分類器で分類され、すべてが長編小説や中国語創作ではない。投票には個人の選好が含まれる。Arena全体のテキストおよび職業ライティング分類と重複し、追加の独立機関とはできない。
データのライセンス:CC BY 4.0 · Arena 公式 Hugging Face leaderboard-dataset。帰属表示、出典リンクを保持し、集計の変更を説明。
スコアは LMArena が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。