評価の出典公式の評価
Arena Text Style-Controlled
LMArena · 人間が匿名で回答を一対一比較し、どちらをより読みたいかを見る。選択式問題では見えない全体的な体験を補う。
News での扱い順位に反映
根拠の配分5%
元データの時点09/30 08:00
最後に同期に成功10/01 20:05
何をどう測るか
公式発表スナップショットのText Overall style-controlled主ランキングのみを採用し、arena.aiのリアルタイムページは取得しない。
この根拠の使い方
人間の偏好予算 10% は全体 5% と創作 5% に分かれる。Arena のプログラミングと視覚評価とは依然として証拠ファミリーを共有する。新旧は公式成績データの時間で判断する。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | gemini-4-argon-highGoogle | 1,524.8 | High 推論 |
| 2 | claude-opus-4-6-highAnthropic | 1,505.5 | High 推論 |
| 3 | claude-fable-5-highAnthropic | 1,504.9 | High 推論 |
| 4 | claude-opus-5.5-highAnthropic | 1,504 | High 推論 |
| 5 | claude-opus-4-7-highAnthropic | 1,501.7 | High 推論 |
| 6 | claude-fable-5.1-maxAnthropic | 1,501.2 | Max 推論 |
| 8 | muse-spark-1.3-maxMeta | 1,494.7 | Max 推論 |
| 10 | muse-spark-1.2 (xHigh)Meta | 1,494.2 | xHigh 推論 |
| 11 | gemini-3.8-flash-highGoogle | 1,494.1 | High 推論 |
| 12 | muse-spark-1.1Meta | 1,491.8 | 情報源のデフォルト構成 |
| 14 | claude-opus-5-maxAnthropic | 1,489.1 | Max 推論 |
| 15 | muse-sparkMeta | 1,489.1 | 情報源のデフォルト構成 |
| 16 | gemini-3.7-flash-highGoogle | 1,488.3 | High 推論 |
| 17 | kimi-k3-maxMoonshot AI | 1,488 | 情報源のデフォルト構成 |
| 18 | gemini-3.1-pro-previewGoogle | 1,487 | 情報源のデフォルト構成 |
| 19 | gemini-3-proGoogle | 1,485.5 | 情報源のデフォルト構成 |
| 20 | gpt-5.6-sol-xhighOpenAI | 1,483.8 | xHigh 推論 |
| 21 | gemini-3.6-flash-highGoogle | 1,483.1 | High 推論 |
| 22 | gpt-5.5-highOpenAI | 1,481.3 | High 推論 |
| 23 | claude-opus-4-8-highAnthropic | 1,481.3 | High 推論 |
| 24 | qwen3.8-maxAlibaba | 1,480.9 | 情報源のデフォルト構成 |
| 25 | mimo-v2.6-proXiaomi | 1,479.6 | 情報源のデフォルト構成 |
| 26 | glm-5.3-maxZ.ai | 1,479.4 | 情報源のデフォルト構成 |
| 27 | gemini-3.5-flash-highGoogle | 1,477.1 | High 推論 |
| 30 | gpt-6-astra-maxOpenAI | 1,476.2 | Max 推論 |
| 31 | gpt-5.2-chat-latest-20260210OpenAI | 1,475.8 | 情報源のデフォルト構成 |
| 32 | glm-5.2-maxZ.ai | 1,475.4 | 情報源のデフォルト構成 |
| 33 | gpt-5.4-highOpenAI | 1,475.2 | High 推論 |
| 34 | grok-4.20-beta1xAI | 1,474.6 | 情報源のデフォルト構成 |
| 35 | qwen3.7-max-previewAlibaba | 1,474.6 | 情報源のデフォルト構成 |
評価の限界とデータの出典
人間の選好はスタイル、ユーザー構成、プロンプト分布に左右される。全体と創作カテゴリでは投票が重複し、既存の人間選好の予算を共有するため、二つの独立した評価機関とはみなさない。
データのライセンス:CC BY 4.0
スコアは LMArena が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。