本文へ移動
評価の出典

Arena Text Style-Controlled

LMArena · 人間が匿名で回答を一対一比較し、どちらをより読みたいかを見る。選択式問題では見えない全体的な体験を補う。

公式の評価
News での扱い順位に反映
根拠の配分5%
元データの時点09/30 08:00
最後に同期に成功10/01 20:05

何をどう測るか

公式発表スナップショットのText Overall style-controlled主ランキングのみを採用し、arena.aiのリアルタイムページは取得しない。

この根拠の使い方

人間の偏好予算 10% は全体 5% と創作 5% に分かれる。Arena のプログラミングと視覚評価とは依然として証拠ファミリーを共有する。新旧は公式成績データの時間で判断する。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1gemini-4-argon-highGoogle1,524.8High 推論
2claude-opus-4-6-highAnthropic1,505.5High 推論
3claude-fable-5-highAnthropic1,504.9High 推論
4claude-opus-5.5-highAnthropic1,504High 推論
5claude-opus-4-7-highAnthropic1,501.7High 推論
6claude-fable-5.1-maxAnthropic1,501.2Max 推論
8muse-spark-1.3-maxMeta1,494.7Max 推論
10muse-spark-1.2 (xHigh)Meta1,494.2xHigh 推論
11gemini-3.8-flash-highGoogle1,494.1High 推論
12muse-spark-1.1Meta1,491.8情報源のデフォルト構成
14claude-opus-5-maxAnthropic1,489.1Max 推論
15muse-sparkMeta1,489.1情報源のデフォルト構成
16gemini-3.7-flash-highGoogle1,488.3High 推論
17kimi-k3-maxMoonshot AI1,488情報源のデフォルト構成
18gemini-3.1-pro-previewGoogle1,487情報源のデフォルト構成
19gemini-3-proGoogle1,485.5情報源のデフォルト構成
20gpt-5.6-sol-xhighOpenAI1,483.8xHigh 推論
21gemini-3.6-flash-highGoogle1,483.1High 推論
22gpt-5.5-highOpenAI1,481.3High 推論
23claude-opus-4-8-highAnthropic1,481.3High 推論
24qwen3.8-maxAlibaba1,480.9情報源のデフォルト構成
25mimo-v2.6-proXiaomi1,479.6情報源のデフォルト構成
26glm-5.3-maxZ.ai1,479.4情報源のデフォルト構成
27gemini-3.5-flash-highGoogle1,477.1High 推論
30gpt-6-astra-maxOpenAI1,476.2Max 推論
31gpt-5.2-chat-latest-20260210OpenAI1,475.8情報源のデフォルト構成
32glm-5.2-maxZ.ai1,475.4情報源のデフォルト構成
33gpt-5.4-highOpenAI1,475.2High 推論
34grok-4.20-beta1xAI1,474.6情報源のデフォルト構成
35qwen3.7-max-previewAlibaba1,474.6情報源のデフォルト構成
評価の限界とデータの出典

人間の選好はスタイル、ユーザー構成、プロンプト分布に左右される。全体と創作カテゴリでは投票が重複し、既存の人間選好の予算を共有するため、二つの独立した評価機関とはみなさない。

データのライセンス:CC BY 4.0

スコアは LMArena が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。