本文へ移動
評価の出典

Arena Vision Style-Controlled

LMArena · 人間が画像付き回答をブラインドで選び、視覚理解の実際の体験を観察する。

公式の評価
News での扱い順位に反映
根拠の配分6%
元データの時点09/28 08:00
最後に同期に成功10/01 20:05

何をどう測るか

公式データセットvision_style_controlのoverallのみを読み取る。画像生成や画像編集は含まない。

この根拠の使い方

視覚予算6%。依然として人間の選好の証拠であり、厳密な画像精度と同一視はできない。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1claude-fable-5-highAnthropic1,310.1High 推論
2qwen3.8-maxAlibaba1,300.9情報源のデフォルト構成
3claude-opus-4-6-highAnthropic1,299.4High 推論
5claude-opus-4-7-highAnthropic1,298.3High 推論
6gemini-3.7-flash-highGoogle1,295High 推論
8muse-sparkMeta1,293.9情報源のデフォルト構成
9muse-spark-1.2 (xHigh)Meta1,292.4xHigh 推論
10muse-spark-1.3-maxMeta1,289.6Max 推論
11gemini-3-proGoogle1,289.1情報源のデフォルト構成
12claude-opus-5-highAnthropic1,288.8High 推論
13gpt-5.6-sol-xhighOpenAI1,286.8xHigh 推論
14claude-fable-5.1-maxAnthropic1,286.6Max 推論
16claude-opus-4-8-highAnthropic1,286.5High 推論
17gemini-3.8-flash-highGoogle1,286.3High 推論
18gpt-6-astra-maxOpenAI1,285.1Max 推論
19gemini-3.5-flash-highGoogle1,284.5High 推論
20gpt-5.4-highOpenAI1,284.1High 推論
22glm-5.3-flashZ.ai1,281.2情報源のデフォルト構成
23gpt-5.5-highOpenAI1,281High 推論
24gemini-3.6-flash-highGoogle1,280.1High 推論
25gemini-3.1-pro-previewGoogle1,279.6情報源のデフォルト構成
26muse-spark-1.1Meta1,279.5情報源のデフォルト構成
28grok-4.5xAI1,278.7情報源のデフォルト構成
30gpt-5.2-chat-latest-20260210OpenAI1,278.3情報源のデフォルト構成
31gpt-5.5-instantOpenAI1,276.1情報源のデフォルト構成
32claude-sonnet-4-6Anthropic1,275.4情報源のデフォルト構成
33gemini-3-flashGoogle1,273情報源のデフォルト構成
34gpt-5.6-terra-xhighOpenAI1,267.9xHigh 推論
35qwen3.7-plusAlibaba1,265.8情報源のデフォルト構成
36kimi-k2.6Moonshot AI1,264.8情報源のデフォルト構成
評価の限界とデータの出典

人間の選好はスタイル、ユーザー構成、プロンプト分布に左右される。全体と創作カテゴリでは投票が重複し、既存の人間選好の予算を共有するため、二つの独立した評価機関とはみなさない。

データのライセンス:CC BY 4.0

スコアは LMArena が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。