評価の出典公式の評価
Arena Vision Style-Controlled
LMArena · 人間が画像付き回答をブラインドで選び、視覚理解の実際の体験を観察する。
News での扱い順位に反映
根拠の配分6%
元データの時点09/28 08:00
最後に同期に成功10/01 20:05
何をどう測るか
公式データセットvision_style_controlのoverallのみを読み取る。画像生成や画像編集は含まない。
この根拠の使い方
視覚予算6%。依然として人間の選好の証拠であり、厳密な画像精度と同一視はできない。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | claude-fable-5-highAnthropic | 1,310.1 | High 推論 |
| 2 | qwen3.8-maxAlibaba | 1,300.9 | 情報源のデフォルト構成 |
| 3 | claude-opus-4-6-highAnthropic | 1,299.4 | High 推論 |
| 5 | claude-opus-4-7-highAnthropic | 1,298.3 | High 推論 |
| 6 | gemini-3.7-flash-highGoogle | 1,295 | High 推論 |
| 8 | muse-sparkMeta | 1,293.9 | 情報源のデフォルト構成 |
| 9 | muse-spark-1.2 (xHigh)Meta | 1,292.4 | xHigh 推論 |
| 10 | muse-spark-1.3-maxMeta | 1,289.6 | Max 推論 |
| 11 | gemini-3-proGoogle | 1,289.1 | 情報源のデフォルト構成 |
| 12 | claude-opus-5-highAnthropic | 1,288.8 | High 推論 |
| 13 | gpt-5.6-sol-xhighOpenAI | 1,286.8 | xHigh 推論 |
| 14 | claude-fable-5.1-maxAnthropic | 1,286.6 | Max 推論 |
| 16 | claude-opus-4-8-highAnthropic | 1,286.5 | High 推論 |
| 17 | gemini-3.8-flash-highGoogle | 1,286.3 | High 推論 |
| 18 | gpt-6-astra-maxOpenAI | 1,285.1 | Max 推論 |
| 19 | gemini-3.5-flash-highGoogle | 1,284.5 | High 推論 |
| 20 | gpt-5.4-highOpenAI | 1,284.1 | High 推論 |
| 22 | glm-5.3-flashZ.ai | 1,281.2 | 情報源のデフォルト構成 |
| 23 | gpt-5.5-highOpenAI | 1,281 | High 推論 |
| 24 | gemini-3.6-flash-highGoogle | 1,280.1 | High 推論 |
| 25 | gemini-3.1-pro-previewGoogle | 1,279.6 | 情報源のデフォルト構成 |
| 26 | muse-spark-1.1Meta | 1,279.5 | 情報源のデフォルト構成 |
| 28 | grok-4.5xAI | 1,278.7 | 情報源のデフォルト構成 |
| 30 | gpt-5.2-chat-latest-20260210OpenAI | 1,278.3 | 情報源のデフォルト構成 |
| 31 | gpt-5.5-instantOpenAI | 1,276.1 | 情報源のデフォルト構成 |
| 32 | claude-sonnet-4-6Anthropic | 1,275.4 | 情報源のデフォルト構成 |
| 33 | gemini-3-flashGoogle | 1,273 | 情報源のデフォルト構成 |
| 34 | gpt-5.6-terra-xhighOpenAI | 1,267.9 | xHigh 推論 |
| 35 | qwen3.7-plusAlibaba | 1,265.8 | 情報源のデフォルト構成 |
| 36 | kimi-k2.6Moonshot AI | 1,264.8 | 情報源のデフォルト構成 |
評価の限界とデータの出典
人間の選好はスタイル、ユーザー構成、プロンプト分布に左右される。全体と創作カテゴリでは投票が重複し、既存の人間選好の予算を共有するため、二つの独立した評価機関とはみなさない。
データのライセンス:CC BY 4.0
スコアは LMArena が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。