本文へ移動
評価の出典

Arena WebDev

LMArena · 同じく人間のブラインド選択で、ウェブが使いやすいか、納品できるかを競う。

公式の評価
News での扱い順位に反映
根拠の配分2.4%
元データの時点09/30 08:00
最後に同期に成功10/01 20:05

何をどう測るか

公式発表スナップショットのWebDev総合ランキングのみを採用し、arena.aiのリアルタイムページは取得しない。Textと合わせて一つのArenaファミリー票を構成する。

この根拠の使い方

コーディングとデザインの予算のうち2.4%。審美カテゴリでウェブ作品の好みを測るもので、コードの正答率とは異なる。Arenaの他のタスクと証拠ファミリーを共有する。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1claude-opus-5.5-maxAnthropic1,817.8Max 推論
2gpt-6-astra-maxOpenAI1,789.1Max 推論
3gpt-6.1-sol-max—1,758.7Max 推論
4claude-fable-5.1-maxAnthropic1,750.7Max 推論
5claude-sonnet-5.5-highanthropic1,708.7High 推論
6claude-opus-5-maxAnthropic1,693.7Max 推論
7gpt-6-sol-maxOpenAI1,689.3Max 推論
8gemini-4-argon-highGoogle1,679High 推論
9qwen3.8-maxAlibaba1,671.2情報源のデフォルト構成
10qwen3.8-max-0902Alibaba1,669.7情報源のデフォルト構成
12kimi-k3-maxMoonshot AI1,657.8情報源のデフォルト構成
13muse-spark-1.3-maxMeta1,655.4Max 推論
14qwen3.8-flash-nextAlibaba1,637.8情報源のデフォルト構成
15grok-4.7-xhighxAI1,636.3xHigh 推論
16hy4-previewTencent1,633.2情報源のデフォルト構成
17claude-fable-5-highAnthropic1,625.6High 推論
19glm-5.3-maxZ.ai1,622情報源のデフォルト構成
20grok-4.6-highxAI1,620.1High 推論
21deepseek-v4.1-flash-maxDeepSeek1,620情報源のデフォルト構成
22gpt-5.6-sol-xhigh (codex-harness)OpenAI1,619.3xHigh 推論 · codex-harness
23mimo-v2.6-proXiaomi1,618.5情報源のデフォルト構成
24glm-5.3-flashZ.ai1,614.8情報源のデフォルト構成
25glm-5.2-maxZ.ai1,604.6情報源のデフォルト構成
26gemini-3.7-flash-highGoogle1,592.2High 推論
27qwen3.8-27bAlibaba1,590.4情報源のデフォルト構成
28gemini-3.8-flash-highGoogle1,582.7High 推論
29deepseek-v4-pro-high-20260813DeepSeek1,582.3情報源のデフォルト構成
30gpt-6-luna-maxOpenAI1,581.9Max 推論
31deepseek-v4-flash-highDeepSeek1,581情報源のデフォルト構成
32step-5-preview-highStepFun1,569.6情報源のデフォルト構成
評価の限界とデータの出典

Text との間に選好構成概念の相関がある。

データのライセンス:CC BY 4.0

スコアは LMArena が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。