順位の決め方
複数の公開評価をまとめた順位の、根拠と方法。
0〜100
共通の根拠から、はっきりした順序を。
複数の公開評価をまとめ、完全な順位の中で既知の成績との矛盾をできるだけ減らします。総合ランキングと 4 つの分野別ランキングは、いずれも上位 30 位まで表示します。
コンセンサス指数は、順位を支える根拠の差を比べやすいよう 0〜100 に換算したもので、正答率でも能力差の百分率でもありません。支持が近ければ同点になることもありますが、順位はあくまで根拠全体で決まります。
- 01
まず、同じモデルかを確かめる
各ランキングのモデル名とバージョンをそろえます。同じモデルに複数の推論レベルがある場合は、事前に決めた規則で代表的な設定を一つだけ選び、最高点を選ぶことはしません。匿名のテスト用コードネームや、他のモデルを併用して課題をこなした成績は除外します。正式に公開された Preview 版は対象にします。
- 02
実際に測ったモデルどうしを比べる
同じ評価の中の実際の成績だけを比べます。双方が誤差を公開している場合、誤差の範囲内の小さな差は引き分けに近いものとして扱い、勝ち負けとはみなしません。測っていなければ、その比較はありません。
- 03
先に票の重みを決め、共通の見方をまとめる
各評価には事前に決めた配分があります。総合ランキングには少なくとも 3 つの評価機関、3 つの根拠ファミリー、3 つの個別評価が必要です。同じ出典の重複取得や表示の切り分けで票の重みが増えることはありません。
- 04
矛盾がいちばん少ない完全な順位を探す
評価どうしの意見はぶつかることがあります。共通の根拠の差し引きの票の重みに反する量が最も少ない順序を選び、表示用の指数は別に計算します。未評価を 0 点で埋めず、公開されていない成績を推測もしません。
総合テスト、人によるブラインド評価、個別評価をあわせて見る。
総合評価が 30%、人によるブラインド評価が 10%、個別評価が合計 60% を占めます。新しい評価は、公開された説明で重なりを確認してから該当する割合の中で配分します。欠けた割合を他の評価に回すことはしません。
- 総合評価30%AA Index
- 人間のブラインド選択10%Arena Text · Arena 創作ブラインド選考
- コーディングとデザイン12%Arena WebDev · DeepSWE v1.1 · TapTap Maker · LiveBench · プログラミング総合
- ライティングと表現9%LiveBench · 言語と指示 · Creative Writing v3 · Longform Writing
- 数学と推論12%LiveBench · 推論と数学 · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
- 知識と事実6%SimpleQA Verified · GPQA Diamond
- 視覚理解6%Arena Vision
- ツールとオフィス6%APEX-Agents 1.1 · τ³-Banking
- 中国語と多言語6%AA 中国語/多言語
- 業界専門タスク3%Vals Finance Agent
コーディング、推論、知識、ビジネス業務はそれぞれ実際の評価をもとに、分野別の点数を別々に計算します。視覚理解と多言語の根拠は総合ランキングに残します。分野名を変えても、同じ成績の票が増えることはありません。総合点は分野別の点数の単純平均ではありません。分野別ランキングは、通常、有効な評価が 2 つ以上、比較できるモデルが 5 つ以上あるときに表示します。知識は現在 Epoch の 2 つの評価に支えられており、同じ機関であるという限界を明記しています。創作の好みやウェブ開発などの根拠は引き続き総合ランキングに使い、最初の版では美的感覚や文章の個別ランキングは設けていません。
ほかに知りたいこと
根拠が少ないモデルでも順位に入るのはなぜ?
「根拠に左右されやすい」とはどういう意味?
上位のモデルは一対一の比較で必ず勝っている?
順位が自分の使用感と違うのはなぜ?
新しいモデルはいつ載る?
ランキングのサイトに一時的にアクセスできないときは?
総合指数と個別評価で点数を二重に数えていない?
価格や速度は順位に影響する?
計算の詳細と現在の版
方法の版:2026.09-public-consensus-v15。重み付きの不完全 Kemeny 順位付けを使います。共通して評価を受けたモデルの各ペアについて差し引きの支持 M を合計し、順位が逆転させる差し引きの支持の総和を最小にすることを目標とします。整数最適化は最適性の状態と目的関数の上下界を返し、検証をすべて通った結果だけを正式に公開します。
双方に明示された標準誤差がある場合、差し引きの支持は 2Φ(点差 / 合成標準誤差) − 1 とし、共分散は 0 と仮定します。それ以外の比較では元のリードの向きだけを使います。未知の誤差は誤差ゼロではなく、小さな点差を順序として扱うことは限界として残ります。票の重みは潜在的なモデルのペアにかかるため、多くのモデルを扱う出典ほど多くの比較枠を使います。名目上の配分を最終順位への正確な寄与率と読むことはできません。
表示用の指数は元の順序を保ちます。隣り合うモデルの前後を一組ずつ入れ替え、他のモデルの並べ替えを許したうえで、最小限増える逆向きの差し引きの支持を計算します。この 0 以上の差を元の順位に沿って累積し、固定した参照グループに対してシグモイドで 0〜100 に写します。別の順序も同じく最適な場合は間隔を 0 のままにし、表示は小数第 1 位まで、最小の点差を人為的に設けることはしません。指数を使って順位を並べ直すことはありません。順位に入るモデルの集合、参照モデル、根拠の変化は指数に影響し、点差は実際の能力の距離ではありません。コストが同じ場合は固定したモデル ID の順で決めます。整数最適化には HiGHS ソルバー(highs 1.15.3)を使い、誤差の換算に使う正規分布関数は SciPy norm.cdf と同じアルゴリズムです。出典、利用条件、評価の資格、各回の計算の入力はすべてバージョンを保存します。共通の根拠のネットワークでつながっていない場合は、成分をまたいだ見かけだけ精密な順序は公開しません。
固定の参照モデル:claude-fable-5、gpt-5-6-sol、kimi-k-3、qwen-3-8-max、gpt-5-4、claude-opus-4-8、claude-sonnet-5、grok-4-5、gemini-3-5-flash、glm-5-2、claude-sonnet-4-6、qwen-3-7-max、kimi-k-2-6、deepseek-v-4-pro、qwen-3-6-plus、minimax-m-3、gpt-5-4-mini、grok-4-3。参照グループは指数の尺度に使うもので、どの会社を何位にするかを決めるものではありません。分野ごとの指数は直接比べられません。