本文へ移動
モデル順位に戻る

順位の決め方

複数の公開評価をまとめた順位の、根拠と方法。

0〜100

共通の根拠から、はっきりした順序を。

複数の公開評価をまとめ、完全な順位の中で既知の成績との矛盾をできるだけ減らします。総合ランキングと 4 つの分野別ランキングは、いずれも上位 30 位まで表示します。

コンセンサス指数は、順位を支える根拠の差を比べやすいよう 0〜100 に換算したもので、正答率でも能力差の百分率でもありません。支持が近ければ同点になることもありますが、順位はあくまで根拠全体で決まります。

  1. 01

    まず、同じモデルかを確かめる

    各ランキングのモデル名とバージョンをそろえます。同じモデルに複数の推論レベルがある場合は、事前に決めた規則で代表的な設定を一つだけ選び、最高点を選ぶことはしません。匿名のテスト用コードネームや、他のモデルを併用して課題をこなした成績は除外します。正式に公開された Preview 版は対象にします。

  2. 02

    実際に測ったモデルどうしを比べる

    同じ評価の中の実際の成績だけを比べます。双方が誤差を公開している場合、誤差の範囲内の小さな差は引き分けに近いものとして扱い、勝ち負けとはみなしません。測っていなければ、その比較はありません。

  3. 03

    先に票の重みを決め、共通の見方をまとめる

    各評価には事前に決めた配分があります。総合ランキングには少なくとも 3 つの評価機関、3 つの根拠ファミリー、3 つの個別評価が必要です。同じ出典の重複取得や表示の切り分けで票の重みが増えることはありません。

  4. 04

    矛盾がいちばん少ない完全な順位を探す

    評価どうしの意見はぶつかることがあります。共通の根拠の差し引きの票の重みに反する量が最も少ない順序を選び、表示用の指数は別に計算します。未評価を 0 点で埋めず、公開されていない成績を推測もしません。

総合テスト、人によるブラインド評価、個別評価をあわせて見る。

総合評価が 30%、人によるブラインド評価が 10%、個別評価が合計 60% を占めます。新しい評価は、公開された説明で重なりを確認してから該当する割合の中で配分します。欠けた割合を他の評価に回すことはしません。

  • 総合評価30%AA Index
  • 人間のブラインド選択10%Arena Text · Arena 創作ブラインド選考
  • コーディングとデザイン12%Arena WebDev · DeepSWE v1.1 · TapTap Maker · LiveBench · プログラミング総合
  • ライティングと表現9%LiveBench · 言語と指示 · Creative Writing v3 · Longform Writing
  • 数学と推論12%LiveBench · 推論と数学 · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
  • 知識と事実6%SimpleQA Verified · GPQA Diamond
  • 視覚理解6%Arena Vision
  • ツールとオフィス6%APEX-Agents 1.1 · τ³-Banking
  • 中国語と多言語6%AA 中国語/多言語
  • 業界専門タスク3%Vals Finance Agent

コーディング、推論、知識、ビジネス業務はそれぞれ実際の評価をもとに、分野別の点数を別々に計算します。視覚理解と多言語の根拠は総合ランキングに残します。分野名を変えても、同じ成績の票が増えることはありません。総合点は分野別の点数の単純平均ではありません。分野別ランキングは、通常、有効な評価が 2 つ以上、比較できるモデルが 5 つ以上あるときに表示します。知識は現在 Epoch の 2 つの評価に支えられており、同じ機関であるという限界を明記しています。創作の好みやウェブ開発などの根拠は引き続き総合ランキングに使い、最初の版では美的感覚や文章の個別ランキングは設けていません。

ほかに知りたいこと

根拠が少ないモデルでも順位に入るのはなぜ?
評価の数と能力は別のものです。総合ランキングには少なくとも 3 つの機関と、複数の能力にまたがる根拠が必要です。多くの分野では 2 つの機関を求めます。知識は同じ機関の 2 つの評価を使っており、その旨を明記しています。未評価は 0 点として扱いませんが、偏りが生じる可能性は残ります。
「根拠に左右されやすい」とはどういう意味?
評価や機関を一つ除く、個別の重みを上下 20% 動かす、誤差の扱いを変える。こうした条件で順位の幅が 3 位以上になる、一部のシナリオで評価の資格を失う、または比較が完了しない場合にこの表示を付けます。詳細ページのシナリオの幅は 95% 信頼区間ではなく、未知の成績も含みません。
上位のモデルは一対一の比較で必ず勝っている?
そうとは限りません。A が B に勝ち、B が C に勝ち、C が A に勝つこともあります。完全な順位はこうした矛盾を比べて決めるため、隣り合わない順位は個別の比較と異なることがあります。数学的に最適とは、現在の規則で矛盾の合計が最も少ないという意味で、あらゆる実際の仕事での能力の順序が証明されたわけではありません。
順位が自分の使用感と違うのはなぜ?
このランキングは公開評価をまとめ、その根拠が支える総合的な能力を表します。実際の使用感は、製品のバージョン、推論レベル、ツール環境、長い作業での安定性にも左右されます。新しい評価で古い順位を検証しています。点数が近いときは、1〜2 位の差をはっきりした強弱と受け取らないでください。
新しいモデルはいつ載る?
News は上流の結果を 1 日 4 回確認します。評価する側が新しいモデルの成績を実際に公開して初めて順位に使えます。ページの更新、価格の変更、こちらの取得時刻は、新しい評価とはみなしません。
ランキングのサイトに一時的にアクセスできないときは?
まだ有効な出典のスナップショットは引き続き使えます。同じ評価バージョン内で一時的に欠けた行は、直近 7 日以内に確認済みの記録に限って引き継ぎます。公開ランキングに残っている有効な成績は、値が長く変わらないという理由では削除しません。公式の撤回・訂正・バージョン変更があれば、それに応じて無効にするか置き換え、過去の最高点は残しません。計算の一回分がすべて失敗した場合は、前回の有効な順位と時刻をそのまま残します。
総合指数と個別評価で点数を二重に数えていない?
公開された問題セットと方法の説明をもとに重なりを確認し、関連する出典の合計の割合に上限を設けています。確認できない相関は限界として残ります。現在 AA 指数は 30% です。Arena の総合テキストとクリエイティブの個別評価は、もともとの人の好みの割合 10% を 5% ずつ分け合います。両者は投票が重なるため、同じ根拠ファミリーとして数え、独立した 2 つの評価とはみなしません。
価格や速度は順位に影響する?
どちらも影響しません。価格は API の利用コストを知るためのもので、100 万トークンあたりで統一して表示し、各社の公式の出典を添えています。サブスクリプションの料金ではありません。
計算の詳細と現在の版

方法の版:2026.09-public-consensus-v15。重み付きの不完全 Kemeny 順位付けを使います。共通して評価を受けたモデルの各ペアについて差し引きの支持 M を合計し、順位が逆転させる差し引きの支持の総和を最小にすることを目標とします。整数最適化は最適性の状態と目的関数の上下界を返し、検証をすべて通った結果だけを正式に公開します。

双方に明示された標準誤差がある場合、差し引きの支持は 2Φ(点差 / 合成標準誤差) − 1 とし、共分散は 0 と仮定します。それ以外の比較では元のリードの向きだけを使います。未知の誤差は誤差ゼロではなく、小さな点差を順序として扱うことは限界として残ります。票の重みは潜在的なモデルのペアにかかるため、多くのモデルを扱う出典ほど多くの比較枠を使います。名目上の配分を最終順位への正確な寄与率と読むことはできません。

表示用の指数は元の順序を保ちます。隣り合うモデルの前後を一組ずつ入れ替え、他のモデルの並べ替えを許したうえで、最小限増える逆向きの差し引きの支持を計算します。この 0 以上の差を元の順位に沿って累積し、固定した参照グループに対してシグモイドで 0〜100 に写します。別の順序も同じく最適な場合は間隔を 0 のままにし、表示は小数第 1 位まで、最小の点差を人為的に設けることはしません。指数を使って順位を並べ直すことはありません。順位に入るモデルの集合、参照モデル、根拠の変化は指数に影響し、点差は実際の能力の距離ではありません。コストが同じ場合は固定したモデル ID の順で決めます。整数最適化には HiGHS ソルバー(highs 1.15.3)を使い、誤差の換算に使う正規分布関数は SciPy norm.cdf と同じアルゴリズムです。出典、利用条件、評価の資格、各回の計算の入力はすべてバージョンを保存します。共通の根拠のネットワークでつながっていない場合は、成分をまたいだ見かけだけ精密な順序は公開しません。

固定の参照モデル:claude-fable-5、gpt-5-6-sol、kimi-k-3、qwen-3-8-max、gpt-5-4、claude-opus-4-8、claude-sonnet-5、grok-4-5、gemini-3-5-flash、glm-5-2、claude-sonnet-4-6、qwen-3-7-max、kimi-k-2-6、deepseek-v-4-pro、qwen-3-6-plus、minimax-m-3、gpt-5-4-mini、grok-4-3。参照グループは指数の尺度に使うもので、どの会社を何位にするかを決めるものではありません。分野ごとの指数は直接比べられません。

すべての評価の根拠を見る