モデル順位に戻る
評価の出典
各出典が何を測り、どう更新され、順位に入るかどうかをここで確認できます。
- 今回順位に反映
- 20
- 確認済みの出典と個別評価
- 69
総合評価と体験
17能力をまたぐ総合テストと真人のブラインド選択。
- AA Index複数の現行評価を同一環境で再実行し、総合能力スコアを算出する。価格は参考のみで、総合スコアには含めない。Artificial Analysis順位に反映根拠の配分 30%
- LiveBench問題集は継続的に入れ替わり、答えは自動で照合できる。モデルが問題を替えても通用するかを見る。LiveBench照合用
- Arena Text人間が匿名で回答を一対一比較し、どちらをより読みたいかを見る。選択式問題では見えない全体的な体験を補う。LMArena順位に反映根拠の配分 5%
- Arena WebDev同じく人間のブラインド選択で、ウェブが使いやすいか、納品できるかを競う。LMArena順位に反映根拠の配分 2.4%
- LiveBench · 言語と指示Language と IF の 2 項目の平均、各 50%。LiveBench順位に反映根拠の配分 3%
- Arena 創作ブラインド選考人間が物語、詩、その他の創作的表現をブラインドで選び、作品が読者を引きつけるかを観察する。LMArena順位に反映根拠の配分 5%
- Design Arena · ビジュアルデザイン人間がウェブ、インターフェース、図表、スライドのデザイン作品をブラインドで選ぶ。Design Arena / Intelligence観察中
- EQ-Bench 4 · 感情と対人理解多ターンのやり取りの中で人物の感情、暗黙のニーズ、異なるコミュニケーション選好を理解する。EQ-Bench観察中
- Short-Story · 短編小説指定された人物、筋書き、文体の要件を自然に織り込み、一編の短編小説として完成させる。Lech Mazur観察中
- ToneBench · 文体とスクリプト指定された著者の文体で動画スクリプトを書き、導入・構成・表現・読み上げのリズムを評価する。Towards AI観察中
- TubeLab · 動画スクリプト異なる動画チャンネル向けに脚本を書き、物語構成、文体、リズム、明瞭さを比較する。TubeLab観察中
- NC Bench · 作家ワークフロー作家の書き換え、続きの執筆、要約、翻訳、創作アイデアの整理を支援する。Novelcrafter観察中
- OpenVibeEval · ウェブ作品ウェブ作品、アクセシビリティ、ブラインド選好を比較し、異なるツールでのデザイン表現を観察する。OpenVibeEval観察中
- SVGBench · ベクター画像ブラインド選考同一のプロンプトで SVG をブラインド選択し、視覚的な明瞭さと図形表現を評価する。SVGBench観察中
- Rapidata SVG人間がモデル生成のベクター画像を比較し、視覚的偏好を直接評価する。Rapidata観察中
- Creative Writing v3短編創作と表現EQ-Bench順位に反映根拠の配分 3.6%
- Longform Writing長編物語の一貫性と完全性EQ-Bench順位に反映根拠の配分 2.4%
コーディング
13コードを書くことからリポジトリを改変することまで、モデルがソフトウェアを作り上げられるかを見る。
- DeepSWE v1.1統一されたコーディングアシスタント環境でリポジトリを変更し、欠陥を修正する。比較するのはコードを書くモデルそのものである。DataCurve順位に反映根拠の配分 3.6%
- TapTap Maker実際のゲームエンジンでLuaを使い、動作する機能を書く。スコアはエンジンの実行で判定し、別のモデルによる採点は行わない。TapTap Maker順位に反映根拠の配分 3.6%
- LiveBench · プログラミング総合Coding と Agentic Coding の 2 項目の平均、各 50%。LiveBench順位に反映根拠の配分 2.4%
- Hyper-τ-bench業務資料に基づいて動作するカスタマーサービスエージェントを構築しテストする。Sierra観察中
- SWE-rebench実在のリポジトリの問題を継続的に収集し、多様なプログラミング言語におけるモデルのソフトウェア修正能力を比較する。Nebius観察中
- LHTB長時間にわたりターミナルを使い続け、複雑なエンジニアリングとツールタスクを完遂する。Tencent HY / Lehigh など観察中
- Terminal-Bench 4モデルと異なる Agent を組み合わせた端末タスクの元の成績を残し、相互照合に供する。Harbor / Terminal-Bench参考のみ
- MirrorCode長時間のソフトウェア再現Epoch AI参考のみ
- Code Migrationソフトウェア移行とインターフェース改修Vals AI観察中
- ProgramBench完全なプログラムの実装と納品Vals AI観察中
- FrontierCode実リポジトリタスクの品質、テスト、修正範囲Cognition観察中
- FrontierSWE v2長時間実行されるエンジニアリング実装と研究タスクProximal Labs観察中
- WeirdML未知のデータで機械学習ソリューションを実装するWeirdML観察中
推論
11数学・論理・未知のルールを通じて、モデルが新しい問題を考え抜けるかを見る。
- LiveBench · 推論と数学Reasoning と Mathematics の 2 項目の平均点で、各 50%。LiveBench順位に反映根拠の配分 4.2%
- SimpleBench日常の常識と論理問題を用いて、モデルが問題中の実際の制約を識別できるかを検証する。SimpleBench観察中
- FrontierMath v2 · Tiers 1–3研究レベルの数学的推論Epoch AI順位に反映根拠の配分 3.6%
- FrontierMath v2 · Tier 4より高難度の数学研究問題Epoch AI順位に反映根拠の配分 1.2%
- Chess Puzzles文字で示された盤面から正しい着手を探すEpoch AI順位に反映根拠の配分 1.8%
- Mystery Game Puzzles未知のルールから正しい行動を導出Epoch AI順位に反映根拠の配分 1.2%
- MathArena · ArXivLeanLean で数学的証明を検証するMathArena / ETH Zurich観察中
- MathArena · BrokenArXiv数学的証明の誤りを発見・修正するMathArena / ETH Zurich観察中
- MathArena · ArXivMath最近の数学論文から抽出した新規問題MathArena / ETH Zurich観察中
- ARC-AGI-2未知のルールからの学習と汎化ARC Prize観察中
- ARC-AGI-3未知のルールからの学習と汎化ARC Prize観察中
知識
5事実に基づく質疑応答と大学院レベルの科学知識。知識の習得度と回答の正確性を見る。
- FACTS Parametric検索ツールを使わずに世界の事実問題に回答し、モデル自身の知識の正確さを検証する。Google DeepMind / Kaggle観察中
- Humanity’s Last Exam学際にわたる高難度の学術知識と推論。CAIS / Scale AI観察中
- BullshitBench · 誤った前提問題文の誤った前提を識別し、モデルが誤りに沿って作り話を続けるかを観察する。Peter Gostev / BullshitBench観察中
- SimpleQA Verified短い問題の事実正確性Epoch AI順位に反映根拠の配分 4%
- GPQA Diamond大学院レベルの物理、化学、生物の知識Epoch AI順位に反映根拠の配分 2%
ビジネス業務
19金融分析、法律相談、銀行業務で、専門タスクを完了できるかを見る。
- APEX-Agents 1.1投資銀行、コンサルティング、法律分野の長いタスクで、モデルが助手として一つの仕事を最後までやり遂げられるかを見る。Mercor順位に反映根拠の配分 4%
- Vals Finance Agent金融アナリストの日常業務問題で、リサーチレポートやモデリングといった仕事がどうかを確認する。Vals AI順位に反映根拠の配分 3%
- OfficeQA Pro大量の実財務ファイルから検索・計算し、質問に答える。Databricks観察中
- Harvey Legal Agent Benchmark法律資料を処理し、Word、Excel、スライドなどレビュー可能なファイルを納品する。Vals AI / Harvey観察中
- MCP Atlas実際のMCPサービスを通じて資料検索、文書操作、データベース操作を行い、ソフトウェアをまたぐタスクを完了する。Scale AI観察中
- FinanceBenchmark金融プライシング、資本計算、リスク管理のタスクを完遂し、数値とコード実行結果で検証する。FinanceBenchmark観察中
- PRBench · Legal実際の法律業務における複雑な問題に回答し、専門的判断と論証の質を検証する。Scale AI観察中
- PRBench · Finance実際の金融意思決定の問題に回答し、専門的判断、推論、リスク説明を検証する。Scale AI観察中
- SpreadsheetBench 2財務モデリング、ワークブックの修正、データ可視化を含む表計算業務一式を完遂する。SpreadsheetBench / Renmin University / AfterQuery観察中
- Vending-Bench 2経営シミュレーションで店を一年運営し、仕入れ、交渉、在庫、価格設定を処理する。Andon Labs観察中
- τ³-Banking統一ツール環境で銀行業務を行い、規則の理解、顧客対応、タスク完了を検証する。Sierra結果待ち根拠の配分 2%
- EBR-bench長いタスクの中で新しいルールを学び、記憶を使うEpoch AI参考のみ
- Excel · EMB表計算編集とExcel業務Vals AI観察中
- Legal Research法的検索と論証Vals AI観察中
- TaxAgentBench税務専門問題Vals AI観察中
- MedScribe臨床記録の整理と作成Vals AI観察中
- BioMysteryBench生物学研究の推論Vals AI観察中
- AutomationBenchオフィスソフトをまたいだ自動化作業Zapier観察中
- Terminal-Bench Scienceターミナルで科学研究タスクを完了するHarbor観察中
視覚理解
2画像を理解する証拠は引き続き総合ランキングに残す。画像を読み取ることとデザインの美しさは別の能力である。
中国語と多言語
2言語基礎の補足証拠であり、英文ライティングの成績を中国語能力とはみなさない。
「観察中」は、データ・実行条件・利用範囲をまだ確認中で、総合ランキングと分野別ランキングには入らないことを表します。同じ評価の重複取得や表示の切り分けで票の重みが増えることはありません。評価どうしの問題の重なりは引き続き確認しています。