本文へ移動
モデル順位に戻る

評価の出典

各出典が何を測り、どう更新され、順位に入るかどうかをここで確認できます。

今回順位に反映
20
確認済みの出典と個別評価
69
順位の決め方

総合評価と体験

17

能力をまたぐ総合テストと真人のブラインド選択。

コーディング

13

コードを書くことからリポジトリを改変することまで、モデルがソフトウェアを作り上げられるかを見る。

推論

11

数学・論理・未知のルールを通じて、モデルが新しい問題を考え抜けるかを見る。

知識

5

事実に基づく質疑応答と大学院レベルの科学知識。知識の習得度と回答の正確性を見る。

ビジネス業務

19

金融分析、法律相談、銀行業務で、専門タスクを完了できるかを見る。

視覚理解

2

画像を理解する証拠は引き続き総合ランキングに残す。画像を読み取ることとデザインの美しさは別の能力である。

中国語と多言語

2

言語基礎の補足証拠であり、英文ライティングの成績を中国語能力とはみなさない。

「観察中」は、データ・実行条件・利用範囲をまだ確認中で、総合ランキングと分野別ランキングには入らないことを表します。同じ評価の重複取得や表示の切り分けで票の重みが増えることはありません。評価どうしの問題の重なりは引き続き確認しています。