評価の出典公式の評価
SimpleBench
SimpleBench / 推論 · 日常の常識と論理問題を用いて、モデルが問題中の実際の制約を識別できるかを検証する。
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
選択式問題と自由回答を区別し、AVG@5、温度、プロンプトプロトコルを固定する。ランキング参加日を問題ごとの評価時刻とはみなさない。
この根拠の使い方
候補観察:新製品のカバレッジは迅速だが、公式サイトの成績の再利用境界と凍結可能なデータバージョンの説明を待つ。コードライセンスは適用せず、まだ自動収集や採点は行っていない。
評価の限界とデータの出典
日常的な常識問題には補完的価値があるが、問題の代表性と選択式・自由回答の条件がいずれも解釈に影響する。
データのライセンス:サンプル問題と評価コードのリポジトリは MIT。公式サイトが独自に公開する最新成績のスクリプト再表示の範囲は未確認。
スコアは SimpleBench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。