評価の出典公式の評価
PRBench · Legal
Scale AI / ビジネス業務 · 実際の法律業務における複雑な問題に回答し、専門的判断と論証の質を検証する。
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
Legalの完全500問またはHard 250問のいずれかを固定する。検索ツール、推論ティア、審判のバージョンを一致させる。その題集のrubric集計スコアを採用し、完全セットと困難サブセットを重複して投票せず、専門Q&Aを完全なファイル納品として記述しない。
この根拠の使い方
観察中:法律専門の判断を補完できる。まず問題集、ツール条件、成績バッチを確認し、現時点では出典を収録するのみで、自動収集やスコアリングは行わない。
評価の限界とデータの出典
モデル審判による評価であり、審判の偏好が存在する。同機関の法律と金融の専門項目は影響境界を共有すべきで、二つの独立した証拠としてはならない。Word、Excel、スライドの作成能力を直接測るものではない。
データのライセンス:公式問題集と評価コードは公開。そのライセンスはリアルタイムリーダーボード成績を自動的にカバーせず、最新成績の安定したエクスポートと再表示の境界は未確認。
スコアは Scale AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。