本文へ移動
評価の出典

BullshitBench v2

Peter Gostev / BullshitBench / 知識 · 問題文の誤った前提を識別し、モデルが誤りに沿って作り話を続けるかを観察する。

公式の評価
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません

何をどう測るか

公式デフォルトの全試行のうち明確に識別された割合を採用し、回答済み応答の平均点も保持する。拒答率は監査用に保持。二つの生指標は現在の総合・分類票権には入れない。

この根拠の使い方

元の成績参考:同一の公開データバージョンで集計、問題集、設定、実行日を照合したうえで自動収集する。匿名モデルは非公開で、固定バージョンを確認できないローリングインターフェースはモデル代表成績としない。現在は総合スコアやカテゴリスコアには算入しない。

評価の限界とデータの出典

すべて誤った前提の問題であり、一般的な知識の広さを代表するものではない。モデル審判と拒答の処理が結果に影響し、ローリング別名および匿名モデルは先に身元確認を完了する必要がある。

データのライセンス:MIT · Copyright (c) 2026 Peter Gostev。公式成績は同リポジトリで公開され、別途のデータライセンス例外はない。

スコアは Peter Gostev / BullshitBench が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。