Hugging Face Blog·· 2026-09-02
Hugging Face、LLMベンチマークが何を測るか監査するBenchMIRTを公開
BenchMIRT: What are LLM benchmarks actually measuring?
AI による要約
Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。
入選の記録
基準 60公式・一次情報1 回目 312 回目 34
入選せず二回の合計 65 < 基準の 2 倍 120
- 情報源の区分
- 公式・一次情報、この区分の基準は 60 点
- 予備審査
- 通過:介绍LLM基准评测新方法BenchMIRT
採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。
情報源:Hugging Face Blog · huggingface.co