本文へ移動
原文
Hugging Face Blog·· 2026-09-02

Hugging Face、LLMベンチマークが何を測るか監査するBenchMIRTを公開

BenchMIRT: What are LLM benchmarks actually measuring?

AI による要約

Hugging Faceは多次元項目反応理論(MIRT)で個別プロンプト単位のベンチマークを監査するBenchMIRTを公開した。安全性と汎用推論の2主要次元を分離する。100モデル、16ベンチマーク、34K超の設問で学習し、評価対象を教えずとも安定して2次元を再現した。BBQやWMDPなどの安全性の得点は汎用推論との関係が強く、単一得点が複数の信号を混ぜる可能性を示す。

入選の記録

入選せず二回の合計 65 < 基準の 2 倍 120

情報源の区分
公式・一次情報、この区分の基準は 60 点
予備審査
通過:介绍LLM基准评测新方法BenchMIRT

採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。

情報源:Hugging Face Blog · huggingface.co