Hugging Face Blog·· 29 天前
Hugging Face 推出 BenchMIRT:审计 LLM 基准测试究竟在测什么
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的方法,基于多维项目反应理论(MIRT)分离出安全与通用推理两个主导维度。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知各基准测什么却稳定复现这两个维度。分析显示 BBQ、WMDP 等安全基准的得分更多与通用推理相关,单一基准分数可能混合多种信号。
入选记录
门槛 60官方一手第一次 31第二次 34
未入选两次之和 65 < 门槛的两倍 120
- 信源等级
- 官方一手,这一级的门槛是 60 分
- 预筛
- 通过:介绍LLM基准评测新方法BenchMIRT
评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。
来源:Hugging Face Blog · huggingface.co