跳到正文
Hugging Face Blog·· 2026-09-02AI 评分31

Hugging Face 推出 BenchMIRT:LLM 基准测试究竟在测什么?

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练。它未被告知各基准测什么,却自行识别出安全与通用推理两个主导维度,并发现 BBQ、WMDP 等基准的得分更多与通用推理相关而非安全。

来源:Hugging Face Blog · huggingface.co