模型与研究

BenchMIRT:大型语言模型基准测试到底在测量什么?

Allen Institute for AI 发布 BenchMIRT 方法,使用多维项目反应理论在题目层面拆解大型语言模型基准,揭示单一平均分可能混淆多种能力信号,并能在较少题目下保留主要结论,同时指出题目级透明度带来的风险与局限。

BenchMIRT:大型语言模型基准测试到底在测量什么?

Allen Institute for AI 发布 BenchMIRT 方法,使用多维项目反应理论在题目层面拆解大型语言模型基准,揭示单一平均分可能混淆多种能力信号,并能在较少题目下保留主要结论,同时指出题目级透明度带来的风险与局限。

人工智能模型的评测分数,往往被压缩成一个看似清晰的数字。但一项由 Allen Institute for AI(Ai2)发布的新研究指出,同一个基准测试中的不同题目,可能同时考察安全性、一般推理、阅读理解或任务执行等多种能力。只看最终平均分,可能会掩盖这些差异。

Ai2 于 2026 年 9 月 1 日在 Hugging Face 发布 BenchMIRT:What are LLM benchmarks actually measuring?,介绍一种在单个提示词、问题和任务层面审计大型语言模型基准的方法。研究团队同时公开了技术报告评测数据代码仓库

一个基准分数可能混合多种能力

基准测试通常会以一个目标命名,例如安全、偏见、数学推理或指令遵循。但一道题要得到正确答案,往往还需要调用其他能力。

Ai2 以 BBQ 为例。这项测试用于观察模型是否依赖社会刻板印象,其中一道题涉及祖父和孙子试图预订网约车。题目确实涉及年龄偏见,但模型还必须准确识别人物关系,并根据题目提供的证据进行推理,而不是凭常识或先入假设作答。

WildJailbreak 则展示了另一种情况:它既包含有害的越狱提示,也包含用于测试模型是否会过度拒绝无害请求的良性提示。前一类题目与安全能力的关系更密切,后一类题目则可能更多反映一般推理能力。把两组结果简单平均,可能会让最终分数难以解释。

这并不意味着相关基准“错误”,而是说明分数所代表的内容可能比基准名称更复杂。类似地,关于评测环境和外部条件如何改变结果的问题,也出现在微软关于代理评估中隐性变量的分析中:操作系统、Shell、文件路径和工具反馈,都可能影响模型或代理的行为。

BenchMIRT 如何拆解题目层面的信号

BenchMIRT 借鉴了源自心理测量学的项目反应理论(Item Response Theory,IRT)。IRT 的基本假设是,不同题目的难度不同,对区分强弱测试对象的能力也不同。

此前,研究人员已经将单维 IRT 用于单个基准。BenchMIRT 则进一步采用多维项目反应理论(MIRT),试图识别同一道题背后可能同时存在的多种能力信号。

该方法分别估计模型和题目的特征:对于模型,它估计模型在不同能力维度上的强弱;对于题目,它估计题目难度,以及题目区分不同能力水平模型的程度。换句话说,BenchMIRT 不只问“模型答对了多少题”,还试图追问“哪些能力让模型答对了这些题”。

研究团队使用了 100 个大型语言模型、16 个基准和超过 3.4 万道题目的结果进行训练。其中 6 个基准主要涉及一般推理,包括 MMLU-Pro、GPQA、MATH 和 BBH;另外 10 个来自 OLMo 3 安全评测套件,包括 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP 和 XSTest。

研究人员没有提前告诉 BenchMIRT 哪些基准对应哪些能力。模型最终独立识别出两个主要维度:安全和一般推理。团队从头重复分析后,这两个维度再次出现,因此认为结果并非只由一次特定分析造成。不过,这种稳定性仍然是在所选择的 16 个基准范围内得到的。

研究发现:安全基准并不总是只测安全

对于许多基准,BenchMIRT 基本印证了原本的设计意图:推理基准的表现与推理能力相联系,越狱和有害内容基准的表现则更多与安全能力相关。

但部分测试显示出更复杂的结构。BBQ 通常被归入安全或偏见评测,但在 BenchMIRT 的分析中,它与一般推理能力的关联更强。这意味着,模型在 BBQ 上得分较低,可能部分源于难以理解题目中的人物、证据和逻辑关系,而不完全是安全行为的问题。

WMDP 的表现也不同于多数安全基准。它测试生物、化学和网络安全领域的危险双重用途知识。由于该测试把拒绝提供危险知识,或无法给出相关知识,视为更理想的反应,因此一般推理能力更强的模型反而可能得到更低的 WMDP 分数。这个结果提醒研究人员,基准分数的方向并不总能按通常的“越高越好”来理解。

HarmBench 则体现了单个基准内部的混合信号。其标准问题可能要求模型撰写用于窃取银行信息的钓鱼邮件,情境问题则会提供额外材料,要求模型据此完成更具体的有害任务。两组问题在分析中都更接近安全维度,但其中有关版权的题目,例如要求生成一首受版权保护歌曲的歌词,则更接近一般推理维度。

因此,BenchMIRT 的结论不是要用一个新分数替代所有旧基准,而是让研究人员看到旧分数由哪些题目和能力共同驱动。Hugging Face 对统一评测结果和元数据的整理所强调的可复现性和透明度,也正是这类题目级分析能够发挥作用的前提。

只用十分之一的题目,能否保留主要结论?

研究团队还使用 BenchMIRT 的题目级估计,对 16 个基准中的题目进行排序,优先保留能够更好区分强弱模型、同时覆盖不同难度的题目。

在这些实验中,只保留原题目数量的 10%,通常仍能大致保留模型在安全或一般推理能力上的强弱关系;保留 50% 的题目时,结果往往与完整基准对能力的测量更加接近。

BenchMIRT 还可以根据已观察到的模型能力和题目要求,预测模型在未观察题目上的表现。研究称,在实验中,该方法预测模型能否答对保留题目的准确率为 79%,而一种仅假设模型在每道题上的表现等同于其总体基准表现的简单方法,准确率为 70%。

这意味着评测不一定要让每个模型回答每一道题,便可以在一定程度上估计其表现。但这种效率提升并不等同于可以随意删题,尤其是在安全评测中。

题目级透明度也带来新的风险

Ai2 明确列出了 BenchMIRT 的局限。用于训练和评估的模型都在 2025 年 3 月之前发布,因此研究没有覆盖更新一代模型。与此同时,模型识别出的能力维度取决于输入的基准组合;如果换一组评测,主导维度可能变成其他能力。

研究还指出,如果目标只是预测模型在随机保留题目上的表现,完整基准的平均分略胜于 BenchMIRT。BenchMIRT 的优势在于提供更细的解释:它能够说明单个题目或题目群组在测量什么。

这种透明度也可能被滥用。研究人员可以利用题目级估计找到最能识别不安全行为的题目,但同样的知识也可能被用于删除这些题目,形成一个更容易被不安全模型通过的评测。Ai2 认为,现有工具本来也能以类似方式裁剪评测,题目级分析带来的透明度仍然具有价值,但风险不能被忽略。

更广泛的背景是,研究界已经持续质疑静态基准是否足以代表模型的真实能力。关于大型语言模型基准有效性的讨论,既包括对基准评测方法的重新审视,也包括 Ai2 此前提出的 Fluid Benchmarking,后者尝试根据模型当前的能力水平动态选择更合适的题目。

BenchMIRT 所提出的方向,与这些工作形成了不同但相互补充的路径:Fluid Benchmarking 关注如何更有效地出题,BenchMIRT 则关注题目实际上测量了什么。两者共同指向一个变化,即模型评测正在从单一排行榜分数,转向对题目、环境、能力和证据链的更细致描述。

对模型开发者和使用者而言,这并不意味着所有排行榜都失去意义,而是意味着在解读分数时,需要进一步了解题目构成、测试环境、评测目标和已知局限。一个更小但目标明确、证据透明的评测,或许比一个更大却难以解释的总分更能说明模型究竟擅长什么、又在哪些地方仍然不可靠。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读