评测大模型不需‘万题海战’!上交大&阿里提出EssenceBench:压缩200倍,排名一致性高达95%,遗传算法选出黄金考题

导语:上交大&阿里联合打造评测利器EssenceBench,用遗传算法精选考题,以200倍压缩实现95%排名一致性,让大模型评测告别“跑分海战”。

引言:跑分跑断腿?大模型评测的“奢侈”困境

“OpenCompass有上百个任务,测我一次要烧掉大约1000个GPU小时,能不能省省?”随着大模型能力维度的扩张,Benchmark(评测基准)数量和体积急剧膨胀。传统的全量评测存在三大痛点:——测一个Qwen2.5-7B-Instruct就要耗费数千万Token;——迭代一个版本等评测结果等到花儿都谢了;——很多题目其实是“重复造轮子”,测了也白测。为解决这一难题,上海交通大学、阿里Qwen团队等联合提出了EssenceBench——首个由粗到细、结合进化算法的评测基准压缩框架。它不仅能剔除榜单中的“水分”,还能通过遗传算法(GA)精选出最具代表性的“精华题”,仅用1/200的数据量,就能实现95%的排名一致性!就像一位经验丰富的考官,不用让学生做完整本五三模拟,只挑几道关键大题,就能精准排好全班座次。论文《Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data?》已发布,并开源了代码。

EssenceBench示意图

研究背景:榜单“注水”有多严重?

该工作由上海交通大学博士生王少博(Shaobo Wang)、王聪(Cong Wang)与复旦大学Wenjie Fu共同担任第一作者,通讯作者为上海交大助理教授张林峰,其他作者来自香港科技大学、上海AI Lab、智谱AI等。团队首先对Open LLM Leaderboard进行了深入“体检”,发现样本冗余现象普遍存在,并定义了两类冗余:

  • 文本冗余 (Text Redundancy):利用BGE-M3等嵌入模型计算题目间语义相似度,发现大量题目仅更换人名、地名或微调句式,核心语义完全一致,属于“换皮题”。
  • 排名冗余 (Ranking Redundancy):更隐蔽的冗余形式。通过计算不同题目在所有模型上的排名之间的皮尔逊相关系数,若两道题所有模型的得分模式都一样(例如模型A、B都对,C、D都错),那么它们提供的区分度信息就是重复的,保留只会增加计算量,无法提供更多关于模型能力差异的信息。

方法机制:由粗到细,遗传算法“进化”出黄金考卷

与传统的训练侧数据压缩不同(往往基于注意力分数、梯度等保证性能持平),测试集压缩更注重模型排名一致性,而非简单进行分数重构。EssenceBench将基准压缩视为一个复杂的组合优化问题,提出了三阶段的由粗到细框架:

1. 粗粒度过滤 (Coarse Filtering) —— 挤干水分

直接砍掉文本冗余和排名冗余的无效样本。利用二进制得分矩阵快速剔除那些对区分模型贡献极低的题目。

2. 子集搜索 (Subset Search) —— 遗传算法登场

如何在剩余题目中选出最优组合?暴力搜索面临天文数字的组合量。EssenceBench引入遗传算法 (GA):通过锦标赛选择、交叉、变异等操作,迭代寻找能最小化预测误差(RMSE)的题目子集。同时训练一个轻量级预测器GAM(Generalized Additive Model)快速预判子集分数,极大提升搜索效率。

3. 归因细化 (Attribution Refinement) —— 归因分析保多样

为了防止选出题目过于偏狭(例如只挑难题),EssenceBench使用EBM (Explainable Boosting Machine)计算每个样本的归因分数,将题目按贡献度分组(高贡献、低贡献、随机),进行微观筛选。这种策略确保最终考卷既有高区分度,又能覆盖容易被忽视的基础能力角落,保证评测的鲁棒性和全面性。

这一套组合拳,既保证了分数预测的准确性,又牢牢锁定了模型间的相对排名。

实验结果:效果炸裂,刷新SOTA

在五个主流榜单上,EssenceBench表现均优于MetaBench、GraNd、PPL等现有方法。以GSM8K数据集为例,当压缩子集大小为500时,EssenceBench的预测误差(RMSE)仅为0.3769,相比此前最优的MetaBench (0.9579) 降低了60.7%。这意味着用极少数据就能极准预测模型分数。

评测的核心是“比大小”。EssenceBench在压缩后依然完美保持模型间的相对排名。在HellaSwag上,EssenceBench的排名波动显著小于MetaBench,即便将数据压缩200倍(仅用50题),仍有95%的模型排名位移在5%以内,展现了惊人的保真度。

案例分析:它到底剔除了什么?

EssenceBench的高效源于其精准识别“看似不同、实则重复”题目的能力。论文给出了两个代表案例:

  • 文本冗余实例——孪生题:GSM8K数学集中,两道题仅变量微调,核心算术结构完全相同。题目A:“Zack的储物柜大小是Timothy的一半,Peter的储物柜大小是Zack的1/4。如果Peter的储物柜是5立方英寸,请问Timothy的储物柜是多少立方英寸?”题目B:“Timothy的储物柜是24立方英寸。Zack的储物柜大小是Timothy的一半,Peter的储物柜大小是Zack的1/4。请问Peter的储物柜是多少立方英寸?”两者考查同一逻辑链条,EssenceBench果断剔除其一,避免无效重复测试。
  • 排名冗余实例——隐形重复:题目A(货币计算)与题目B(考试计分)题面完全不同,但分析发现,所有模型在这两道题上的表现高度一致——能做对A的模型几乎都能做对B,做错的也几乎都错。因为它们都要求复杂的多步数值推理、中间变量推导和加权求和能力,排名贡献高度冗余。删掉一道,模型排名依然稳如泰山。

泛化能力:不止老榜单,新题库也通吃

EssenceBench不仅在经典榜单上表现出色,面对MathVista(多模态)、LiveMCPBench(Agent工具调用)、GPQA(博士级难题)等8个现代高难度基准测试,同样展现了强大泛化能力。例如在GSM-Plus对抗性数学评测中,RMSE低至0.010,几乎完美复刻全量榜单表现。相比传统方法,EssenceBench的杀手锏在于:考虑了样本间的相互作用而不是孤立选题;遗传算法在巨大搜索空间中高效寻优;以及始终紧扣排名一致性这一核心指标。

总结:评测范式的转折点

EssenceBench揭示了大模型评测领域一个关键趋势:榜单规模的指数级增长不可持续,“大数据暴力测试”正让位于“小数据精准评估”。只要考题出得精,几百道题足矣看穿一个千亿参数模型的真实水平。从此,评测不再是巨头专属的“算力游戏”,小实验室也能快速迭代、精准打榜。论文链接:https://arxiv.org/abs/2510.10457,GitHub地址:https://github.com/gszfwsb/EssenceBench

© 版权声明

相关文章