Papers with Code
Papers with Code关联学术论文与开源代码实现,提供SOTA基准和数据集信息。
MMBench 是由知名开源社区 OpenCompass 推出的一套针对多模态大语言模型(VLM)的系统化评测基准。为了解决现有评测数据集可能存在的随机猜测、选项偏见等问题,MMBench 创新性地引入了全新的数据集构建方式与评测协议,为研究人员提供了一个客观、可靠、细粒度的 AI 模型能力评估工具。
MMBench 通过精心设计的细粒度评估维度,涵盖了感知、推理、跨模态理解等数十个核心能力子项。它采用了创新的“循环选择”评测机制,能有效减少大模型在选择题评测中的偏见,使测试结果更加精准。同时,平台还支持在线提交评估结果,并向全球公开透明地展示主流多模态模型的综合排行榜。
对于关注多模态 AI 发展的开发者和学术研究者而言,MMBench 是不可或缺的专业参考工具。若想发现更多实用的国内前沿 AI 应用与学术文献资源,欢迎访问 ACGFav导航。作为专业的网址导航平台,ACGFav导航 将持续为您收集并整理最新的智能体工具、科研效率神兵利器及多媒体黑科技网站。