MMBench
全方位多模态评测
官网: 立即访问
所属分类: AI模型评测
工具介绍
MMBench具体信息
MMBench是由上海人工智能实验室OpenCompass团队联合南洋理工大学、香港中文大学等机构于2023年提出的多模态大模型(视觉-语言模型,VLM)能力评测体系,论文入选ECCV 2024。
它从“多模态模型是否是全能球员”这一核心问题出发,针对传统评测方式存在的主观评测难复现、客观评测任务覆盖少、答案匹配粗糙易产生假阳性等痛点,自上而下定义了三级能力维度,并构建了包含数千道单项选择题的评测数据集。
MMBench以中英双语形式提供,覆盖目标定位、图像质量、关系推理、逻辑推理等20个细粒度能力维度,旨在为视觉-语言模型提供客观、全面、可复现的“能力体检”标准,已成为多模态大模型领域公认的评测基准之一。
三级能力维度体系:自上而下定义能力结构,L1分为感知与推理两大能力,L2细化为6项能力,L3进一步拆分为20个细粒度能力维度,每个维度收集超过75道题目,确保评估的全面性与稳定性。
大规模双语数据集:提供英文(en)与中文(cn)两个子集,含开发集与测试集,题目统一为多选一形式,便于不同模型间的横向比较。
CircularEval循环评测策略:将题目选项按环状顺序多次重排,仅当模型在每次重排中都回答正确时才判定该题通过,有效消除随机猜测与选项顺序偏差。
ChatGPT辅助答案匹配:当模型输出不包含标准选项标签时,借助ChatGPT将自由文本输出匹配到最相近选项并输出对应标签,减少因表述差异导致的误判。
开放排行榜与评测工具:深度集成VLMEvalKit、OpenCompass、EvalScope等工具链,支持一键评测并提交至MMBench排行榜,输出按能力类别划分的细粒度诊断报告。
使用MMBench评测模型主要分为四步:
1. 环境准备:安装PyTorch等依赖,从GitHub克隆MMBench或VLMEvalKit仓库并安装项目依赖。
2. 数据与模型配置:下载开发集/测试集数据,通过命令行或配置文件指定待评测模型,支持HuggingFace模型、API模型等多种接入方式。
3. 运行评测:执行评测脚本,例如 python run.py --model <模型名> --data MMBench_TEST_EN --mode infer,可使用LMDeploy、vLLM等推理框架加速评测过程。
4. 结果提交与分析:将生成的Excel结果文件提交至MMBench排行榜,即可查看总体得分及各能力维度的详细表现。
此外,用户也可以直接访问 opencompass.org.cn/MMBench 查看已有主流模型的评测结果与排名。
评测体系系统化:不同于传统单任务评测,MMBench以“能力维度”而非“任务”为组织单位,覆盖从粗粒度感知到细粒度推理的完整能力谱系,能够精准定位模型的具体短板,为模型迭代提供明确方向。
结果稳定可靠:CircularEval通过多次选项重排验证回答一致性,配合ChatGPT的语义匹配,评测结果与人工判断高度吻合,可复现性强,显著降低了传统exact matching带来的假阳性问题。
双语跨文化评估:中英文版本在相同题目结构下进行“苹果对苹果”的对比,能够反映模型在不同语言与知识背景下的真实表现,为跨语言多模态研究提供数据支撑。
生态完善开放:与OpenCompass、VLMEvalKit等主流评测工具深度集成,支持数十种主流模型的开箱即用评测,社区活跃、持续更新,并已被HuggingFace收录。
当前多模态评测基准主要有MMBench、SEED-Bench、MME等,三者定位各有侧重。
与SEED-Bench相比:SEED-Bench覆盖图像与视频、问题类型混合、数据规模较大(约1.9万题),偏重复杂场景理解;而MMBench以图像单选题为主,更聚焦“能力维度”的细粒度拆解与诊断,便于针对性优化模型。
与MME相比:MME侧重感知与认知两类任务的粗粒度评估,评测粒度较粗;MMBench则通过三级能力维度和CircularEval策略,提供更精细、更稳定的评测结果。
总体而言,MMBench以“能力导向+循环评测+双语覆盖”的组合形成了差异化优势,在评测的可解释性与严谨性上表现突出,是目前社区使用最广泛的多模态模型评测基准之一。
Q1: MMBench是免费的吗?
A1: 是的。MMBench是完全开源免费的评测体系,其代码、数据与评测工具均对研究社区开放,任何人都可以免费使用、提交结果并查看排行榜。
Q2: MMBench支持哪些模型?
A2: MMBench支持几乎所有主流多模态大模型,包括GPT-4V等商业模型,以及LLaVA、MiniGPT-4、InstructBLIP、VisualGLM、Qwen-VL等开源模型,可通过VLMEvalKit接入HuggingFace模型或API模型。
Q3: 什么是CircularEval?
A3: CircularEval是MMBench提出的循环评测策略:将每道题的选项按环状顺序多次重排,只有当模型在每次重排中都回答正确时才判定该题通过,从而消除随机猜测带来的误差,更真实地反映模型能力。
Q4: 如何将评测结果提交到排行榜?
A4: 使用官方VLMEvalKit运行 python run.py --model <模型名> --data MMBench_TEST_EN --mode infer 生成结果文件,然后通过MMBench官方网站的提交系统上传即可参与排行榜排名。
Q5: MMBench与MMBench-CN有什么区别?
A5: MMBench包含英文(en)和中文(cn)两个子集,MMBench-CN即其中文子集,专门用于评估模型在中文语境下的多模态理解能力;英文子集则用于跨语言对比,两者共用相同的题目结构与能力维度。
MMBench数据分析
数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:opencompass.org.cn。
总访问量
23,720
环比变化
17.09%
平均停留
00:01:42
跳出率
35.60%
- 直接访问 45.74%
- 搜索引擎 34.25%
- 引荐流量 13.66%
- 社交媒体 2.47%
- 其他 3.87%
- China 71.06%
- Taiwan 7.08%
- United States 7.07%
- Singapore 5.18%
- Vietnam 3.49%