MMLU
多任务语言理解基准
官网: 立即访问
所属分类: AI模型评测
工具介绍
MMLU具体信息
MMLU(Massive Multitask Language Understanding,大规模多任务语言理解)是由加州大学伯克利分校研究团队于2020年9月推出的综合性评测基准,核心定位是衡量大型语言模型在预训练阶段获取的世界知识与跨领域推理能力。
与传统的单一任务评测不同,MMLU通过大规模多学科多项选择题的形式,要求模型在不经过任务微调的情况下,直接回答横跨STEM(科学、技术、工程、数学)、人文学科、社会科学及其他领域的57个学科问题。
MMLU共包含15,908道四选一选择题,每个学科至少100道题目,难度从基础水平覆盖到高级专业级别,如法律、医学、计算机科学等。它采用零样本(zero-shot)和少样本(few-shot)两种评测模式,如今已成为全球范围内衡量大模型知识广度与综合能力的事实标准。
跨学科知识广度评估:覆盖数学、历史、法律、医学、物理、计算机科学等57个学科,全面检验模型的多领域知识储备。
零样本与少样本推理:通过零样本(不提供示例)和少样本(提供若干示例)两种设置,考察模型的泛化能力与情境学习(in-context learning)能力。
难度分级测试:从基础到专业级的题目难度,能够有效区分模型在常识知识与高阶专业知识上的表现差异。
细粒度结果报告:支持按单个学科或四大类别(STEM、人文学科、社会科学、其他)分别统计准确率,帮助研究者精准定位模型的薄弱环节。
标准化模型对比:提供统一的提示模板与评分指标(准确率acc),便于不同模型之间的横向比较与榜单排名。
生态扩展:衍生出MMLU-Pro(增加复杂推理题)、CMMLU(中文版)等变体,并集成于OpenCompass、EvalScope、lm-eval-harness等主流评测框架。
获取数据集:从官方GitHub仓库或Hugging Face等平台下载MMLU数据,数据分为dev(开发集,用于少样本示例)和test(测试集,用于最终评分)。
准备模型与提示:模型需接收包含四个选项(A/B/C/D)的问题文本,并输出单个正确答案字母。默认使用dev集的5-shot示例,也可选择零样本模式。
选择评测框架:可直接使用OpenCompass、EvalScope等开源工具运行评测,也可自行编写推理脚本调用模型API进行批量评测。
运行与统计:对测试集逐题推理并记录答案,按学科和类别计算准确率,最终汇总得到模型的MMLU总分。
结果解读:将得分与公开模型榜单、人类基线(非专业人士约34.5%)对比,评估模型的知识覆盖水平与综合能力。
覆盖面广:57个学科、近1.6万道题目,从抽象代数到美国外交政策,是目前评估大模型知识广度最全面的基准之一。
难度分层合理:涵盖基础到专业级知识,能够有效拉开不同能力模型之间的分数差距,避免早期基准普遍存在的天花板效应。
评测方式严谨:采用零样本与少样本双模式,减少对特定任务数据的过拟合,侧重考察模型在预训练阶段真正学到的知识。
行业认可度高:截至2024年底,全球超过76%的大模型研究论文使用MMLU进行能力验证,并被斯坦福大学HELM框架纳入标准化测评体系。
可解释性强:按学科细粒度报告分数,研究者可直观定位模型擅长与薄弱的领域,为后续训练与优化指明方向。
大模型研究者与工程师:用于验证模型训练效果、对比不同架构、参数规模或训练策略的优劣,是迭代优化的核心参考指标。
AI评测与基准开发人员:以MMLU为参照设计新评测体系,或将其作为榜单基准持续跟踪模型能力演进趋势。
高校与科研机构:在学术论文中将MMLU得分作为模型能力的标准化证据,支撑人工智能前沿研究。
模型选型决策者:企业或组织在选择开源或商业大模型时,参考MMLU分数评估候选模型的知识水平与综合表现。
AI产品开发者:通过细粒度学科成绩了解模型在特定业务领域(如法律、医疗、金融)的知识表现,辅助产品方案设计与能力边界判断。
Q1: MMLU是什么时候推出的,由谁开发?
A1: MMLU由加州大学伯克利分校的Dan Hendrycks等研究者于2020年9月发布,旨在评估语言模型在预训练阶段获得的多学科知识。
Q2: MMLU包含多少道题目和多少个学科?
A2: MMLU共包含15,908道四选一选择题,覆盖57个学科,分为STEM、人文学科、社会科学和其他四大类别。
Q3: MMLU与MMLU-Pro有什么区别?
A3: MMLU-Pro是2024年发布的增强版,通过筛选冗余题目、增加多步骤逻辑推理和代码理解等复杂问题提高评测难度,将顶尖模型的得分上限提升至约89%。
Q4: 人类在MMLU上能得多少分?
A4: 据原论文测试,非专业人类答题者的平均准确率约为34.5%,说明MMLU中专业级问题难度较高;而顶尖大模型目前得分可达85%以上。
Q5: MMLU存在哪些局限性?
A5: MMLU存在数据污染风险(部分题目可能已出现在训练集中)、个别题目答案有误(有研究估计约6.5%的题目存在错误)以及基准趋于饱和等问题,因此社区已推出MMLU-Pro等更难的替代评测。
Q6: 有中文版的MMLU吗?
A6: 有。CMMLU是专门的中文多任务语言理解基准,涵盖67个中文主题,用于评估模型在中文语境下的知识与推理能力。
MMLU数据分析
数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:paperswithcode.com。
总访问量
71,570
环比变化
9.81%
平均停留
00:00:03
跳出率
78.58%
- 直接访问 81.46%
- 搜索引擎 5.87%
- 引荐流量 5.90%
- 社交媒体 6.77%
- Azerbaijan 57.35%
- Kazakhstan 37.14%
- India 2.14%
- Indonesia 1.07%
- Ireland 0.92%