CMMLU
中文大模型评测基准
官网: 立即访问
所属分类: AI模型评测
工具介绍
CMMLU具体信息
CMMLU(Chinese Massive Multitask Language Understanding,中文多任务语言理解)是由多家高校与科研机构联合提出的综合性大模型中文评估基准,论文发表于ACL 2024 Findings。
它系统评估大语言模型在中文语言与文化背景下的知识储备和推理能力,覆盖67个主题、共11528道单项选择题,是中文评测领域最具影响力的基准之一。
其核心定位是填补中文语境评测的空白:既包含数学、物理等通用学科,也纳入驾驶规则、饮食文化、古汉语等中国特色任务,能更真实地反映模型的中文理解水平。
1. 多学科全面评测:覆盖STEM(17个主题)、人文学科(13个)、社会科学(22个)及其他领域(15个),从基础到高级专业水平,全面衡量模型知识广度。
2. 中国特定知识考察:包含16个中国特有任务,如驾驶规则、饮食文化、教师资格考试等,答案具有中国语境专属特征,难以通过翻译获得。
3. 多种评测范式:支持零样本、少样本及思路链(COT)提示评测,满足不同场景需求。
4. 公开数据集与排行榜:数据与代码完全开源,提供持续更新的模型排行榜,便于横向对比。
5. 主流平台集成:已集成到lm-evaluation-harness、OpenCompass等主流评测框架,可直接调用。
使用CMMLU主要分为三步:
第一步,获取数据:从GitHub(haonan-li/CMMLU)或Hugging Face下载数据集,每个主题包含5道题的开发集和100道以上的测试集。
第二步,运行评测:可通过已集成的lm-evaluation-harness、OpenCompass平台直接评测,或使用仓库src目录下的评测脚本自行打分。
第三步,提交结果:开源模型可提交拉取请求(PR);未开放公测的模型需发送测试代码至官方邮箱,验证数据无污染后即可更新榜单。
完全中国化设计:题目由中文母语标注者人工收集,大量任务仅存在于中国语境,避免了机器翻译带来的文化偏差。
规模大、覆盖广:67个主题、11528道题目,远超多数同类中文基准,兼顾学术知识与生活常识。
数据质量可控:数据多来源于非公开材料、模拟考试和知识竞赛,超80%来自PDF(OCR提取),有效降低题目混入模型训练集的风险。
开放共享:数据与代码完全公开,免费供社区使用,极大降低了中文模型评测的门槛。
与MMLU相比:MMLU是英文基准,以西方文化为背景,直接翻译并不适合评测中文模型;CMMLU完全面向中文语境,含驾驶规则、饮食文化等本土化任务。
与C-Eval相比:C-Eval多取材于标准化考试;CMMLU额外纳入10余个日常生活相关主题,并同时覆盖中国特定知识与世界通用知识,覆盖面更广。
与AGIEval等相比:CMMLU数据完全公开,任何团队都可免费复现评测,在可复现性与社区友好度上更具优势。
Q1: CMMLU的全称是什么?
A1: 全称是Chinese Massive Multitask Language Understanding,即中文多任务语言理解评估基准。
Q2: CMMLU包含多少题目和主题?
A2: 共包含11528道单项选择题,覆盖67个主题,每个主题测试集包含100道以上题目。
Q3: CMMLU与MMLU有什么区别?
A3: MMLU是英文基准,偏向西方文化;CMMLU面向中文语境,含中国特定任务,更能反映模型的中文知识与推理能力。
Q4: CMMLU的数据是否免费开放?
A4: 是的,数据集与评测代码已在GitHub和Hugging Face上完全公开,可免费下载使用。
Q5: 如何将模型成绩提交到排行榜?
A5: 开源模型可通过拉取请求(PR)提交测试结果;未开放公测的模型需发送测试代码至官方邮箱,经验证无数据污染后更新榜单。
Q6: 模型的平均得分多少算合格?
A6: 以中国考试60分为及格线,当前多数大模型平均准确率难以达到60%(随机水平为25%),该基准挑战性较高。
CMMLU数据分析
数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:github.com。
总访问量
615,240,000
环比变化
-3.28%
平均停留
00:06:23
跳出率
36.34%
- 直接访问 52.10%
- 搜索引擎 25.35%
- 展示广告 0.27%
- 引荐流量 9.88%
- 社交媒体 9.24%
- 邮件 1.16%
- 其他 1.99%
- United States 19.35%
- China 11.29%
- India 10.2%
- Russia 8.43%
- Germany 4.06%