CMMLU

CMMLU

中文大模型评测基准

官网: 立即访问

所属分类: AI模型评测

工具介绍
CMMLU是专为中文设计的大模型综合评估基准,覆盖STEM、人文、社科等67个学科主题、11528道题目,全面检验模型在中文语境下的知识储备与推理能力,为开发者选型与模型优化提供权威参考。
CMMLU具体信息

CMMLU(Chinese Massive Multitask Language Understanding,中文多任务语言理解)是由多家高校与科研机构联合提出的综合性大模型中文评估基准,论文发表于ACL 2024 Findings。
它系统评估大语言模型在中文语言与文化背景下的知识储备和推理能力,覆盖67个主题、共11528道单项选择题,是中文评测领域最具影响力的基准之一。
其核心定位是填补中文语境评测的空白:既包含数学、物理等通用学科,也纳入驾驶规则、饮食文化、古汉语等中国特色任务,能更真实地反映模型的中文理解水平。

1. 多学科全面评测:覆盖STEM(17个主题)、人文学科(13个)、社会科学(22个)及其他领域(15个),从基础到高级专业水平,全面衡量模型知识广度。
2. 中国特定知识考察:包含16个中国特有任务,如驾驶规则、饮食文化、教师资格考试等,答案具有中国语境专属特征,难以通过翻译获得。
3. 多种评测范式:支持零样本、少样本及思路链(COT)提示评测,满足不同场景需求。
4. 公开数据集与排行榜:数据与代码完全开源,提供持续更新的模型排行榜,便于横向对比。
5. 主流平台集成:已集成到lm-evaluation-harness、OpenCompass等主流评测框架,可直接调用。

使用CMMLU主要分为三步:
第一步,获取数据:从GitHub(haonan-li/CMMLU)或Hugging Face下载数据集,每个主题包含5道题的开发集和100道以上的测试集。
第二步,运行评测:可通过已集成的lm-evaluation-harness、OpenCompass平台直接评测,或使用仓库src目录下的评测脚本自行打分。
第三步,提交结果:开源模型可提交拉取请求(PR);未开放公测的模型需发送测试代码至官方邮箱,验证数据无污染后即可更新榜单。

完全中国化设计:题目由中文母语标注者人工收集,大量任务仅存在于中国语境,避免了机器翻译带来的文化偏差。
规模大、覆盖广:67个主题、11528道题目,远超多数同类中文基准,兼顾学术知识与生活常识。
数据质量可控:数据多来源于非公开材料、模拟考试和知识竞赛,超80%来自PDF(OCR提取),有效降低题目混入模型训练集的风险。
开放共享:数据与代码完全公开,免费供社区使用,极大降低了中文模型评测的门槛。

与MMLU相比:MMLU是英文基准,以西方文化为背景,直接翻译并不适合评测中文模型;CMMLU完全面向中文语境,含驾驶规则、饮食文化等本土化任务。
与C-Eval相比:C-Eval多取材于标准化考试;CMMLU额外纳入10余个日常生活相关主题,并同时覆盖中国特定知识与世界通用知识,覆盖面更广。
与AGIEval等相比:CMMLU数据完全公开,任何团队都可免费复现评测,在可复现性与社区友好度上更具优势。

Q1: CMMLU的全称是什么?
A1: 全称是Chinese Massive Multitask Language Understanding,即中文多任务语言理解评估基准。
Q2: CMMLU包含多少题目和主题?
A2: 共包含11528道单项选择题,覆盖67个主题,每个主题测试集包含100道以上题目。
Q3: CMMLU与MMLU有什么区别?
A3: MMLU是英文基准,偏向西方文化;CMMLU面向中文语境,含中国特定任务,更能反映模型的中文知识与推理能力。
Q4: CMMLU的数据是否免费开放?
A4: 是的,数据集与评测代码已在GitHub和Hugging Face上完全公开,可免费下载使用。
Q5: 如何将模型成绩提交到排行榜?
A5: 开源模型可通过拉取请求(PR)提交测试结果;未开放公测的模型需发送测试代码至官方邮箱,经验证无数据污染后更新榜单。
Q6: 模型的平均得分多少算合格?
A6: 以中国考试60分为及格线,当前多数大模型平均准确率难以达到60%(随机水平为25%),该基准挑战性较高。

CMMLU
联系邮箱
haonan.li@librai.tech
社交媒体

CMMLU数据分析

数据更新于 2026-09-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:github.com。

总访问量

649,320,000

环比变化

1.79%

平均停留

00:06:24

跳出率

36.66%

CMMLU访问来源占比
  • 直接访问 52.60%
  • 搜索引擎 24.56%
  • 展示广告 0.24%
  • 引荐流量 9.56%
  • 社交媒体 9.54%
  • 邮件 1.15%
  • 其他 2.34%
CMMLU地区分布
  • United States 18.61%
  • China 11.66%
  • India 10.47%
  • Russia 8.33%
  • Germany 4.11%
CMMLU搜索关键词
github
流量 11,330,000 搜索量 10,020,000 CPC 1.631
tamilmv
流量 1,660,000 搜索量 478,800 CPC 0.76
desihub
流量 506,620 搜索量 241,400 CPC 0.42
yt-dlp
流量 478,520 搜索量 638,970 CPC 4.63
CMMLU访问趋势(最近3个月)

CMMLU同类推荐

FlagEval
FlagEval

大模型权威评测平台

OpenCompass
OpenCompass

一站式大模型评测

PubMedQA
PubMedQA

生物医学问答评测

MMBench
MMBench

全方位多模态评测