OpenCompass
一站式大模型评测
官网: 立即访问
所属分类: AI模型评测
工具介绍
OpenCompass具体信息
OpenCompass(中文名“司南”)是由上海人工智能实验室推出的开源开放大模型评测体系,为大语言模型和多模态大模型提供一站式、全流程的能力量化评测服务。
自2023年正式推出以来,OpenCompass已成为国内最具影响力的大模型评测平台之一,其评测榜单被Hugging Face官方收录;2024年发布的2.0版本进一步将评测范围扩展至AI计算系统、具身智能、安全可信及垂类行业应用等五大领域,构建起“五位一体”的全景评估范式。
OpenCompass的核心定位是“评测体系”而非单一工具,包含评测榜单(CompassRank)、基准社区(CompassHub)和全栈工具链(CompassKit)三大模块,以纯粹技术及中立视角,为产学研各界提供客观、权威、可复现的大模型能力参考。
1. 全面能力评测:覆盖语言、知识、理解、推理、考试及安全等能力维度,整合70余个评测数据集、超40万道评测问题,并提供长文本、代码、工具调用等特色能力评测。
2. 丰富模型支持:支持70余种开源模型及HuggingFace承载的主流模型,预留简洁接口可接入OpenAI、Claude等API模型,也支持自定义模型评测。
3. 分布式高效评测:原生支持分布式并行与负载均衡,资源充足时最快约3小时即可完成千亿参数量级模型的全面评测。
4. 多样化评测方式:提供零样本、小样本、思维链(CoT)等评测策略,支持判别式(ppl)与生成式(gen)客观评测,以及人类反馈与模型辅助打分的主观评测。
5. 多模态评测能力:自建MMBench数据集,从感知到认知逐级评估视觉语言模型,并收录SEED-Bench、MME、ScienceQA等十余个多模态评测集。
6. 开源可复现与榜单发布:全链路开源,数据集与提示词可一键下载;定期发布公开榜单,接受社区评测申请并实时更新结果。
在OpenCompass中评估一个模型通常遵循“配置→推理→评估→可视化”四阶段流程:
1. 环境安装:git clone OpenCompass仓库后,执行pip install -e .完成安装。
2. 选择模型与数据集:模型和数据集配置文件预置于configs/models与configs/datasets目录,可用tools/list_configs.py查看或过滤可用配置。
3. 配置评测任务:通过命令行指定,如python run.py --models <模型> --datasets <数据集>;也可编写包含datasets和models字段的Python配置文件后运行。
4. 启动评测:首次运行建议加--debug参数顺序执行以检查问题,正常模式下任务后台并行执行,并支持Slurm集群与多卡环境。
5. 查看结果:评测完成后结果以CSV和TXT表格输出到工作目录,支持定制化展示数据集平均分,并可激活飞书状态上报功能。
中立客观:以纯粹技术视角构建评测体系,榜单不受商业利益干扰,为产学研界提供可信的模型能力参照。
全栈覆盖:从能力维度设计、数据集构建、评测方法到分布式工具链与榜单发布形成完整闭环,覆盖从底层算力到上层智能的全链路关键能力。
高效可复现:原生分布式评测大幅提升效率;数据集、提示词与评测代码全链路公开,确保评测结果可被完整复现,支撑模型“训练-评测”快速迭代。
生态开放活跃:被Hugging Face官方收录,并携手高校与头部企业推出LawBench(法律)、MedBench(医疗)、OpenFinData(金融)、SecBench(网络安全)等垂直领域评测基准,共建开放评测生态。
相比Hugging Face Open LLM Leaderboard、LMSYS Chatbot Arena、Stanford HELM等主流评测体系,OpenCompass的差异化优势体现在:
中文覆盖更全面:构建超过1.5万道中英文双语问题,针对中文场景的评测粒度与模型适配更具优势。
开源可复现性更强:完整开源评测框架、数据集及提示词,用户可本地复现全部结果,而部分竞品仅提供榜单展示、评测细节不透明。
评测方法更立体:同时支持客观与主观评测、判别式与生成式评测路径,多数竞品仅采用单一评测方式。
本地生态更紧密:与书生·浦语、Qwen、GLM等国产模型深度适配,提供完善的中文文档与社区支持,降低国内用户的使用门槛。
Q1: OpenCompass支持哪些类型的模型?
A1: 支持基座模型、对话模型及多模态大模型,可评测70余种开源模型,并预留接口支持OpenAI、Claude等API模型及自定义模型。
Q2: OpenCompass支持哪些评测数据集?
A2: 整合70余个评测数据集、超40万道评测问题,覆盖知识、语言、理解、推理、考试等维度,并支持长文本、安全、代码及多模态等特色评测。
Q3: 如何快速开始使用OpenCompass?
A3: 克隆仓库并安装后,运行python run.py --models <模型> --datasets <数据集> --debug即可启动最小化评测,详细步骤可参考官方文档“快速开始”章节。
Q4: 运行OpenCompass需要什么硬件资源?
A4: 评测大模型通常需要GPU,较小参数模型可在单卡上运行,大参数模型建议使用多卡或集群,OpenCompass原生支持分布式评测。
Q5: OpenCompass的评测结果能否复现?
A5: 可以。OpenCompass全链路开源,所有数据集及各版本提示词均可一键下载,评测代码公开透明,确保结果可被完整复现。
Q6: OpenCompass如何保证评测的公平性?
A6: 通过全面能力维度覆盖避免模型“偏科”、为数据集提供多版本提示词、首创循环评估(Circular Evaluation)策略,并采用中立公开的榜单机制,最大程度保证评测的公平与客观。
OpenCompass数据分析
数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:opencompass.org.cn。
总访问量
23,720
环比变化
17.09%
平均停留
00:01:42
跳出率
35.60%
- 直接访问 45.74%
- 搜索引擎 34.25%
- 引荐流量 13.66%
- 社交媒体 2.47%
- 其他 3.87%
- China 71.06%
- Taiwan 7.08%
- United States 7.07%
- Singapore 5.18%
- Vietnam 3.49%