OpenCompass

OpenCompass

一站式大模型评测

官网: 立即访问

所属分类: AI模型评测

工具介绍
OpenCompass是上海人工智能实验室开源的开放评测体系,覆盖学科、语言、知识、理解、推理五大维度,支持大语言模型与多模态模型一站式评测,开源可复现,定期发布权威榜单,助力大模型能力量化与选型。
OpenCompass具体信息

OpenCompass(中文名“司南”)是由上海人工智能实验室推出的开源开放大模型评测体系,为大语言模型和多模态大模型提供一站式、全流程的能力量化评测服务。

自2023年正式推出以来,OpenCompass已成为国内最具影响力的大模型评测平台之一,其评测榜单被Hugging Face官方收录;2024年发布的2.0版本进一步将评测范围扩展至AI计算系统、具身智能、安全可信及垂类行业应用等五大领域,构建起“五位一体”的全景评估范式。

OpenCompass的核心定位是“评测体系”而非单一工具,包含评测榜单(CompassRank)、基准社区(CompassHub)和全栈工具链(CompassKit)三大模块,以纯粹技术及中立视角,为产学研各界提供客观、权威、可复现的大模型能力参考。

1. 全面能力评测:覆盖语言、知识、理解、推理、考试及安全等能力维度,整合70余个评测数据集、超40万道评测问题,并提供长文本、代码、工具调用等特色能力评测。

2. 丰富模型支持:支持70余种开源模型及HuggingFace承载的主流模型,预留简洁接口可接入OpenAI、Claude等API模型,也支持自定义模型评测。

3. 分布式高效评测:原生支持分布式并行与负载均衡,资源充足时最快约3小时即可完成千亿参数量级模型的全面评测。

4. 多样化评测方式:提供零样本、小样本、思维链(CoT)等评测策略,支持判别式(ppl)与生成式(gen)客观评测,以及人类反馈与模型辅助打分的主观评测。

5. 多模态评测能力:自建MMBench数据集,从感知到认知逐级评估视觉语言模型,并收录SEED-Bench、MME、ScienceQA等十余个多模态评测集。

6. 开源可复现与榜单发布:全链路开源,数据集与提示词可一键下载;定期发布公开榜单,接受社区评测申请并实时更新结果。

在OpenCompass中评估一个模型通常遵循“配置→推理→评估→可视化”四阶段流程:

1. 环境安装:git clone OpenCompass仓库后,执行pip install -e .完成安装。

2. 选择模型与数据集:模型和数据集配置文件预置于configs/models与configs/datasets目录,可用tools/list_configs.py查看或过滤可用配置。

3. 配置评测任务:通过命令行指定,如python run.py --models <模型> --datasets <数据集>;也可编写包含datasets和models字段的Python配置文件后运行。

4. 启动评测:首次运行建议加--debug参数顺序执行以检查问题,正常模式下任务后台并行执行,并支持Slurm集群与多卡环境。

5. 查看结果:评测完成后结果以CSV和TXT表格输出到工作目录,支持定制化展示数据集平均分,并可激活飞书状态上报功能。

中立客观:以纯粹技术视角构建评测体系,榜单不受商业利益干扰,为产学研界提供可信的模型能力参照。

全栈覆盖:从能力维度设计、数据集构建、评测方法到分布式工具链与榜单发布形成完整闭环,覆盖从底层算力到上层智能的全链路关键能力。

高效可复现:原生分布式评测大幅提升效率;数据集、提示词与评测代码全链路公开,确保评测结果可被完整复现,支撑模型“训练-评测”快速迭代。

生态开放活跃:被Hugging Face官方收录,并携手高校与头部企业推出LawBench(法律)、MedBench(医疗)、OpenFinData(金融)、SecBench(网络安全)等垂直领域评测基准,共建开放评测生态。

相比Hugging Face Open LLM Leaderboard、LMSYS Chatbot Arena、Stanford HELM等主流评测体系,OpenCompass的差异化优势体现在:

中文覆盖更全面:构建超过1.5万道中英文双语问题,针对中文场景的评测粒度与模型适配更具优势。

开源可复现性更强:完整开源评测框架、数据集及提示词,用户可本地复现全部结果,而部分竞品仅提供榜单展示、评测细节不透明。

评测方法更立体:同时支持客观与主观评测、判别式与生成式评测路径,多数竞品仅采用单一评测方式。

本地生态更紧密:与书生·浦语、Qwen、GLM等国产模型深度适配,提供完善的中文文档与社区支持,降低国内用户的使用门槛。

Q1: OpenCompass支持哪些类型的模型?
A1: 支持基座模型、对话模型及多模态大模型,可评测70余种开源模型,并预留接口支持OpenAI、Claude等API模型及自定义模型。
Q2: OpenCompass支持哪些评测数据集?
A2: 整合70余个评测数据集、超40万道评测问题,覆盖知识、语言、理解、推理、考试等维度,并支持长文本、安全、代码及多模态等特色评测。
Q3: 如何快速开始使用OpenCompass?
A3: 克隆仓库并安装后,运行python run.py --models <模型> --datasets <数据集> --debug即可启动最小化评测,详细步骤可参考官方文档“快速开始”章节。
Q4: 运行OpenCompass需要什么硬件资源?
A4: 评测大模型通常需要GPU,较小参数模型可在单卡上运行,大参数模型建议使用多卡或集群,OpenCompass原生支持分布式评测。
Q5: OpenCompass的评测结果能否复现?
A5: 可以。OpenCompass全链路开源,所有数据集及各版本提示词均可一键下载,评测代码公开透明,确保结果可被完整复现。
Q6: OpenCompass如何保证评测的公平性?
A6: 通过全面能力维度覆盖避免模型“偏科”、为数据集提供多版本提示词、首创循环评估(Circular Evaluation)策略,并采用中立公开的榜单机制,最大程度保证评测的公平与客观。

OpenCompass

OpenCompass数据分析

数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:opencompass.org.cn。

总访问量

23,720

环比变化

17.09%

平均停留

00:01:42

跳出率

35.60%

OpenCompass访问来源占比
  • 直接访问 45.74%
  • 搜索引擎 34.25%
  • 引荐流量 13.66%
  • 社交媒体 2.47%
  • 其他 3.87%
OpenCompass地区分布
  • China 71.06%
  • Taiwan 7.08%
  • United States 7.07%
  • Singapore 5.18%
  • Vietnam 3.49%
OpenCompass搜索关键词
opencompass
流量 1,490 搜索量 1,720 CPC 0.68
多模态大模型排行榜
流量 4,904 搜索量 0 CPC 0
司南排行版
流量 210 搜索量 0 CPC 0
医疗大模型平台
流量 140 搜索量 0 CPC 0
mmbench
流量 12,021 搜索量 0 CPC 0
OpenCompass访问趋势(最近2个月)

OpenCompass同类推荐

FlagEval
FlagEval

大模型权威评测平台

AGI-Eval
AGI-Eval

AI大模型评测社区

Open LLM Leaderboard
Open LLM Leaderboard

开源大模型排行榜

LLMEval3
LLMEval3

复旦大模型评测基准