SuperCLUE

SuperCLUE

中文大模型权威测评

官网: 立即访问

所属分类: AI模型评测

工具介绍
SuperCLUE是中文通用大模型综合性测评基准,由CLUE基准发展而来,多维度考察大模型语言理解、知识、推理、代码、中文特性与安全等能力,按月发布权威排行榜与匿名对战,助力模型效果对比与选型。
SuperCLUE具体信息

SuperCLUE是中文通用大模型综合性测评基准,由CLUEbenchmark(中文语言理解测评基准CLUE团队)于2023年5月正式发布,是CLUE基准在通用人工智能(AGI)时代的发展和延续。
作为独立、领先的通用大模型综合性测评机构,SuperCLUE主要回答一个核心问题:在通用大模型快速发展的当下,中文大模型的效果究竟如何——包括各模型的相对水平、与国际代表性模型的差距,以及与人类表现的对比。
SuperCLUE目前包含OPEN多轮开放式基准、OPT三大能力客观题基准、琅琊榜匿名对战基准三大子基准,从语言理解与生成、知识理解与应用、专业能力、环境适应与安全性四个能力象限出发,对国内外代表性模型进行多维度测试,并按照月度更新榜单,定期发布月报、半年报与年报。

1)多维度综合测评:覆盖语言理解与生成、知识理解与应用、专业能力、环境适应与安全四个能力象限,细分为12项基础能力(早期版本为3大类、70+子能力),全面考察模型的综合表现。
2)三大基准体系:OPEN基准测评多轮开放式对话,OPT基准测评客观选择题,琅琊榜基准提供众包匿名对战,覆盖不同评测场景。
3)自动化一键测评:采用自动化评测技术,可一键对模型进行标准化测评,有效消除人为因素带来的不确定性。
4)独立第三方客观评测:以完全独立第三方的身份发布无偏倚的测评结果,纳入开放主观题与多轮对话,模拟真实应用场景。
5)排行榜与报告:发布总榜、专项榜、多模态、智能体等榜单,并定期发布月度、半年及年度权威报告。
6)扩展专项基准:提供SuperCLUE-V多模态测评、智能体(Agent)任务规划、行业与专项基准等,覆盖更广泛的AI能力。

SuperCLUE使用门槛较低,不同角色可通过以下方式参与:
1)查看榜单:访问官网 www.superclueai.com,查看最新总榜、专项榜、多模态与智能体榜单,快速了解各模型的综合表现。
2)阅读报告:在官网或CLUE官网(www.cluebenchmarks.com)下载月度、半年及年度测评报告,获取详细的评分标准、题目说明与结果分析。
3)参与琅琊榜对战:进入对战平台,同时与两个匿名模型对话并投票,为榜单提供众包评测数据。
4)自测模型:从GitHub(CLUEbenchmark/SuperCLUE)获取开源测评工具与题库,一键对自研模型进行标准化测评,并与主流模型对标。
5)提交模型或合作:开发者可通过官方渠道提交模型参与公测,企业与机构可联系官方进行专项测评与深度合作。

1)体系全面、贴近真实:区别于传统仅靠选择题的测评,SuperCLUE纳入开放主观题与多轮对话,模拟真实应用场景,真实考察模型的生成、上下文理解与记忆能力。
2)独立客观、消除偏见:作为完全独立的第三方评测机构,采用自动化评测技术,有效消除人为因素带来的不确定性,确保结果无偏倚。
3)中文特性突出:除通用能力外,还专门评测字形拼音、诗词、成语、歇后语、方言、对联、古文等中文特性能力,精准衡量模型的中文水平。
4)防过拟合机制:每期公测100%更新题目,并对30%-40%的子任务进行难度与类型调整,确保榜单不被模型刷分。
5)动态演进、紧跟前沿:测评体系随AI热点动态调整,任务类别、题目难度与AI总体水平同步提升,长期反映大模型真实进步。
6)权威认可、影响力广:榜单被学术界与产业界广泛引用,成为衡量中文大模型实力的重要参考。

1)大模型开发者与研发团队:可通过SuperCLUE对自研模型进行标准化测评与能力对标,定位薄弱环节并持续优化模型。
2)企业选型决策者:在选择或替换中文大模型时,可依据SuperCLUE分数与榜单进行横向对比,做出更客观的选型决策。
3)学术研究者:可将SuperCLUE作为评估工具,分析不同模型架构在中文任务上的优劣,开展模型能力对标研究。
4)AI评测机构与投资机构:可参考SuperCLUE的多维度测评体系与结果,评估模型厂商的技术实力与发展趋势。
5)普通用户与AI爱好者:通过公开榜单与报告,快速了解主流大模型的真实水平,避免仅凭宣传做判断。

Q1: SuperCLUE是什么?
A1: SuperCLUE是中文通用大模型综合性测评基准,由CLUE团队于2023年发布,是大模型时代背景下CLUE基准的发展和延续,旨在多维度、客观地测评中文通用大模型的综合能力。
Q2: SuperCLUE三大基准分别测什么?
A2: OPEN基准测评多轮开放式对话能力;OPT基准测评三大能力相关的客观选择题;琅琊榜基准是开放域众包匿名对战评测,让用户与两个匿名模型对话后投票选出更好的模型。
Q3: SuperCLUE和C-Eval有什么区别?
A3: SuperCLUE侧重四象限综合能力加多轮开放式对话,考察更接近真实使用场景;C-Eval侧重学科知识的选择题测评,两者侧重点不同,可互为补充。
Q4: 如何防止模型过拟合测评数据?
A4: SuperCLUE每期公测会对全部题目进行100%更新,并对30%-40%的子任务进行难度与类型调整,同时以半年为单位动态提升题目难度,有效防止刷分。
Q5: SuperCLUE多久更新一次榜单?
A5: SuperCLUE按月度更新排行榜,并定期发布月度、半年及年度报告,题目每两个月全面更新一次。
Q6: 如何参与琅琊榜匿名对战?
A6: 用户可访问www.superclueai.com进入对战平台,同时与两个匿名模型聊天并提交投票,即可为榜单贡献众包评测数据。

SuperCLUE
联系邮箱
CLUEbenchmark@163.com
社交媒体

SuperCLUE数据分析

数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:cluebenchmarks.com。

总访问量

3,140

环比变化

-5.59%

平均停留

00:00:02

跳出率

38.91%

SuperCLUE地区分布
  • United States 34.8%
  • Hong Kong 27.15%
  • Singapore 25.37%
  • Taiwan 12.68%
SuperCLUE搜索关键词
superclue
流量 75,087 搜索量 0 CPC 0
小模型排行榜
流量 3,011 搜索量 0 CPC 0
clue data set
流量 1,036 搜索量 0 CPC 0
superclue-video
流量 102 搜索量 0 CPC 0
clue
流量 63 搜索量 7,000 CPC 1.81
SuperCLUE访问趋势(最近2个月)

SuperCLUE同类推荐

CMMLU
CMMLU

中文大模型评测基准

OpenCompass
OpenCompass

一站式大模型评测

HELM
HELM

斯坦福大模型评测框架

MMBench
MMBench

全方位多模态评测