LLMEval3

LLMEval3

复旦大模型评测基准

官网: 立即访问

所属分类: AI模型评测

工具介绍
LLMEval3由复旦大学NLP实验室推出,是国内权威的大模型评测基准。覆盖13个学科门类、50余个二级学科及约20万道生成式问答题目,采用防作弊题库模式与自动评分机制,为研究人员、开发者与企业提供公平客观、可复现的模型能力评估,助力中文大模型发展。
LLMEval3具体信息

LLMEval3(Large Language Model Evaluation-3)是由复旦大学自然语言处理实验室推出的大模型评测基准,也是LLMEval系列(LLMEval-1、LLMEval-2)的第三代升级版本。

它以“题库考试”为核心模式,聚焦于中文大模型的专业知识能力评测,覆盖哲学、经济学、法学、教育学、文学、历史学、理学、工学、农学、医学、军事学、管理学、艺术学等教育部划定的13个学科门类、50余个二级学科,累计约20万道标准生成式问答题目。

与传统静态基准不同,LLMEval3是一套动态评估框架,依托专有的22万道研究生级私有问题库,通过随机抽样、抗污染数据管理与校准的大模型评分机制,力图真实、稳健、公平地衡量大模型的知识储备与推理能力,为学术界和产业界提供可复现、可比较的权威评测参考。

多学科专业知识评测:涵盖13个学科门类与50余个二级学科,题目来源包括大学本科课后作业、期中期末考试、研究生入学考试等非公开渠道,确保数据的原创性与防污染性。

生成式问答形式:统一采用简答、计算、判断、辨析、写作等生成式题型,相比选择题更能反映用户真实使用场景与模型语言能力。

动态防作弊机制:采用“题库考试”模式,每次评测从题库中随机抽样约1000题,同一模型的每次评测题目不重复,题目串行发送,有效防止刷榜、刷分与数据记忆。

自动化评分流程:采用校准的LLM-as-Judge方法自动打分,每道题0-3分,评分聚焦于核心正确性与解释正确性,与人类专家评分一致性达90%。

双指标体系:同时提供绝对分数与相对排名,相对分数以GPT-3.5-turbo和GPT-4的表现为参照分位,实现跨模型的公平比较。

纵向评测追踪:支持对同一模型进行多轮次、长期持续的评测,帮助观察模型能力随版本迭代的演变趋势。

第一步,访问LLMEval3官方网站(http://llmeval.com/),注册并登录账号;开发者也可通过GitHub仓库(github.com/llmeval/llmeval-3)获取相关资料与代码。

第二步,准备待评测的大模型,确保模型可通过API或其他方式与评测系统交互,并填写必要的模型信息与配置。

第三步,在平台提交模型评测申请,系统将自动从私有题库中随机抽取约1000道题目,以在线串行方式完成全自动评测。

第四步,评测完成后在平台查看详细报告,包括各项指标得分、相对排名、对比图表等,据此分析模型在专业知识、推理等维度的表现。

抗数据污染:采用私有问题库与动态随机抽样机制,并辅以结构变体,有效规避模型记忆与数据泄露带来的虚假高分,评测结果更接近模型真实能力。

评测稳健可靠:经过长达20个月、覆盖近50个主流模型的纵向研究验证,其排名在多次重抽样与样本量变化下保持高度稳定,不易受污染影响。

权威且可信:评分采用校准的大模型自动评测方法,与人类专家评分一致性达到约90%,兼具自动化效率与人工评审的严谨性。

完全免费开源:LLMEval3对研究社区完全免费开放,用户无需付费即可使用评测功能、查看排行榜并下载评测报告,降低了学术研究与技术选型的门槛。

目前中文大模型评测领域的主要基准包括SuperCLUE(中文通用大模型综合性测评基准)和OpenCompass(上海人工智能实验室的大模型开放评测体系)。

多数同类基准采用公开的静态题库,模型在训练时容易接触到题目,导致“刷榜”“刷分”和数据污染问题。LLMEval3则首创动态评估范式,依托非公开的私有题库进行随机抽样,并通过抗污染数据管理与防加热架构,显著提升了评测结果的可信度。

在评测维度上,LLMEval3聚焦中文专业知识能力,覆盖教育部划定的13个学科门类、50余个二级学科,学科广度在同类基准中处于领先水平。

在评分机制上,LLMEval3采用校准的LLM-as-Judge自动评分并结合相对排名系统,既保证了大规模评测的效率,也通过人类一致性验证(约90%)保障了公平性,为动态评估树立了新标杆。

Q1: LLMEval3与LLMEval-1、LLMEval-2有什么区别?
A1: LLMEval-1侧重通用能力评测,LLMEval-2聚焦专业领域评测,LLMEval3则是第三代升级版本,采用动态评估框架,依托22万道私有问题库与抗污染机制,显著提升了评测的稳健性与公平性。
Q2: LLMEval3是免费的吗?
A2: 是的,LLMEval3完全免费开源,用户无需支付任何费用即可使用全部评测功能、查看排行榜并下载评测报告,所有资源面向研究社区开放。
Q3: 每次评测的题目会重复吗?
A3: 不会。每次评测会从私有题库中随机抽取约1000道题,同一模型每次评测的题目均不重复,且题目采用串行方式发送,可有效防止爬取与刷分。
Q4: 可以评测哪些大模型?
A4: 只要是能够通过API或接口接入的中文大模型均可参与评测。平台已对近50个主流模型开展长期评测,研究者也可以提交自有模型获取评测结果。
Q5: 自动评分的结果可靠吗?
A5: 可靠。LLMEval3采用校准的大模型自动评分(LLM-as-Judge),每道题按0-3分计分,评分聚焦于回答的核心正确性与解释正确性,其评分与人类专家的一致性达到约90%。

LLMEval3
社交媒体
LLMEval3的标签
LLM evaluation benchmark language model NLP AI

LLMEval3数据分析

数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:llmeval.com。

总访问量

250

环比变化

0.00%

平均停留

00:00:00

跳出率

38.42%

LLMEval3地区分布
  • United States 100%
LLMEval3搜索关键词
llmevals.com is s website
流量 18,020 搜索量 0 CPC 0
llmeval
流量 9,010 搜索量 0 CPC 0
llmeval-med
流量 21 搜索量 0 CPC 0
LLMEval3访问趋势(最近2个月)

LLMEval3同类推荐

MMBench
MMBench

全方位多模态评测

OpenCompass
OpenCompass

一站式大模型评测

CMMLU
CMMLU

中文大模型评测基准

AGI-Eval
AGI-Eval

AI大模型评测社区