AGI-Eval

AGI-Eval

AI大模型评测社区

官网: 立即访问

所属分类: AI模型评测

工具介绍
AGI-Eval由上海交大、同济大学等机构联合打造的大模型评测社区。提供权威大模型能力榜单、丰富评测集、人机协同评测比赛与数据工坊,构建公正可信、科学全面的AI评测生态,助力AI成为人类更好的伙伴。
AGI-Eval具体信息

AGI-Eval是由上海交通大学、同济大学、华东师范大学、美团、DataWhale等高校与机构联合打造的大模型评测社区。
它以“评测助力,让AI成为人类更好的伙伴”为使命,致力于构建公正、可信、科学、全面的评测生态,评估大语言模型及多模态模型在各类任务中的AGI能力。
AGI-Eval不仅是权威的模型评测平台,更是一个汇聚榜单、数据集、比赛与数据工坊的开放社区,连接人与AI、连接学术界与产业界。

大模型榜单:提供综合与细分能力项得分排名,数据透明、定期更新,帮助用户洞察各模型优劣。
人机协同比赛:开展人与大模型协作的竞技活动,探索人机增益指标,推动评测方案创新。
丰富评测集:汇聚公开学术评测集、官方自建评测集与用户自建评测集,覆盖多领域多维度。
Data Studio数据工坊:依托数万众包用户,支持单条数据、扩写数据等多种收集方式,实行机审+人审双重审核。
开源评测框架:提供基于插件化架构、可扩展的工程化评测框架,让每个人都能轻松开启评测。

访问官网 agi-eval.cn 即可免费使用,无需安装。
查看榜单:进入评测榜单页面,比较各大模型的综合与能力项得分。
参与比赛:报名人机协同比赛,与大模型协作挑战复杂任务。
使用数据集:搜索并下载公开评测集,或上传自建评测集参与共建。
贡献数据:通过Data Studio完成数据收集任务,助力社区生态。
开源部署:开发者可接入开源评测框架,对自有模型与数据集开展评测实验。

权威可信:顶尖高校与头部企业联合共建,榜单严格筛选官方认证的高价值评测集,数据透明可溯源。
全面科学:覆盖语言、多模态、代码、推理等多维度能力,综合榜单与细分能力项并重。
开源开放:评测框架与评测集开源共建,大幅降低评测门槛,促进产学研协同。
动态评测:首创人机协同与开放式交互评测方式,比静态打分更贴近真实应用场景。
生态活跃:汇聚数万社区用户与海量高质量数据,形成良性循环的评测生态。

竞品多为单一榜单或单一数据集,AGI-Eval则集榜单、评测集、比赛、数据工坊与开源框架于一体,形成完整闭环。
竞品以静态题库打分为主,AGI-Eval引入人机协同、开放式对话等动态评测方式,更贴近真实使用体验。
竞品数据大多封闭,AGI-Eval坚持数据透明、开源共建,评测结果可复现、可验证。
AGI-Eval背靠多所顶尖高校及美团等机构,联合发布OlympicArena等高难度基准,专业认可度高。

Q1: AGI-Eval是免费的吗?
A1: 是的,访问官网即可免费查看榜单、使用数据集并参与社区活动,无需付费。
Q2: 个人用户可以参与评测吗?
A2: 可以,用户可参加人机协同比赛、通过Data Studio贡献数据,并上传自建评测集参与共建。
Q3: AGI-Eval支持哪些模型?
A3: 支持主流大语言模型与多模态模型,也可通过开源评测框架接入自有模型进行评测。
Q4: 如何确保评测结果公正可信?
A4: 榜单严格筛选官方认证评测集,数据透明可溯源,并实行机审+人审双重审核机制。
Q5: 如何下载数据集?
A5: 在数据集社区页面即可搜索并下载公开评测集,官方与用户自建评测集均开放使用。
Q6: 什么是人机协同比赛?
A6: 这是一种人与大模型协作完成复杂任务的比赛形式,旨在探索人机增益指标、推动评测方案创新。

AGI-Eval
联系邮箱
agieval17@gmail.com

AGI-Eval数据分析

数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:agi-eval.cn。

总访问量

41,640

环比变化

-37.41%

平均停留

00:15:54

跳出率

23.00%

AGI-Eval访问来源占比
  • 直接访问 88.48%
  • 搜索引擎 1.84%
  • 引荐流量 9.51%
  • 其他 0.17%
AGI-Eval地区分布
  • China 91.74%
  • United States 8.26%
AGI-Eval搜索关键词
ai 评分 网站
流量 30 搜索量 0 CPC 0
AGI-Eval访问趋势(最近2个月)

AGI-Eval同类推荐

MMLU
MMLU

多任务语言理解基准

H2O EvalGPT
H2O EvalGPT

大模型Elo评测平台

MagicArena
MagicArena

视觉模型对战平台

LMArena
LMArena

大模型匿名竞技场