FlagEval

FlagEval

大模型权威评测平台

官网: 立即访问

所属分类: AI模型评测

工具介绍
智源研究院推出的大模型评测开放平台,构建'能力-任务-指标'三维评测框架,覆盖全球800+开闭源模型,支持50+能力维度与四大评测领域,并提供大模型角斗场在线对战、盲测等服务,科学公正地评估模型性能。
FlagEval具体信息

FlagEval(天秤)是智源研究院推出的大模型评测体系及开放平台,是智源FlagOpen大模型开源技术体系的重要组成部分。
平台旨在建立科学、公正、开放的评测基准、方法与工具集,协助研究人员全方位评估基础模型及训练算法的性能,并探索以AI辅助主观评测,提升评测效率与客观性。
FlagEval创新构建了"能力-任务-指标"三维评测框架,细粒度刻画模型认知能力边界,覆盖NLP、CV、音频及多模态四大评测场景,是国内外权威的大模型评测平台之一。

- 三维评测框架:涵盖30+能力、5大任务、4大指标,共600+子维度,可视化呈现评测结果。
- 多领域覆盖:支持语言、视觉、多模态、音频模型评测,覆盖90多个评测数据集、超200万道评测题。
- 主客观结合:客观评测与主观评测相结合,采用"多人背靠背标注+第三方仲裁"及AI辅助标注。
- 大模型角斗场:全球首个包含文生视频的模型对战评测服务,支持纯文本、图文理解、文生图、文生视频四种模态的匿名对战、深度思考与多模型对战。
- 开放工具集:提供FlagEval-Serving等开源评测工具,支持提交自有模型评测,兼容多种芯片架构与深度学习框架。
- 权威榜单:定期发布全球开源与闭源模型的评测排行榜,为产业选型提供参考。

1. 注册账号:微信扫码注册,填写企业邮箱、手机号及个人信息,经管理员审核通过后即可使用。
2. 查看榜单:按能力、任务、指标筛选对比全球主流大模型。
3. 体验角斗场:选择对战模态并输入Prompt,对匿名模型的作答进行投票或打分。
4. 提交自有模型:安装FlagEval-Serving工具,按对应领域的目录结构与接口规范上传模型、代码与数据,配置并提交评测实例。
5. 查看报告:评测完成后在详情页查看日志与评测结果,定位问题或分析模型优劣。

- 科学权威:由智源研究院牵头,联合多所高校院所共建,依托国家重大项目,评测结果权威可信。
- 公正开放:坚持中立公益原则,匿名对战保障公平,数据集与评测方法公开。
- 框架创新:"能力-任务-指标"三维评测体系与首创的梯级胜负评测,更能捕捉模型间的细微差异。
- 覆盖广泛:评测范围从语言扩展至视觉、音频、多模态及文生图、文生视频,覆盖全球数百个主流模型。
- 生态完整:开源评测工具与框架,支持国产算力,助力"以评促优、以评促用、以评促享"。

与OpenCompass(司南)、SuperCLUE、LMSYS Chatbot Arena等主流评测平台相比,FlagEval特色鲜明。
- 对比OpenCompass:两者均坚持开源,OpenCompass侧重全流程代码与数据开源,FlagEval更强调三维评测体系与权威榜单,评测维度更细(600+子维度),并首创文生视频对战评测。
- 对比SuperCLUE:SuperCLUE聚焦中文通用大模型综合性能,FlagEval则覆盖语言、视觉、音频、多模态等多领域,并提供匿名对战、主客观结合等更丰富的评测方式。
- 对比LMSYS Arena:后者仅支持语言模型两两对战,FlagEval角斗场还支持图文理解、文生图、文生视频,以及3-10个模型的多模型对战与深度思考模式,覆盖更全面。

Q1: FlagEval是商业产品吗?
A1: 不是。FlagEval由非营利性科研机构智源研究院主导,坚持中立、公益、开放原则。
Q2: 注册后未通过审核怎么办?
A2: 审核结果会通知到个人邮箱;如未通过,请按邮箱提示补充信息或更换邮箱重新提交。
Q3: 如何上传模型与文件?
A3: 安装FlagEval-Serving工具(pip install flageval-serving),通过flageval-serving upload上传模型、代码与数据,不同领域需遵循各自的目录结构与接口规范。
Q4: 每月可以评测几次?
A4: 每位用户每月通常有5次正式评测机会,建议先通过"推理验证"确保代码可运行再提交;因平台原因导致的失败可联系管理员返还次数。
Q5: 任务一直显示排队中怎么办?
A5: 多为平台算力资源紧张,建议错峰提交;紧急任务可联系管理员调度算力。
Q6: 角斗场支持哪些模态?
A6: 支持纯文本、图文理解、文生图、文生视频四种模态,其中文生图、文生视频不支持多轮对话。
Q7: FlagEval只测中文模型吗?
A7: 不是。平台评测覆盖国内外众多主流的开源与闭源模型,榜单面向全球模型开放。

FlagEval
社交媒体

FlagEval数据分析

数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:baai.ac.cn。

总访问量

402,600

环比变化

22.30%

平均停留

00:00:42

跳出率

67.91%

FlagEval访问来源占比
  • 直接访问 19.22%
  • 搜索引擎 72.57%
  • 展示广告 0.02%
  • 引荐流量 7.16%
  • 社交媒体 0.48%
  • 邮件 0.04%
  • 其他 0.51%
FlagEval地区分布
  • China 79.84%
  • Hong Kong 5.67%
  • United States 4.08%
  • Taiwan 1.44%
  • Germany 0.93%
FlagEval搜索关键词
智源大会
流量 53,046 搜索量 0 CPC 0
由北京智源人工智能研究院主导研发的超大规模智能模型系
流量 930 搜索量 0 CPC 0
智源文生图
流量 750 搜索量 0 CPC 0
ai陪伴项目
流量 600 搜索量 0 CPC 2026
FlagEval访问趋势(最近2个月)

FlagEval同类推荐

LMArena
LMArena

大模型匿名竞技场

SuperCLUE
SuperCLUE

中文大模型权威测评

MagicArena
MagicArena

视觉模型对战平台

LLMEval3
LLMEval3

复旦大模型评测基准