Open LLM Leaderboard

Open LLM Leaderboard

开源大模型排行榜

官网: 立即访问

所属分类: AI模型评测

工具介绍
Hugging Face官方推出的开源大模型评测排行榜,覆盖IFEval、BBH、MATH、GPQA等多项权威基准,自动评测并实时排名开源模型,提供可复现的客观评分,帮助开发者甄别模型真实性能,是AI社区公认的模型竞技场。
Open LLM Leaderboard具体信息

Open LLM Leaderboard 是由全球最大 AI 社区 Hugging Face 推出的开源大模型排行榜单,专门用于评估、追踪和比较各类开源大语言模型(LLM)的综合能力。

它被誉为 AI 模型界的“奥运会”和“照妖镜”,通过一套标准化、透明、可复现的评测体系,为所有开源模型提供公平竞技的舞台。其核心定位是“去营销化”:不依赖厂商自报的分数,而是由 Hugging Face 官方集群统一运行评测,用客观数据帮助研究人员、开发者与企业快速了解每个模型的真实水平,过滤掉浮夸宣传。

标准化评测:基于 Eleuther AI Language Model Evaluation Harness 框架,在统一硬件、统一提示词策略下对所有模型进行评测,确保结果公平可比。

多基准覆盖:v2 版本采用 MMLU-Pro、GPQA、MATH、BBH、MuSR、IFEval 等难度更高、抗污染能力更强的基准,全面考察模型的世界知识、复杂推理、数学能力和指令遵循能力。

综合得分与分项报告:提供 Overall Score 综合得分及每个基准的单项得分,支持按模型规模、发布时间、机构等条件筛选和排序。

模型提交与自动评测:支持用户将开源模型提交到评测队列,由 Hugging Face 集群自动运行评测并公布结果。

动态更新:榜单随新模型提交和基准更新持续刷新,帮助社区追踪最新进展。

对比工具:提供模型对比功能,可直观比较两个模型在各基准上的表现差异。

浏览与筛选:访问 Open LLM Leaderboard 页面,通过搜索、排序和筛选功能(按模型规模、类型、机构等)快速定位感兴趣的开源模型,并查看其综合得分与单项表现。

按需选型:根据业务需求(如推理、数学、指令遵循等)重点关注相关基准的单项得分,横向比较候选模型,做出数据驱动的技术选型。

提交模型评测:注册 Hugging Face 账号,将模型权重以 safetensors 格式上传至 Hub,完善模型卡信息,然后在提交页面选择精度和模型版本提交评测,等待排队评测并获取结果。

公开透明:评测代码、数据集与结果全部公开可查,任何人都可以复现验证,结果可信度高。

公平统一:所有模型在相同硬件、相同评测框架和提示词下接受测试,避免厂商“自说自话”和选择性报分。

抗污染设计:v2 采用更新、难度更高的基准并加入污染检测,有效减少“刷榜”现象,更真实地反映模型的泛化能力。

社区生态强大:背靠 Hugging Face 庞大的模型仓库与社区,覆盖绝大多数主流开源模型,是开源模型领域引用率最高的权威榜单之一。

与 LMSYS Chatbot Arena 相比:Open LLM Leaderboard 使用自动化学术基准(如 MMLU-Pro、GPQA),结果客观、可复现,更注重模型的“硬实力”;而 Chatbot Arena 采用真实用户匿名投票的 Elo 评分,更贴近主观体验与对话质量。前者适合严谨的横向对比,后者适合评估用户实际感受,两者可互为补充。

与厂商自报分数相比:Open LLM Leaderboard 由第三方统一评测,数据独立可信,能有效规避“数据污染”和选择性报分问题,为技术选型提供更可靠的参考依据。

Q1: 如何提交自己的模型到 Open LLM Leaderboard?
A1: 你需要一个 Hugging Face 账号,将模型权重以 safetensors 格式上传到 Hub 并完善模型卡,然后在提交页面选择精度与版本提交,等待自动评测即可,通常排队周期为 1–2 周。
Q2: Open LLM Leaderboard 和 LMSYS Chatbot Arena 有什么区别?
A2: Open LLM Leaderboard 使用自动化学术基准,结果客观可复现;Chatbot Arena 采用真实用户匿名投票与 Elo 评分,更贴近主观体验。两者评测方式不同,可以互补使用。
Q3: 为什么有些模型在 v1 升级到 v2 之后排名大幅下降?
A3: 因为 v2 换用了更难、更新、抗污染能力更强的基准(如 MMLU-Pro、GPQA),此前通过拟合公开测试集获得高分的模型在新基准下暴露了真实水平,排名下降属于正常现象。
Q4: 排行榜分数高就意味着模型适合我的业务吗?
A4: 不一定。排行榜主要衡量通用能力,对于医疗、法律等垂直领域或特殊语言场景,建议结合专业评测集并开展实际业务测试,不能仅依赖榜单得分。
Q5: 评测失败或模型从队列中消失怎么办?
A5: 模型从队列中消失通常表示评测失败,常见原因包括模型下载失败、文件格式不符合要求(如未使用 safetensors)或需要开启 trust_remote_code 等,可检查提交信息并在社区讨论区寻求帮助。

Open LLM Leaderboard

Open LLM Leaderboard数据分析

数据更新于 2026-09-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:huggingface.co。

总访问量

31,190,000

环比变化

10.69%

平均停留

00:05:13

跳出率

40.68%

Open LLM Leaderboard访问来源占比
  • 直接访问 42.80%
  • 搜索引擎 32.31%
  • 展示广告 0.18%
  • 引荐流量 9.42%
  • 社交媒体 10.86%
  • 邮件 0.69%
  • 其他 3.74%
Open LLM Leaderboard地区分布
  • United States 18.95%
  • China 11.6%
  • India 8.8%
  • Germany 5.01%
  • Russia 4.24%
Open LLM Leaderboard搜索关键词
hugging face
流量 1,580,000 搜索量 1,520,000 CPC 1.1
huggingface
流量 353,070 搜索量 371,750 CPC 1.58
minimax h
流量 3,143,230 搜索量 926,660 CPC 0
qwen 3.8 27b
流量 138,520 搜索量 266,780 CPC 0
deepseek
流量 82,130 搜索量 12,430,000 CPC 0.42
Open LLM Leaderboard访问趋势(最近3个月)

Open LLM Leaderboard同类推荐

MMBench
MMBench

全方位多模态评测

MagicArena
MagicArena

视觉模型对战平台

HELM
HELM

斯坦福大模型评测框架

LMArena
LMArena

大模型匿名竞技场