AI模型评测
MMLU
多任务语言理解基准
Open LLM Leaderboard
开源大模型排行榜
CMMLU
中文大模型评测基准
SuperCLUE
中文大模型权威测评
LMArena
大模型匿名竞技场
FlagEval
大模型权威评测平台
OpenCompass
一站式大模型评测
MMBench
全方位多模态评测
H2O EvalGPT
大模型Elo评测平台
HELM
斯坦福大模型评测框架
LLMEval3
复旦大模型评测基准
PubMedQA
生物医学问答评测
AGI-Eval
AI大模型评测社区
MagicArena
视觉模型对战平台