PubMedQA

PubMedQA

生物医学问答评测

官网: 立即访问

所属分类: AI模型评测

工具介绍
PubMedQA是基于PubMed摘要的生物医学问答数据集,含1k专家标注与211.3k人工生成问答实例,支持yes/no/maybe三分类评测,并提供大模型得分排行榜,是医学AI问答核心基准。
PubMedQA具体信息

PubMedQA是一个面向生物医学研究领域的问答(QA)数据集与模型评测基准,由匹兹堡大学与卡内基梅隆大学团队于2019年提出,论文发表于EMNLP-IJCNLP 2019。
它从PubMed文献摘要中构建问答对,任务是让模型根据论文摘要回答“是/否/可能(yes/no/maybe)”三类问题,例如“术前使用他汀类药物能否降低冠状动脉旁路移植术后心房颤动的发生率?”
其核心定位有二:一是作为评测生物医学NLP模型与大语言模型科学推理能力的标准基准;二是提供公开的模型得分排行榜,供研究者在统一标准下对比模型表现。

标准化数据集:包含1k条专家标注集(PQA-L)、61.2k条未标注集(PQA-U)与211.3k条自动生成集(PQA-A),分别用于测试、半监督训练与预训练。
科学推理评测:答案无法直接从文本中抽取,需对上下文尤其是定量内容(统计数字、p值等)进行推理,96.5%的实例涉及数值推理。
统一评测指标:以准确率(Accuracy)与宏平均F1(Macro-F1)为主指标,分“需要推理”与“无需推理”两种设置评测。
公开排行榜:官方收录了GPT-4(Medprompt)、Med-PaLM 2、MEDITRON、Claude 3等模型的成绩,支持研究者提交模型参与排名。
多样化题型:涵盖因果效应、疗法评价、陈述真伪、因素相关性等四类问题。
开源可复现:数据集与提交说明在GitHub开放,便于复现与二次研究。

第一步:访问官网pubmedqa.github.io或GitHub仓库下载数据集。
第二步:选择评测子集,通常使用PQA-L中的500条测试集进行评测。
第三步:构建模型,输入“问题+摘要上下文”,输出yes/no/maybe类别。
第四步:按官方评估脚本计算Accuracy与Macro-F1。
第五步:如需上榜,按GitHub中的提交说明将预测结果与系统描述发送至指定邮箱即可。

真实科研场景:问题与上下文由同一作者撰写,语境高度一致,问题与摘要天然相关,避免了许多合成数据集的噪声。
强推理需求:它是首个要求对生物医学研究文本(尤其是定量内容)进行推理才能作答的QA数据集,能有效拉开不同模型的能力差距。
规模与质量兼具:既有专家标注的小规模高精度测试集,又有数十万级自动生成数据供预训练。
区分度强:人类单人在需要推理设置下准确率为78.0%,多数类基线仅55.2%,初始最优模型BioBERT为68.1%,任务难度适中且仍有提升空间。
生态成熟:排行榜持续更新、论文引用广泛,已成为医学大语言模型评测的默认基准之一。

与BioASQ相比:BioASQ训练集不足3k条,多为简单事实性问题,答案可通过抽取获取;PubMedQA规模更大,且需要深层次推理才能作答。
与emrQA、BioRead、BMKC相比:这些数据集以抽取式或完形填空式为主,答案可直接在上下文中获取;PubMedQA为三分类推理任务,答案不可直接抽取。
与BoolQ相比:BoolQ专注自然发生的yes/no问题,不涉及生物医学数值推理;PubMedQA增加“maybe”选项,更贴合真实科研结论的不确定性。
总体而言,PubMedQA更侧重科学推理能力,已成为衡量GPT-4、Med-PaLM 2等医学大模型推理水平的重要试金石。

Q1: PubMedQA包含多少条数据?
A1: 共约27.35万条问答实例,其中专家标注集(PQA-L)1k条、未标注集(PQA-U)61.2k条、自动生成集(PQA-A)211.3k条。
Q2: 模型需要输出什么格式的答案?
A2: 模型需根据问题与摘要上下文输出yes/no/maybe三选一结果,评测时以PMID为键的JSON文件提交。
Q3: 当前排行榜上表现最好的模型是谁?
A3: 截至官方排行榜更新,GPT-4(Medprompt)以82.0%的准确率位居榜首,Med-PaLM 2(81.8%)与MEDITRON(81.6%)紧随其后。
Q4: 人类在PubMedQA上能达到什么水平?
A4: 在需要推理的设置下,单个标注者可达78.0%的准确率与72.2%的宏F1,而多数类基线仅为55.2%。
Q5: 如何提交自己的模型到排行榜?
A5: 访问官方GitHub仓库,按提交说明准备预测结果与系统描述,通过邮件提交即可参与排名。
Q6: PubMedQA可以免费使用吗?
A6: 可以,数据集在官网与GitHub公开免费提供,使用时请引用论文Jin et al.(2019)。

PubMedQA
社交媒体

PubMedQA数据分析

数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:github.io。

总访问量

17,800

环比变化

46.58%

平均停留

00:00:25

跳出率

43.44%

PubMedQA地区分布
  • United States 32.33%
  • India 14.95%
  • Republic of 13.22%
  • Mexico 10.01%
  • Indonesia 8.67%
PubMedQA搜索关键词
annas archive
流量 967,000 搜索量 1,210,000 CPC 0.32
anna's archive
流量 260,390 搜索量 410,160 CPC 0.13
odysseus ai
流量 204,240 搜索量 717,950 CPC 0
libgen
流量 133,810 搜索量 987,620 CPC 1.86
anna archive
流量 115,700 搜索量 169,150 CPC 0.13
PubMedQA访问趋势(最近2个月)

PubMedQA同类推荐

MagicArena
MagicArena

视觉模型对战平台

SuperCLUE
SuperCLUE

中文大模型权威测评

FlagEval
FlagEval

大模型权威评测平台

Open LLM Leaderboard
Open LLM Leaderboard

开源大模型排行榜