做医疗AI这一年多,我发现自己被问得最多的一个问题不是“模型怎么调”,而是“数据从哪找”。身边不少朋友兴冲冲想复现一篇顶会论文,结果卡在数据集下载上:要么官网要注册审批,要么链接失效,要么格式吓人。这篇汇总就是想把医疗场景里那些经典、热门的公开数据集一次性捋清楚,按影像、信号、文本、组学几个方向分开,每个都说明白是什么、能做什么、怎么拿,方便你按自己的任务对号入座。
先交代一下这个清单的筛选标准。第一,只要是做医疗影像、生理信号、病历文本或基因组方向,这些数据集几乎绕不开,属于“行业硬通货”;第二,优先选还在维护、申请链路相对明确的;第三,尽量覆盖不同模态,让做算法和做临床研究的人都能找到能用的东西。你不需要全下,先收藏,等真需要的时候知道去哪找就值了。
1. 医疗数据集的特殊之处:为什么“找数据”本身就是一道坎
想搞清楚这些数据集为什么这么难拿,得先理解医疗数据和普通CV数据集完全不是一个物种。ImageNet你可以一键压缩包拖走,但医疗数据基本都涉及患者隐私、伦理审批和使用协议,所以绝大多数需要注册、填用途、过考试,甚至签法律文件。
1.1 医疗数据和普通公开数据集的三点本质区别
第一个区别是身份门槛。很多医疗数据集的申请页面会要求你提交机构邮箱、研究背景说明,甚至要求你完成一份关于人类受试者保护的在线培训,拿到证书才能下载。这不是卡你,而是数据共享伦理规范的一部分,医院把患者数据拿出来本身就要过层层审批,研究者自然也要承担对应责任。
第二个区别是标注成本极其昂贵。一张胸片让放射科医生标病灶,快的几分钟,慢的要半小时,而一个像样的数据集动辄几万张图。所以你会发现医疗数据集的标注常常是“不完美”的:有的只有疾病级标签没有像素级标注,有的只有部分数据被专家复核过。这不是数据集质量差,而是医学专家的人力成本决定了标注精度存在天花板。
第三个区别是数据分布天然不均衡。正常样本和病变样本的比例可能差几十倍,不同疾病的发病率差异也极大。你拿到的数据往往只是医院历史病例的一个切片,里面暗藏着设备型号、人群种族、地域疾病谱等系统性偏差。如果只闷头跑精度,不去看数据本身的结构,上线之后大概率会在真实场景翻车。
1.2 这篇汇总的组织逻辑
下面的20个数据集,我按使用频率和我自己的熟悉程度分了四组:
- 医学影像类:胸片、CT、超声、内镜、皮肤镜、眼底图,共9个,适合做分类、检测、分割任务。
- 生理信号与重症临床类:心电、脑电、重症监护记录,共5个,适合做时序建模、预测任务。
- 病历文本与基因组类:医疗NLP文本、肿瘤多组学数据,共4个,适合做文本挖掘和生信分析。
- 我个人的“如果只能选一个”推荐:给新手一个直接的入手指引。
每个数据集我会说明规模、获取方式、适合什么任务,以及我实际使用中踩过的坑。这样你拿到的不是一张冷冰冰的列表,而是一张带“路况提示”的地图。
2. 医学影像方向:9个经典数据集,从入门到进阶一次配齐
医学影像是医疗AI里最卷也最成熟的赛道,数据集数量也最多。这里选的是我反复用、周围同行也说靠谱的9个,覆盖了肺、脑、皮肤、心脏、眼底、内镜等主要器官场景。
2.1 胸部X光和肺结节:入坑首选的两个数据集
NIH ChestX-ray14是几乎每一个做过胸片识别的人都绕不开的数据集。它包含约112120张正面胸片,来自3万多名患者,每张图带有最多14种肺部疾病的标签。这个数字放在今天看依然非常可观,而且它是很多后续胸片模型的基准。获取方式是去NIH官网填申请,审核不复杂,一般一周内能下来。需要注意它的标签是从影像报告中用NLP自动提取的,存在一定噪声,精度不如专家逐张复核,这是公开数据的通病。
对肺结节检测,LIDC-IDRI则是更硬核的选择。它包含1018例胸部CT,由四位放射科医生分别对结节进行标注,标注内容包括结节位置、大小、良恶性评分等。它的价值在于每个病灶有多位专家的独立意见,你可以用来做检测、分割,也可以用来研究标注者间差异性。下载前需要在癌症影像档案库(TCIA)注册并同意数据使用协议。
这两个数据集配合使用很常见:先用ChestX-ray14做疾病分类预训练,再用LIDC-IDRI做结节定位微调。我自己的经验是,ChestX-ray14做预训练比直接用ImageNet预训练要稳,因为特征分布和下游任务更接近,迁移损失小很多。
提示:NIH ChestX-ray14申请后别急着关页面,文件列表里不仅有图像,还有一份包含患者性别、年龄的CSV,对做公平性分析非常有用。
2.2 脑肿瘤与皮肤病变:病灶分割的经典难度
**BraTS(Brain Tumor Segmentation)**是脑胶质瘤分割领域最权威的benchmark,每年MICCAI都会举办配套挑战赛更新数据。它提供多模态MRI(T1、T1ce、T2、FLAIR),每个病例都有像素级标注,区分水肿、增强肿瘤和坏死核心。做医学图像分割的人如果没跑过BraTS,基本不好意思说做过分割。数据通过BraTS官网申请,需要用机构邮箱注册。
ISIC Archive是皮肤镜图像的数据集,由国际皮肤成像协作组维护,最新版本包含数万张皮肤病变图像,标注覆盖良恶性、病变类型等。它每年都会推出新的挑战赛任务,比如分割任务、属性分类任务,数据质量整体比较高。不过由于皮肤镜图像和实际手机拍照差异较大,做移动端皮肤自测工具的人需要注意域迁移问题。
这两个数据集的共同特点是标注标准体系非常成熟,带给了研究者一个清晰的评估框架。BraTS里把肿瘤区域拆成三个子区域分别评估Dice,ISIC则区分了病灶级和图像级的评估指标。做分割任务时不要只看整体Dice,分结构看才有意义。
2.3 肺炎检测、超声、眼底与内镜:垂直场景里的高质量选择
RSNA Pneumonia Detection Challenge数据集来自Kaggle,是胸部X光肺炎病灶检测的经典数据集。它和NIH ChestX-ray14最大的区别是:所有肺炎病灶都由放射科医生用边界框标注,标注质量明显更高。虽然它名义上是Kaggle竞赛数据,但赛后依然开放下载,非常适合做检测任务的练手项目。
CAMUS是一个超声心脏数据集,包含500例患者的二维超声图像,重点是左心室和左心房的分割标注。超声数据相比CT、MRI在公开数据里本身就少见,CAMUS是少数能用于做超声心脏结构分割的公开资源,申请手续也比较简单,填表即可。它对做心功能量化分析的人非常关键。
DRIVE是视网膜血管分割数据集,只有40张眼底图,规模不大,但因为它包含金标准标注和训练测试划分,是眼底血管分割领域的事实标准。很多人拿它做血管分割模型的验证集。虽然数据量小,但因为它作为基准的作用大于训练集的作用,因此在论文对比里到处可见。
Kvasir-SEG是消化内镜息肉分割数据集,包含1000张息肉图像和对应的像素级掩码,另有视频版本。做内镜辅助诊断、息肉检测分割的团队几乎都会用它做初始验证。内镜图像的光反射、模糊区域都很多,对模型的鲁棒性要求比较高,属于“看起来很简单、实际挺难”的典型任务。
个人体会:做医学影像任务时,数据集之间的“域差异”往往比模型结构更影响结果。同一个分割模型在BraTS上Dice刷到0.9,换到Kvasir-SEG上跌到0.6并不稀奇。挑选数据集时先想清楚你的落地场景和训练集分布是否一致。
3. 生理信号与重症临床:从心电到MIMIC,时序数据的宝藏库
医学影像之外,另一大类高频需求来自机器学习和时序信号结合的场景。心电图、脑电图、重症监护记录,这类数据对做预测、异常检测、多模态融合的人来说是真正的金矿。
3.1 MIMIC系列:重症数据库里的“王者级”资源
MIMIC-III和MIMIC-IV是麻省理工计算生理学实验室发布的重症监护数据库,记录了Beth Israel Deaconess Medical Center重症监护室数万名患者的去标识化医疗数据,包括生命体征、实验室检验、用药记录、护理记录、影像报告和自由文本等。如果你要做时序预测、患者恶化预警、药物干预效果分析,这里几乎是绕不开的选择。
MIMIC的申请流程是最容易卡住新手的环节。现在PhysioNet要求完成CITI Program的“Data or Specimens Only Research”课程,拿到通过证书后才能申请Credentialed Access,整个过程从考试到获批通常需要1到2周。建议有需求的人尽早申请,不要等到论文截稿才开始走流程。
MIMIC-IV是MIMIC-III的升级版,表结构更清晰,去标识化更彻底,字段覆盖也更广。现在新项目建议直接用MIMIC-IV,除非你需要复现某些基于MIMIC-III的旧方法。要注意的是,MIMIC中的时间轴数据格式很复杂,需要处理ICU admission、transfer event、chart time等多个表才能拼出完整的事件序列,建议先看官方提供的tutorial笔记。
注意:下载MIMIC需要访问Google Drive或PhysioNet托管服务。国内网络环境下,多人协作下载大文件经常出现中断,建议使用支持断点续传的下载工具,分文件逐个下载,不要指望一次把几GB数据完整拉下来。
3.2 心电、脑电等公开信号数据集
心电图方向,PTB-XL是当前最大的公开12导联心电数据集,包含21837条记录,每条10秒,标注涵盖44种心电图诊断。它是心电自动诊断领域的标准benchmark之一,数据获取很直接,在PhysioNet注册后即可下载。缺点也很明显:类别严重不平衡,正常窦性心律占了很大比例,需要自己设计采样策略。
MIT-BIH心律失常数据库是心电信号处理里资历最老的数据集,包含48条半小时双导联心电记录,带逐拍的标注。虽然规模不大,但因为它几乎被所有心电论文当作基准,你没跑过它都不好意思跟人谈心电分析。它适合做心跳分类、QRS波检测等基础任务。
脑电方向,DEAP是一个多模态情感分析数据集,包含32名被试观看音乐视频时的脑电(EEG)和外周生理信号,并有人工标注的效价、唤醒度、支配度评分。虽然严格说属于情感计算范畴,但它的EEG预处理流程、特征提取方法常被医疗健康研究借用。Sleep-EDF则是睡眠分期研究的经典数据集,包含整夜多导睡眠图记录,标注了睡眠阶段,适合做睡眠分期模型。
我建议对信号类数据集感兴趣的朋友先从PTB-XL或MIT-BIH入手,因为结构简单、答案明确(标注是金标准),不像MIMIC需要大量表关联清洗。信号数据的坑更多在预处理:不同设备采样率不同、噪声类型不同、导联顺序不同,后续做跨数据集测试时都需要统一处理。
4. 病历文本与基因组数据:医疗NLP和多组学分析同样有好料
影像和信号之外,病历文本和基因组数据是另外两个大类。做医疗NLP、知识图谱、药物发现、精准医疗的人,需要的资源和前两类完全不同。
4.1 病历文本与临床NLP数据集
**n2c2(National NLP Clinical Challenges)**是临床NLP领域最有影响力的数据来源之一,前身是i2b2。它提供脱敏后的真实病历文本,标注了时间关系、共病识别、药物信息抽取、吸烟状态等多个任务。不同年份的挑战赛对应不同任务,数据需要在官网申请,审核门槛不低,但质量确实很好。如果你要做实体识别、关系抽取,n2c2几乎是必跑的数据集。
MIMIC-III其实也包含大量自由文本,比如放射学报告、出院小结和护理记录,很多医疗NLP工作直接在这些文本上做预训练。官方提供去标识化后的文本版本,配合诊断代码可以组成不错的弱监督信号。需要注意的是,MIMIC文本中包含大量缩写和记录片段,没有经过NLP预处理经验的人上手会很痛苦。
医疗文本NLP和通用NLP的一个显著区别是领域术语极度丰富且高度结构化。同一种疾病在不同记录里可能有多种表述,这要求做实体归一化时充分结合国际疾病分类(ICD)和系统化临床术语(SNOMED CT)等标准编码体系。我在实际项目中踩过一个坑:直接拿通用预训练模型做实体识别,实体边界找得还行,但归一化到标准编码时经常错位,后来加入词典特征才逐步改善。
4.2 癌症基因组与大型队列数据集
**TCGA(The Cancer Genome Atlas)**是癌症基因组学领域最著名的公共数据资源,包含33种癌症类型的两万多个样本的基因表达、拷贝数变异、甲基化、突变和临床数据。几乎所有癌症生信论文里都能看到TCGA的身影。它通过GDC数据门户获取,部分数据需要下载授权,但大多数转录组和临床数据可以直接访问。
UK Biobank则是另一个维度的巨型资源,不是专门针对肿瘤,而是包含了50万名英国志愿者的基因型数据、影像数据、生活方式问卷和纵向健康记录。数据显示量巨大,对计算资源要求极高,申请流程也相对严格,需要通过英国伦理审查和用途审批。个人研究很难直接把全量数据搬回本地,通常使用他们提供的云分析环境或提交流程获取子集。它比较适合做复杂疾病的风险预测、多基因评分等研究。
如果只是入门练习,也可以先用**GEO(Gene Expression Omnibus)**上的公开芯片或测序数据集练手。GEO的优势是条目极多,任何疾病方向几乎都能找到免费数据,配合R语言工具包就能完成差异表达分析。不过GEO条目质量参差不齐,下载前建议看下样本量和分组信息,优先选择样本量大于20的数据集。
5. 申请与下载中的高频问题:资质审核、协议签署和本地化处理
前面每个数据集都提到了获取方式,但实际申请的过程中,你可能会遇到各种“非技术性卡点”。把这些经验单独写一节,是想让你尽量少走弯路。
5.1 资质审核和数据使用协议到底是怎么一回事
很多医疗数据集需要申请者完成人类研究保护培训,具体由PhysioNet统一管理。流程是:在CITI Program官网注册,选择“Data or Specimens Only Research”课程,完成在线学习和考试,取得合格证书,再把证书信息填到PhysioNet的申请页面。整个过程免费,但需要花几个小时学习。还有一类数据集需要机构层面的《数据使用协议》(DUA),比如部分商业化程度较高的数据集会要求你所在机构的法务签字,这通常耗时更久,要提前规划。
这里有个容易忽略的点:申请时填写的用途要具体但不要太窄。有些机构审核人员会认真看你写的用途,如果你只写“用于训练模型”可能被认为过于宽泛,但如果你把具体疾病、具体方法写得太死,后续调整研究方向时又可能违背最初声明。我的建议是写清楚“用于XX疾病医学影像分析的研究用途”,既明确方向又有一定的弹性空间。
5.2 下载之后的高频翻车点:格式、标注和类不平衡
数据拿到手只是开始,实际使用中还有几个高频坑。
第一个是格式转换。医学影像数据常用DICOM或NIfTI格式,不是JPEG或PNG直接能吃。DICOM需要解析头信息和像素矩阵,NIfTI需要读入三维体数据,这都依赖专业库。很多新手一上来就报错,其实只是格式没转对。
第二个是标注的读取方式。有些数据集用XML存标注框,有些用JSON,有些是RLE编码的掩码,还有一些需要你根据中心坐标和半径自己生成。标注格式不一致在混合多个数据集做训练时尤其痛苦,建议一开始就统一转换成COCO或YOLO格式,后面会省很多事。
第三个是类不平衡问题。真实医疗数据里正常样本远多于病变样本,直接训练会让模型全预测成正常类。正则项、损失函数加权、欠采样/过采样都有效,但更重要的是先认真统计每个类别的样本量,再根据任务选择合适的策略。
重要:无论使用哪个数据集,都要做好数据使用记录。实验日志里记清数据集的版本、下载日期、预处理细节,不仅是为了合规要求,更是为了复现。
6. 如果只能选一个:不同目标下的数据集优先级建议
写到这里,20个数据集盘完了,但我知道很多人真正的问题是“我时间有限,到底先跑哪个”。根据不同目标给个直接的排序建议。
目标是快速入门医疗AI:从NIH ChestX-ray14开始。它是医疗影像分类任务的最佳入门,数据量足够大,任务定义清晰,申请流程简单。配合ResNet或EfficientNet跑一个baseline,再套用迁移学习技巧调参,两三天就能走通医疗影像的基本pipeline。
目标是发论文做分割任务:把BraTS和ISIC作为两个必跑benchmark。BraTS有完整的评估协议和历年SOTA对比,ISIC每年更新且覆盖面广。先分别跑通再考虑如何增强模型的结构感知能力,能覆盖大多数分割类论文的实验需求。
目标是做临床预测或时序建模:直接从MIMIC-IV入手。虽然前期需要投入时间学习表结构和数据清洗,但一旦跑通了特征提取流程,你拥有的将是医疗数据中最丰富、最具临床意义的数据源之一。后续无论做死亡预测、再入院预测还是用药效果分析,都能复用这套工程能力。
目标是研究医疗NLP:从n2c2开始。它提供的任务定义明确,且官方有评测脚本,适合建立基线后和后续方法做对比。跑通后可以再到MIMIC的放射学报告上做预训练实验。
每个方向都是“先跑通一个完整pipeline,再去积累数量”的思路。医疗数据集的申请和清洗门槛确实比普通数据集高,但这也是它的门槛价值:能把这些数据处理明白的人,在团队里本身就是稀缺资源。我的个人建议是尽早申请MIMIC,哪怕暂时用不上——审核周期摆在那里,等真需要的时候再申请,大概率会耽误你的研究进度。先把钥匙拿到手,什么时候开门都来得及。