ADNI数据集下载指南:从LONI IDA申请到批量拉取与格式转换
2026/9/16 3:09:59 网站建设 项目流程

不少做医学影像和深度学习的同行,应该都经历过这个瞬间:看到某篇顶会论文用了ADNI数据集,自己也想去跑一跑,结果在下载这一步就卡了两三个礼拜。说实话,ADNI数据集下载这件事,确实不像ImageNet或者COCO那样注册完就能拉数据,它的申请、授权、检索、批量下载有一套官方流程,中间任何一个环节想当然,都会浪费时间。

我自己第一次申请ADNI的时候,注册完LONI IDA账号之后,足足研究了好几天才弄清楚“原来要单独提交研究计划申请数据访问权限”。等真正开始批量下载图像数据,又因为不知道IDA的脚本生成功能,傻乎乎地在网页上一个一个点文件,下了两三天才把一小部分数据拉完。这篇文章就把我从注册到把所有模态数据下到本地、再到整理成可用训练集的完整过程写清楚,给后面要用ADNI的同学省点时间。

1. ADNI数据集是什么,为什么值得专门申请

1.1 ADNI的发起背景与目标

ADNI全称是Alzheimer's Disease Neuroimaging Initiative,也就是阿尔茨海默病神经影像学倡议。它不是某个实验室自己搞的小数据集,而是由美国国立老龄化研究所、国家生物医学成像与生物工程研究所,联合多家制药企业和非营利机构共同资助的大型多中心纵向研究项目。

这个项目从2004年启动,核心思路非常明确:把临床评估、神经影像、脑脊液生物标志物、血液生物标志物、遗传数据放在同一个随访框架里,长期追踪正常老化、轻度认知障碍(MCI)和阿尔茨海默病(AD)三类人群,试图找到可以早期诊断和监测疾病进展的客观指标。

对搞深度学习的人来说,真正有价值的是这套数据的高度结构化。同一个受试者回访多次,每次回访都有对应的影像检查、认知量表、部分还有生物样本检测结果。如果你想做多模态融合、纵向变化建模、跨域泛化分析,ADNI几乎是最合适的公开选择,没有之一。

1.2 数据包含哪些模态,四个研究阶段的变化

ADNI的数据按研究阶段可以分成四块,每个阶段的受试者来源、扫描协议、数据侧重点都有差别。

阶段时间跨度主要特点
ADNI-12004-2010以1.5T MRI为主,兼顾部分3T MRI,包含FDG-PET,重点是建立标准化纵向随访数据库
ADNI-GO2009-2011增加了早期MCI人群,开始引入AV45淀粉样PET
ADNI-22011-2016进一步扩大样本,3T MRI成为主流,补充了Tau-PET等相关序列
ADNI-32016-2022纳入更多新型影像序列,持续随访原有队列,同时增加新技术探索

数据模态方面,影像类主要包括:

  • MRI结构像:最常用的是3D T1加权像,部分受试者还有T2、FLAIR、DTI、静息态fMRI等序列。
  • PET成像:包括FDG-PET(葡萄糖代谢)、AV45-PET(淀粉样蛋白沉积)和Tau-PET(Tau蛋白缠结),这三类PET正好对应AD病理机制的不同维度。
  • 临床与认知评估:MMSE、CDR、ADAS-Cog、FAQ、神经心理成套测试等量表分数,基本每个访视节点都有。
  • 生物标志物:脑脊液Aβ42、tau、p-tau,以及血液样本检测结果。
  • 遗传数据:APOE基因型、全基因组测序(WGS)等,这部分需要额外申请权限。

从下载者的视角看,ADNI的影像数据以DICOM格式为主,也有一部分后处理完成的数据,比如FreeSurfer跑完的皮层厚度/体积结果、UC Berkeley的PET分析结果等。所以它既能支持自己从头做预处理,也能直接拿来用现成的特征做统计建模。

1.3 哪些研究方向适合用ADNI

如果你正处于课题设计阶段,拿不准自己的方向适不适合用ADNI,我根据自己的观察列几个典型场景:

  • AD/MCI/正常人的多分类或二分类,用3D T1 MRI或者PET做图像分类,ADNI是最常见的实验数据。
  • 认知评分回归,用影像特征预测MMSE或ADAS-Cog分数。
  • 纵向进展预测,用基线数据预测MCI是否在2-3年内转变成AD,这时ADNI的纵向随访节点就非常有价值。
  • 跨数据集泛化验证,在很多论文里ADNI承担“外部验证集”的角色。
  • 多模态融合,影像+量表+生物标志物做合并建模,ADNI是少数公开数据里能把这几类数据对到同一批受试者上的。

文章后面所有流程,都是围绕“把ADNI这些模态完整下载下来”进行。

2. 申请权限的完整链路:账号、研究计划、审核

2.1 LONI IDA账号注册时别忽略的几个选项

ADNI的数据托管在LONI IDA(Image and Data Archive)平台,网址是ida.loni.usc.edu。这个平台是南加州大学实验室神经影像研究所维护的,很多神经影像数据集都放在这里,不只有ADNI。

注册的时候有几点值得注意:

  1. 优先使用机构邮箱。注册时填写的邮件地址,最好是你所在大学或研究机构的正式邮箱。虽然我现在不确定系统是否强制要求,但从审核通过的效率来看,机构邮箱明显比个人邮箱更稳妥,因为审核方能更快判断你的身份。
  2. 机构信息要能对应上实际单位。如果列表里找不到自己的机构,可以先搜一下再手动输入,不要随便选一个。
  3. 注册完立刻去邮箱点激活链接。LONI的激活邮件偶尔会被邮件系统扔到垃圾箱,我当时就是找了半天才在垃圾箱里翻出来。
  4. 记住自己的用户名。后续申请权限、下载数据、登录IDA客户端,都靠这个用户名,别用邮箱替代。

2.2 研究计划书撰写的实操建议

注册完账号,登录IDA之后,你会发现自己还看不到ADNI的数据。需要在平台里找到ADNI数据申请入口,提交一份研究计划(Research Proposal),审核通过后才会开放相应权限。

研究计划这块,我见过很多人被退回,绝大多数不是因为学术水平不够,而是没有说清楚几件事:

  • 研究目标:审稿人(ADNI的数据使用申请有专门委员会审核)希望看到你的具体研究问题,不要写得太空泛。比如“用深度学习预测阿尔茨海默病进展”比“研究AD”要好很多。
  • 使用哪些数据:说清楚需要哪个阶段的ADNI数据、需要哪些模态、需要哪些访视节点。这会影响最终开放的权限范围。
  • 分析方法:不需要特别详细的公式,但要让审核方知道你具备处理这批数据的能力。
  • 预期的学术产出:比如计划发表哪些类型的论文、是否用于毕业论文、是否用于商业用途。ADNI的数据协议对商业用途有严格限制,如果你只是学术研究,明确写“仅用于非商业学术研究”即可。
  • 数据安全与保密:写明数据保存于加密存储环境中、不会向第三方传播、分析完成后按要求归档或销毁。这部分是审核委员会非常看重的合规内容。

具体到写法,建议分几个自然段,不要堆砌术语,评审方会评估你的研究价值,也会看你的数据需求和他们制定的使用条款是否匹配。我第一次申请时把研究目的写了很长一段专业术语,结果反而被要求补充“数据安全管理说明”,后面就有经验了,直接按“目标—数据需求—方法—安全措施—产出”的框架来写,效率高很多。

2.3 提交后的审核周期和常见等待情况

审核周期我个人经历是1到2周,但也有同行说过等过3周以上。ADNI的数据申请不是自动审批,涉及人工审核,所以耐心等就好。审核通过后你会收到一封邮件,提示数据访问权限已经开通,这时再登录IDA,就能看到ADNI相关的数据列表了。

等待期间可以做一些准备工作:

  • 把磁盘空间规划好。后面下载数据动辄几十GB到几百GB,建议提前准备好大容量存储并考虑是否需要外接硬盘。
  • 阅读ADNI的引用规范和数据使用协议。不同论文引用ADNI时有固定格式,提前准备好可以避免投稿前临时补。
  • 想清楚需要下载哪些子集,不要全量下载,否则很多数据用不上还占空间。

2.4 特殊权限(基因组学数据)的额外流程

这里特别提醒一下:ADNI的常规申请通过后,你能访问的是影像和大部分临床数据,但遗传数据(如APOE基因型、全基因组测序WGS)不在其中。这类数据在IDA里需要单独申请“Genetic Data Access”,流程和前面类似,但需要补充填写遗传研究方向的相关内容。

从很多实际做ADNI研究的同行反馈来看,APOE基因型在AD诊断和风险分层研究中价值很高,但申请的人相对少,审核也相对严格。如果你确实需要,建议在研究计划的“额外数据需求”一栏提前说明,以免后补流程耽误时间。

其他生物标志物数据(CSF、血液指标)通常包含在常规临床数据包中,不需要单独申请。

3. IDA图片检索下载的界面级操作

3.1 进入ADNI数据区

拿到权限后,登录IDA,页面上方通常有搜索框和工具菜单。需要找到ADNI的数据区入口,通常在“Data”或“Browse”相关菜单下能发现ADNI的选项。

如果你之前已经提交申请并且审核通过,数据区里就会显示你可以访问的ADNI阶段。点进去之后,默认显示的是所有受试者的列表,接下来就可以开始按条件筛选了。

3.2 用简单搜索和高级搜索把范围缩到最小

IDA的搜索逻辑和常规数据库不太一样,我建议直接用高级搜索(Advanced Search)来构建自己的下载列表。

比较常用的筛选维度如下:

  • Group / Diagnosis:Control(健康对照)、MCI(轻度认知障碍)、AD(阿尔茨海默病)。部分阶段还细分早期MCI(EMCI)和晚期MCI(LMCI)。
  • Subject Type / RID:RID是受试者编号,在ADNI文档和临床表里用来做关联,这个字段非常关键。
  • Visit Code:比如bl(基线)、m6(6个月随访)、m12(12个月随访)、m24(24个月随访)等,用于纵向研究时按访视节点筛选。
  • Modality:MRI、PET。
  • Image Type / Sequence:比如3D T1、T2、FLAIR、DTI、rs-fMRI,以及FDG-PET、AV45-PET、Tau-PET。Type这里容易看花眼,建议先按具体序列名筛一次,把列表收窄再说。
  • Scan Date:某些研究需要限定扫描日期范围,比如只想要某个特定时期的数据。

筛选时有一个经验:先按诊断分组筛一遍,再按模态筛第二遍,最后再按图片序列筛第三遍。如果一开始就同时选太多条件,有时候会因为某个条件组合没有数据而出现空列表,反而不好排查。

3.3 收藏夹、下载队列和Web端批量下载

当你通过高级搜索把结果列表收窄后,有两类下载方式:

  1. 勾选后直接下载:列表每一行前面有复选框,勾选后点击“Download”按钮,IDA会把选中文件打包成下载任务。这个方式比较直观,但如果文件数量很大,网页端打包过程容易超时。
  2. 加入收藏夹(Collection):把筛选结果存成收藏夹,后续在下载中心围绕收藏夹做批量下载。当一个研究的筛选条件比较复杂时,强烈建议先保存收藏夹,避免丢失检索条件,也方便分期分批下载。

我在早期使用IDA时犯过的错误是,直接全选几百个文件点Download,结果网页卡住,任务莫名其妙中断。后面改用收藏夹分批处理后,就再没出过这种问题。

需要注意,IDA的网页端下载本质是逐个文件请求URL,没有专门的断点续传图形界面。所以当你有几百上千个文件要下时,网页端并不是最优解,下一节讲脚本化下载。

4. 遇到大数据量时的脚本化下载

4.1 哪些情况适合脚本下载

如果你只需要几十个文件,直接在网页端打包下载没问题。但ADNI的典型使用场景往往涉及上百个受试者、多个访视节点、多个序列,文件数量动辄上千,这时候脚本化下载是唯一靠谱的方案。

另外,网页下载依赖浏览器环境,中途断网、合上笔记本、网络波动都可能让下载中断而难以续传,脚本配合命令行下载工具,体验完全不同。

4.2 用IDA生成的Shell脚本批量拉取

IDA其实内置了脚本生成工具。在你选好一批数据、确定下载文件列表之后,可以在下载相关菜单里选择“生成下载脚本”,通常支持UNIX Shell脚本(.sh)和Python脚本两种格式。

生成的脚本内容大致是:

#!/bin/bash wget -O /path/to/save/filename.dcm "https://ida.loni.usc.edu/...文件下载URL..." wget -O /path/to/save/another.dcm "https://ida.loni.usc.edu/...另一个文件URL..."

实际操作时,我一般会做几件事:

  • sed或编辑器把脚本里的输出路径改成自己的目录结构;
  • 把参数加上-c(断点续传)和-t 3(失败重试次数),避免网络抖动导致文件损坏;
  • 在后台用nohuptmux跑脚本,避免终端断开导致任务终止;
  • 下载完成后用finddu检查文件数量和磁盘占用是否吻合预期。

Python脚本的方式则适合二次加工。拿到脚本后,可以按受试者、访视节点、序列重新组织目录,也可以把URL列表解析出来,结合aria2和curl做并发下载。不过并发别拉太高,IDA毕竟是学术平台,扛不住太猛烈的请求,我一般控制在4到6个并发线程以内。

4.3 断点续传、并发和磁盘空间的实践经验

下载ADNI这种大体量数据时,以下几条经验非常实用:

  1. 先小批量试跑。第一次跑通脚本前,先用10个文件测试一下,确认目录结构、文件名、内容无损,再放全量任务。不要等到几百个文件下完才发现路径错了。
  2. 按子集分批下载。可以按诊断分组分批次下,也可以按访视节点分批次下。这样既能控制磁盘压力,也能随时检查某一批数据是否有问题。
  3. 磁盘剩余空间要预留1.5倍以上余量。DICOM文件本身比较大,有些原始序列一个文件就上百MB,再加上解压、中间转换格式,磁盘很快就满。
  4. 下载日志要保存。跑批量的脚本下载时,把标准输出和错误输出分别重定向到日志文件里,比如download.sh > out.log 2> err.log,下载结束后重点看err.log。
  5. 敏感文件不要用个人网盘中转。ADNI数据使用协议明确限制第三方传播,下载后尽量保存在机构服务器或加密磁盘里。

5. 临床数据与衍生数据的获取入口

5.1 临床数据不在图像模块里:换一条路

很多人以为ADNI的临床数据也在IDA的同一个图像搜索界面里,其实不是。临床数据下载入口更常见的是在IDA平台的“Clinical Data”专区,或者在ADNI官网(adni.loni.usc.edu)的数据与样本板块下。

最直接的路径是:登录IDA后,找页面上方或侧边栏与Clinical相关的菜单,点击进入后能看到按ADNI-1、ADNI-GO、ADNI-2、ADNI-3分类的临床数据文件列表,里面大多是CSV或Excel文件。这个入口和图像检索模块互不干扰,下载流程简单很多,通常单个文件点一下就能下载。

5.2 常用量表文件和字段速查

下面这些是我在ADNI相关课题里几乎必下的临床表格:

文件名片段内容典型用途
DXSUM_PDXCONV_ADNIALL受试者诊断汇总,含各访视的诊断结论划分AD/MCI/Normal标签
MMSE简易精神状态检查分数认知水平标签、回归任务
CDR临床痴呆评定量表痴呆严重程度评估
ADASSCORES / ADAS_ADNIGO2ADAS-Cog评分认知功能量化指标
FAQ功能活动问卷日常功能评估
NEUROBAT神经心理成套测试多维度认知指标
UPENNBIOMK脑脊液生物标志物AD病理相关分析
APOERESAPOE基因型遗传风险分层(需额外权限)

这些CSV文件里都有RID字段,是关联影像数据和临床数据的关键桥梁。下载临床表后,建议先做一步简单的数据清洗:把RID统一转成字符型,去掉首尾空格,再和图像数据目录里的受试者编号做匹配。

5.3 图像RID与临床统计的关联方法

影像文件本身带有受试者ID、访视编号等信息,而临床表里的RID通常就是在同一个访视下记录的数值。实操中需要把两边的ID统一起来。

我的习惯做法是:

  • 下载临床表后,按“RID + VISCODE + 诊断组别”生成一个主键;
  • 图像数据部分,按Subject ID和Visit Code生成同样的主键;
  • 两侧主键一致的行,就可以直接用于“影像+临床标签”的建模。

这里特别提醒:ADNI的VISCODE在早期阶段和后续阶段命名略有不一致,比如基线有时是“bl”,有时是“m0”;不同表里也可能混用“m24”和“m24.0”。做关联时最好先检查一下取值分布,不然容易莫名少掉一批样本。

6. 下载完成后的数据整理与踩坑清单

6.1 原始文件的目录组织和命名解码

从IDA下载的影像文件,常见格式是DICOM,也可能以.tar.gz压缩包形式保存。在脚本下载模式下,文件名通常保留了原始的文件编号,但这串编号人类很难直接阅读。

建议拿到数据后,自己重新组织目录结构,例如:

ADNI ├── AD │ ├── 0002_S_0295 │ │ ├── bl │ │ ├── m6 │ │ └── m12 ├── MCI ├── Normal

另一种常见组织方式是按“研究阶段/诊断/受试者ID/访视节点/序列”来组织。无论用哪种,核心原则是:每个目录层级对应一个可追溯的元数据字段

DICOM文件自带的元数据(比如SeriesDescription、ProtocolName、ImageType)其实是很好的验证依据。批量重命名时,可以用dcm2niix工具的参数直接从DICOM头提取受试者ID和序列描述,自动生成可读文件名。

6.2 DICOM到NIfTI的批量转换建议

ADNI原始数据大多是DICOM格式,训练深度学习模型时,大家通常会用NIfTI格式作为标准输入。我推荐使用dcm2niix做批量转换,原因很简单:它对多中心、多序列的DICOM支持好,能自动生成对应的.json元数据文件。

转换命令大致如下:

for d in /path/to/dicom_dir/*; do dcm2niix -z y -o /output/nifti_dir "$d" done

转换时有几个参数值得注意:

  • -z y:压缩成.nii.gz,能省不少磁盘空间;
  • -f %p_%s:用序列描述和序列号命名输出文件,便于区分;
  • -b y:生成BIDS格式的JSON元数据文件,记录扫描参数。

转换完成后,建议随机抽几个文件,用ITK-SNAP或FSLeyes打开看看,确认方向信息和图像内容正常,再进入预处理流程。

6.3 我实际踩过的坑与建议

最后分享几个我在ADNI数据集使用中亲身遇到过的坑,希望后来人别再踩。

第一个坑:APOE等基因数据的权限误以为拿到了。
我一开始以为研究计划通过后所有数据权限都开通了,结果下载APOERES表时提示无权限,才发现遗传数据是独立授权。建议大家重点确认自己的研究是否真的需要遗传数据,如果不需要,就别在这个权限上折腾,会省很多时间。

第二个坑:临床表和影像数据的受试者ID格式不一致。
有一批受试者影像目录里写的是“002_S_0295”,临床表里是“002S0295”,差个下划线,一匹配就少了几百个样本。后面统一用正则清洗成标准格式才对齐。

第三个坑:下载脚本在没有nohup的情况下跑,被中断。
有一批数据我直接在前台跑Shell脚本,中间一个电话导致终端断连,进程被杀,所有文件得重新下载。之后凡是超过1小时的任务,我一定用tmux或者nohup ... &在后台跑,这已经成了习惯。

第四个坑:磁盘空间被临时文件撑爆。
IDA下载时有些压缩包文件体积不小,解压后体积再翻几倍,一次性全量解压导致磁盘满了。后面我改成“下载一批—解压一批—确认无误—删除压缩包”的流程,再没出现空间不足的问题。

第五个坑:PET数据的分量名称很混乱。
同一批AV45-PET,有的文件标记为“AV45”,有的标记为“Florbetapir”,有的直接叫“Amyvid”,如果不去对照官方文档清洗,很容易在构建模型时把同一种PET当成多种模态。建议下载后先用官方数据说明文档对一遍所有序列名称,再做后续处理。

ADNI这套数据虽然申请门槛和下载过程比普通公开数据集麻烦不少,但它提供的纵向、多模态、多中心研究数据,在医学影像领域几乎没有替代品。按照上面这套流程走一遍,从账号注册到拿到一批能直接训练模型的数据,大概一周左右就能完成,其中大部分时间其实都在等审核。耐心一点,把前面几步的权限申请和下载规划做扎实,后面就会顺畅很多。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询