☰
16S rDNA测序数据提交NCBI SRA完整操作指南
2026/10/5 0:33:47 网站建设 项目流程

1. 为什么这篇操作详解值得你花20分钟读

这几年做微生物组研究的人越来越多,16S rDNA扩增子测序几乎是入行标配。但一个很现实的问题卡住了不少人:数据在本地跑完了QIIME2、跑完了LEfSe,文章写完了,结果投稿时期刊要求提供NCBI accession number,这时候才发现自己根本不知道数据往哪儿传、怎么传、传上去之后怎么跟踪状态。我最早提交SRA的时候也踩过不少坑,光是BioSample属性表就被打回过三次,当时论坛上翻到的教程都写得比较零散,很多细节要靠自己试错。

这篇博文就是冲着“提交NCBI”这个具体环节去的。我尽量把从原始数据准备、文件整理、BankIt网页提交、BioSample属性填写,到拿到SRA登录号并追踪评审状态的完整流程都写清楚。无论你现在是用QIIME2、mothur还是DADA2做完了分析,只要手里有16S rDNA的原始FASTQ文件,这篇文章都能直接当操作手册用。文中涉及的操作我都按NCBI目前实际在用的页面流程来写,没有用旧版本截图里的过时菜单。

适合谁来读?正在准备投稿、被期刊要求提供数据编号的科研人员;需要组内统一数据上传规范、帮学生或同事处理上传事务的实验室管理员;以及所有想在数据共享上少走弯路的人。对NCBI页面英文界面不太熟、或者第一次接触SRA和BioSample概念的朋友,读完这篇也能自己动手传一次。

2. 上传前必须做好的数据准备:这一步没做对,后面全是白忙

2.1 先判断你要上传哪个“库”:不是所有数据都进SRA

提到NCBI提交测序数据,多数人第一反应就是SRA(Sequence Read Archive)。这没错,原始测序FASTQ文件确实统一归SRA管。但16S rDNA项目还有一个容易忽略的关联库:BioSample。严格来说,每个SRA实验(Experiment)都必须在提交时关联一个已经创建好的BioSample,里面记录着这个样本的来源环境、宿主信息、采样地点等元数据。简单理解:BioSample是“样本户口本”,SRA是“原始数据仓库”,两者绑定在一起才构成完整的可追溯链条。

至于Bioproject,它是更高一层的项目汇总,可以包含多个SRA实验和多个BioSample。对大多数只有一批16S数据的课题来说,直接建一个Bioproject再往里面挂样本和数据就够了。如果课题组有多个相关实验设计,比如同批次还做了宏基因组或者ITS扩增子,也建议统一放在一个Bioproject下管理,后面写文章引用起来很清爽。

2.2 文件命名规范:机器不认中文,更不认“最终版”

在打开NCBI任何提交页面之前,我强烈建议先把本地数据文件整理一遍。NCBI并不强制规定FASTQ文件的具体命名格式,但有一个硬性要求:同一对双端测序的两个文件,必须能通过文件名清楚区分R1和R2,而且这组文件最终会跟你的BioSample一一对应。我在实践里养成的习惯是这么命名的:

项目代号_样本编号_引物区域_L001_R1_001.fastq.gz 项目代号_样本编号_引物区域_L001_R2_001.fastq.gz

比如说GutMicrobiota_S01_V34_L001_R1_001.fastq.gz。这种命名方式的好处是,后期在Bioproject页面里核对样本与文件对应关系时,人眼扫过去就能看出哪个R1配哪个R2。很多下机数据从测序公司拿到手时文件名往往是一长串看不懂的编号,我强烈建议先统一重命名再上传,否则后面在SRA页面上一旦传错文件,改起来非常费劲。

文件格式方面,NCBI现在更推荐上传压缩后的FASTQ格式(.fastq.gz)。注意这里指的是gzip压缩,不是别的压缩方式。你可以先用gzip命令处理原始数据,上传前自己解压看一眼文件内容是否完整。顺手检查一下文件大小是否跟测序下机的产出量对得上,如果某个样本的gzip文件明显异常小,大概率是测序或者拆分时出了问题,这类问题一定要在数据上传前发现,别把坏数据提交上去。

2.3 样本信息表:BioSample属性填写的“弹药库”

这里我要重点展开,因为这是整个提交流程里最容易翻车的环节。NCBI要求每个BioSample提供一套结构化属性,具体字段因样本类型而异,植物样本、动物样本、环境样本、微生物分离株的要求都不一样。

对于16S rDNA研究,最常见的样本来源无外乎这几种:

  • 肠道内容物或粪便样本(human gut, mouse gut等)
  • 环境样本(土壤、水体、活性污泥)
  • 植物根际或叶际样本
  • 临床样本(如痰液、肺泡灌洗液)

不同类型的样本,NCBI要求填写的核心属性差别很大。以人类肠道微生物研究为例,至少需要提供:宿主(host)、宿主性别、宿主年龄或年龄区间、采样国家/地区、采样日期、样本来源(如粪便或肠黏膜)。如果是环境样本,则通常需要经纬度、采样地描述、环境介质(如土壤类型)、采样深度等。

我建议在开始NCBI提交前,先做一个Excel格式的样本信息总表,每一行是一个样本,每一列是一个属性字段。这样做的好处有两个:一是提交时可以直接从表里拷贝内容,不用一个个样本去回忆;二是多人协作时,这张表就是团队统一的信息标准。另外,我习惯在表格里额外添加两列:一列写样本的16S测序引物序列,另一列写目标区域(如V3-V4),这在后面填SRA实验的Library Description时可以直接引用。

2.4 提前准备的项目信息草稿

还有一个经常被忽略的准备工作:把项目信息(Project Info)、文献引用信息、数据释放时间等内容提前写在文本文件里。NCBI提交界面有超时限制,如果一边填一边想,经常会出现填到一半页面超时、前面内容白填的情况。我通常在本地建一个submit_notes.txt,把下面的信息提前写好:

  • 项目标题和简要描述
  • 课题负责人联系方式(姓名、单位、邮箱,NCBI还会要求提供一个通信作者或者数据负责人的信息)
  • 资助项目编号(如果有的话)
  • 计划数据公开时间(默认是文章发表时公开,也可以选择立即公开)
  • 是否关联已经发表的文献(如果文章在投或者已接收,需要提供PMID或期刊名、稿件编号)

把这些信息备好,提交过程会很顺畅,不用在中途去翻邮箱找资助编号。

3. 实操全程:BankIt入口到SRA数据上传一步步跟做

3.1 进入正确的提交入口:SRA Submission Portal

NCBI的数据提交入口其实有好几个,但SRA和BioSample有两个不同的Portal,很多新手就是在这里绕晕的。正确的流程是:

  1. 打开NCBI主页,登录你的账号。没有账号就注册一个,这个账号会关联你之后所有提交的Bioproject、BioSample和SRA记录。
  2. 在主页顶部的下拉菜单里找到“Submit”入口,或者直接访问提交总览页面。
  3. 在提交类型列表里选择“SRA”或“BioSample”,两者会分别打开不同的流程。这里有个关键点:如果是全新的课题,没有建过Bioproject和BioSample,直接从SRA Submission Portal开始反而更顺,因为SRA流程里会引导你同时创建Bioproject和BioSample。如果你已经单独提交过BioSample,那么直接选SRA并关联已有BioSample即可。

NCBI现在对“Sequence Read Archive (SRA)”提交统一使用BankIt式的网页交互界面,不再需要老的SRA FTP上传方式。整个页面分七个大步骤:Submitter、General Information、Project、BioSample、SRA metadata、Files、Review & Submit。下面我按实际填写顺序逐项拆解。

3.2 Submitter与General Information:谁能替你接收邮件

进入SRA提交页面后,第一步先填Submitter信息,主要涉及提交者姓名、单位、邮箱。这里有一个细节需要特别提醒:NCBI系统会默认用你账号注册邮箱作为通讯邮箱,但你可以在这个页面把实际收件人改成实验室另一位负责数据管理的成员。凡是后面跟提交相关的邮件通知(比如评审驳回、登录号正式分配、release时间确认)都会发到这里的邮箱,千万别填一个不常看的地址。

第二步General Information里,会让你填写提交标题(Submission Title)和提交描述。Submission Title建议跟文章标题或者课题代号保持一致,方便日后检索对应关系。比如“16S rRNA amplicon sequencing of gut microbiota in type 2 diabetes patients”这种写法就够用。这里的描述可以简单写一下研究目的和样本概况,NCBI会把它作为提交的基本索引信息展示。

Data release date这一项需要注意。NCBI默认的释放时间是文章正式发表日期,你也可以手动指定一个日期让它提前公开。一般建议保持默认,除非期刊或者评审要求数据在投稿当天就必须可公开访问。我自己的操作习惯是选择“release when paper published”,这样数据在文章接收前不会对外可见,避免被别人抢先引用。

3.3 Bioproject创建:项目就是数据集的“文件夹”

如果新课题还没有Bioproject,SRA提交流程会引导你新建一个。Bioproject的创建表单核心信息包括:Project title、Project description、Project type。Project type选择“Research project”即可,如果课题是环境宏基因组相关还可以考虑“Environmental project”。

这里有一个容易混淆的点:Bioproject的外部引用(External Link)和生物样本(BioSample)是被分开管理的,各自有独立登录号。在建Bioproject时,会让你填写这个项目涉及的目标(Objectives)等信息,并不是强制全部字段都填完,但建议把Project Description写清楚,日后在文章补充材料里粘贴Bioproject链接时,审稿人点进去能一眼看出项目是干嘛的。

新建Bioproject完成后,系统会分配一个以PRJNA开头的登录号,并提示后续继续SRA提交。如果你已经有现成的Bioproject,直接在SRA流程里选择已有项目,并关联它即可。

3.4 BioSample信息表:两种填写方式,选适合自己的

这是整个流程中最需要耐心的步骤。NCBI的BioSample提交支持两种填写模式:

  • 在线交互式表单:适合样本数量比较少(10个以内)的情况
  • 批量上传制表符分隔的表格:适合几十上百个样本的情况

如果你只有二三十个样本,直接在线表单问题不大,但超过这个量,强烈建议用批量模式。NCBI会提供一个tsv模板文件,模板里包含了一长串属性列,其中包括必填项(橙色标记)和选填项。不同sample package对应不同的必填属性,通常选“Microbe”或者“Environmental/Metagenome”相关的package就能覆盖16S研究的常见需求。

我踩过的一个坑是:属性列中有些字段需要满足受控词汇表(比如经纬度必须是十进制度数,而不是“N 39°54'”这种格式)。还有日期格式必须是YYYY-MM-DD,如果只提供年份,NCBI有可能会打回。所以填批量表格的时候要格外仔细,我一般会先填两行做test,提交后看系统有没有报错,再补全剩余样本。如果要省时间,可以先只提交三个样本,走通全流程后再回到BioSample页面把剩下的批量补传,然后在新SRA提交中关联完整样本列表。

再提醒一个很重要的字段:sample_name最好不要包含空格、斜杠和括号,建议全部使用下划线和字母数字组合。NCBI系统对这类特殊字符虽然不拒绝,但后续下载SRA metadata的时候容易出现解析问题。

3.5 SRA metadata填写:样本与文库信息对应关系

SRA这一步要填写的是每个样本的文库信息。页面会列出一个样本清单,每个样本需要填写:

  • Library strategy:一般是AMPLICON
  • Library source:一般是GENOMIC
  • Library selection:一般是PCR
  • Library name:可以随便起,但建议跟本地文件前缀一致
  • Sequencing platform:根据测序平台选择(比如Illumina)
  • Instrument model:具体型号(如Illumina MiSeq、HiSeq 2500、NovaSeq 6000)
  • Insert size / read length:如果双端测序,insert size填目标片段长度加引物长度后的期望值,read length填150或250之类的实际读长
  • Forward primer / Reverse primer sequence:这里需要填实际引物序列,比如341F/805R就是CCTACGGGNGGCWGCAG和GACTACHVGGGTATCTAATCC
  • Target region:如V3-V4或者V4

重点说两个容易错的点。第一,Platform和Instrument model必须匹配你真实的测序情况,不能随便选“Illumina unspecified”。这个信息后续会影响SRA数据在不同工具下的兼容性,如果有on instrument control数据或者basecall版本信息也可以填。第二,如果你用的是515F/806R这类经典V4引物,引物方向要填好,NCBI并不强制要求,但某些审稿编辑器会据此判断你的数据质量。

如果样本数量很多,SRA提交页也提供批量上传。批量上传模板里每个样本一行,除了样本名,还要填一个“library ID”。SRA系统不要求这个ID全局唯一,但最好跟文件名对应。

3.6 Files上传:双端文件配对和压缩格式

SRA metadata填完,接下来就是上传FASTQ文件。这一步的操作界面很简单,但最容易出问题。

页面会针对每个样本列出你需要上传的文件位置。你需要在本地把.fastq.gz文件拖拽上传,或者选择NCBI提供的FTP上传方式。如果文件较小(比如一个样本几十MB),网页上传完全够用。如果文件很大,比如一个样本的FASTQ有5GB以上,网页上传非常容易断线,建议改用FTP。

双端测序文件的配对逻辑需要特别小心。以Illumina双端为例,每个样本的两个文件会被SRA系统自动识别为R1和R2,前提是你在上传时按照R1文件、R2文件的顺序正确对应。NCBI文档里有一个很重要的提示:如果文件名包含“R1”和“R2”这样的标识,系统会自动配对成功;如果文件命名不含R1/R2,系统可能会把每个文件识别成独立的single-end run,这会导致数据信息错乱。

我自己的习惯是,在上传页面的文件列表里逐个核对,每个样本对应的两个文件必须同时出现并标记为matepair。千万别图省事拖拽整个文件夹,那样容易让多个样本的文件混到一起,后面检查的时候头疼。

上传结束后,页面会进入Review & Submit。这时系统会生成一个汇总清单,包含Bioproject登录号、BioSample数量、SRA实验数量、文件列表大小等。建议把这一页完整截图存档,万一后续有争议或者数据被误删,这个截图可以作为提交记录凭证。

4. 把你的特定数据集套进去:一个双端16S提交的完整演示

4.1 示例背景与样本设计

为了把上面这些抽象步骤落到实操层面,我用一个典型的案例来模拟:某课题组研究两种不同饮食干预对小鼠肠道菌群的影响,设置了对照组(Control)和处理组(Treatment),每组各10只小鼠,一共20份粪便样本。提取DNA后对16S rRNA基因V3-V4区域进行PCR扩增,使用Illumina MiSeq平台进行双端300 bp测序。

本地数据目录长这样:

rawdata/ ├── C01_S1_L001_R1_001.fastq.gz ├── C01_S1_L001_R2_001.fastq.gz ├── C02_S2_L001_R1_001.fastq.gz ├── C02_S2_L001_R2_001.fastq.gz ... ├── T10_S20_L001_R1_001.fastq.gz └── T10_S20_L001_R2_001.fastq.gz

这20个样本一共产生40个FASTQ文件,每个文件约120 MB。下面把整个提交流程的关键节点演示一遍。

4.2 逐项填写示例:从Project到BioSample

打开SRA Submission Portal,登录账号后选择“New submission”,在项目信息Page创建Bioproject时:

  • Project title:Effect of dietary interventions on gut microbiota composition in C57BL/6 mice
  • Description:We investigated the impact of a high-fiber diet and a high-fat diet on the gut microbiota of C57BL/6 mice using 16S rRNA gene amplicon sequencing (V3-V4 region, Illumina MiSeq 2x300 bp). Fecal samples were collected at week 8 post-intervention.
  • Project type:Research project
  • 计划公开时间:选择 release with publication

提交后拿到Bioproject登录号,比如PRJNA1234567。接着进入BioSample步骤,由于样本数量是20个,我选择批量上传模式。先从NCBI下载BioSample attributes模板,在里面逐样本填写:

sample_namehosthost_agehost_sexcollection_dategeographic_locationtissue
C01Mus musculus8 weeksmale2024-03-15China: Beijingfeces
C02Mus musculus8 weeksmale2024-03-15China: Beijingfeces
.....................
T10Mus musculus8 weeksfemale2024-03-18China: Beijingfeces

这里特别强调geographic_location这一列:标准格式是“国家: 地区”,比如“China: Beijing”,不要写成“Beijing, China”,否则NCBI系统解析的时候可能出问题。如果样本来自多个地点,就分别填写对应的地点字符串。

4.3 SRA metadata与文件上传的对应关系演示

批量填完BioSample之后,SRA metadata页会自动从BioSample导入样本名。这里需要给每个样本填写Library和Platform信息。因为整个项目的文库构建方式一致,可以直接用页面的batch editing功能一次性给所有样本赋相同的Library参数:

  • Library strategy:AMPLICON
  • Library source:GENOMIC
  • Library selection:PCR
  • Platform:ILLUMINA
  • Instrument model:Illumina MiSeq
  • Forward primer:CCTACGGGNGGCWGCAG(341F)
  • Reverse primer:GACTACHVGGGTATCTAATCC(805R)
  • Target region:V3-V4
  • Read length:300

文件上传时,我直接用网页上传入口,20个样本、40个文件,逐个选好R1和R2的配对关系。这里的一个小经验是:先上传所有R1文件,再上传所有R2文件,按照文件名排序后批量勾选配对,效率比逐个拖拽高很多。

4.4 Review & Submit后的登录号判读

提交并成功校验后,NCBI会生成SRA实验登录号(SRX)、SRA Run登录号(SRR),同时BioSample会有SAMN开头的登录号,Bioproject是PRJNA开头。这四个编号的关系会在NCBI页面上清晰展示。文章里需要引用的通常是Bioproject登录号(PRJNA)或者SRA登录号(SRR),期刊要求不同,按期刊指示填写。

从提交到正式公开,NCBI一般需要两三个工作日进行数据质量检查和元数据审核。如果状态变成public,你的数据就能被全球检索到;如果状态是in process或者on hold,说明还没释放。提交后可以通过页面右下方的“Manage Submissions”查看历史提交和当前状态。

5. 新手最容易卡住的四类问题与排查方法

5.1 BioSample属性表被驳回的常见原因

这是我在实操中遇到最多的一类退件。NCBI的工作人员会把BioSample里的必填项逐条审核,一旦缺失或不规范,就会在邮件中列出具体哪一行、哪个字段有问题。常见被打回的情况包括:

问题表现排查思路正确写法
经纬度格式错误用了度分秒或带方向字母使用十进制度数,例如39.9042 116.4074(经度 纬度)
日期格式不可识别写了“March 2024”或“2024/03/15”使用YYYY-MM-DD格式
缺少必需属性(如host)选了错误的BioSample package回到BioSample页面更换package,或补充字段后重新提交
缺少采样地点只写了“实验室”补充具体到国家或城市级别的信息

5.2 文件上传到一半断线怎么办

上传中断很常见。NCBI的网页上传在中断后一般会保留已经完整上传的文件块,你可以重新进入该提交的Files页面接着传,而不是从头再来。注意,如果有文件显示“upload incomplete”,建议删掉这个文件重新上传,不要只续传剩余部分,因为校验不通过会引发后续SRA文件解析失败。

大文件场景下,我更推荐用FTP。NCBI提供了一个upload文件夹,用FileZilla等FTP客户端登录后,把FASTQ文件放到指定的upload目录,然后在网页提交页面选择“use existing FTP files”,系统会自动扫描目录并关联文件。用FTP时文件名不能包含空格或特殊字符,这一条也要提前遵守。

5.3 提交后一直显示on hold,什么时候才能公开

on hold状态分两种情况:一种是系统按你选择的“release when paper published”策略,在文章正式见刊前一直保持数据不公开;另一种是NCBI还在进行数据质控,通常需要48到72小时,最长不超过一周。如果超过一周还没变成public,建议直接通过SRA support邮箱咨询,附上提交编号。

还有一种情况是,你已经把文章投出去了,但期刊没有跟NCBI产生自动关联,数据无法随接收自动释放。这时可以登录提交页面,手动把Release date改成当前日期或指定的提前日期。我遇到过合作实验室急着催数据公开,直接在“Manage Submissions”里改掉release date,过几个小时数据就可见了。

5.4 引物序列填错或目标区域填反了怎么办

如果你提交后才发现SRA metadata里的引物序列有误,不用慌张。在数据公开前,可以通过“Manage Submissions”打开对应提交,点击SRA metadata步骤编辑引物序列后重新提交,会生成一个新的SRA实验版本。数据公开后发现问题,处理就麻烦得多,需要联系SRA help desk说明情况,所以提交前仔细核对引物信息非常重要。

这里分享一个我自己的核对习惯:在Review & Submit的最终界面,把页面展示的每行样本名、文库策略、文件名全部复制到Excel里,跟本地的样本信息表做一次逐列比对,重点看文件与样本是否错位。耗时不超过5分钟,但能避免大多数数据错配事故。如果文件很多,可以考虑写个小脚本按文件名批量核验。

6. 从数据共享的角度聊聊提交策略与后续扩展

很多人以为数据提交到NCBI就算完事了,其实拿到登录号之后还有几个值得做的事情。第一,把Bioproject登录号和SRA登录号写进文章的Data Availability Statement里,这是期刊审查的硬性要求。第二,建议在BioSample页面补充“related data”信息,比如关联你已经上传的序列文件或原始数据,方便读者快速跳转。第三,如果后续补测了更多样本,可以直接在同一个Bioproject下面新增BioSample和SRA实验,不必为同一课题重复创建project。

从课题组管理的角度,我越来越觉得数据提交过程应该标准化。团队可以做一个固定模板的Excel表格,里面存放所有标准的BioSample属性值、引物序列、Platform型号,来新人之后按表格填即可,避免每次提交都回到最初的低效试错。我们实验室现在把当年交过的所有提交记录做成内部台账,包含Bioproject、BioSample、SRA、对应文章、公开日期,日常管理方便很多。

如果你提交的数据量很大,比如一个项目有好几百个样本,NCBI还支持通过Programmatic access或者C++ toolkit批量提交SRA metadata和文件,这属于进阶玩法,要写简单的XML文件,但对规模化提交真的很省力。我打算后面专门写一篇关于大规模批量提交的实践思路,如果大家有批量上传方面的需求,可以先在NCBI的SRA Submission Portal里把样本信息和FASTQ传到一半,然后联系NCBI技术支持请求Bulk FTP账户,流程会顺畅不少。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询