☰
宏基因组分箱实战:从组装到MAG评估与下游分析
2026/10/10 4:22:31 网站建设 项目流程

1. 从一锅"微生物汤"里捞出单个基因组:宏基因组分箱到底在做什么

做微生物研究的朋友应该都有过这种经历:从土壤、肠道或海洋里取一份样品,提取总DNA,送测序,回来后拿到上百万条reads。如果做的是扩增子测序,那只能看到"有哪些菌",大概搞清楚群落组成。但如果你想知道"某个菌能在环境里干什么活、能否把葡萄糖变成丁酸、有没有抗生素耐药基因",扩增子远远不够,你需要的是单个菌的完整基因组。

传统做法是把菌分离纯培养,再测序。可现实是,环境里超过99%的微生物根本养不出来,纯培养这条路走不通。就算养出来了,培养条件也可能大幅改变它的基因表达和代谢潜能,不能代表它在自然环境里的真实状态。

宏基因组分箱(metagenomic binning)要解决的就是这个问题:在一个包含几十甚至上百种微生物的混池测序数据里,想办法把属于同一个基因组的序列碎片聚到一起,重构出接近完整的、代表某个物种的基因组草图,也就是大家常说的MAG(Metagenome-Assembled Genome)。

我从第一次接触这个技术到现在,最大的感受是:它本质上做的是一件"分类整理"的事。就好像面前有一大堆混在一起的乐高零件,来自几十个不同的套装,你需要靠零件的颜色、形状、使用频率等信息,推断哪些零件属于同一套,再拼出尽可能完整的模型。分箱的好坏,直接决定了后面所有分析的可信度——拼出一个完整性只有40%的基因组,和拼出一个完整性95%、污染率2%的基因组,学术结论的天差地别。

分箱的学术价值也正在于此。这些年宏基因组学领域的大量新物种、新功能基因、新代谢通路,很多都是从MAGs里挖出来的。没有分箱技术,这些信息会继续淹没在海量短读序里。这篇文章我从技术原理讲到实操中的坑,希望能帮刚入坑的朋友建立一套完整的判断框架。

2. 分箱之前:为什么组装质量决定了分箱的天花板

2.1 从reads到contigs,先解决"拼图"问题

分箱的输入不是原始reads,而是组装后的contigs。这一步看似理所当然,却是很多人忽略的关键点。

宏基因组测序拿到的是长度150bp左右的短读序,它们像被切成碎片的书页。组装就是把重叠的片段拼接回尽可能长的"文字段落",也就是contigs。但宏基因组的组装比单菌基因组要难得多:混合样品里多个物种之间可能存在相似序列,测序深度也各不相同,重复区域难以跨越。

组装质量差、N50低、contig普遍很短,分箱的结果几乎不可能好。这就好比你想把一叠碎纸片按笔迹归回不同的信件,可碎纸片本身已经太小太碎,再专业的机器也分不出所以然。

选择组装工具时,我个人的习惯是:先看你的数据量。宏基因组样品如果测序深度足够(通常建议每个样品不少于5-10 Gbp),用MEGAHIT可以快速获得初始组装结果;如果追求更长的contigs和更好的基因完整性,metaSPAdes通常表现更好,但会消耗大量内存和时间。条件允许的情况,可以两个都跑一遍,比较N50和完整基因比例再定。

2.2 组装结果的过滤与去冗余

组装出来以后不要急着分箱。那些又短又可能来自测序错误的contigs,不但帮不上忙,反而会严重干扰分箱算法。

常规做法是过滤掉长度小于1000bp(有人用1500bp)的contigs。为什么是这个数量级?因为分箱算法主要依赖k-mer频率特征和覆盖度信息,contig太短时这些统计特征不稳定,缺乏足够的数据点,聚类时会误判。尤其那些来自低丰度物种的短contigs,是分箱错误污染的主要来源。

另外,如果做了多个样品的联合组装或共组装,要去冗余。常用工具是CD-HIT或者MMseqs2,按95%左右相似度去冗余。需要注意:这个去冗余阈值和物种(OTU/ASV)聚类的阈值不是一个概念,不要混淆。

提示:过滤掉短contigs之后,建议重新计算一下组装结果的N50和总长度,做到心里有数。如果过滤后剩余的总长度不到测序数据预期基因组的几倍,说明组装效果很差,先去优化组装再谈分箱,否则后面全是白费功夫。

3. 分箱的两大底层信号:组成特征与覆盖度曲线

分箱算法之所以能把不同的contigs归到同一个基因组,主要依据两大类信号。理解这两个信号,你就能够判断各种分箱工具到底在干什么。

3.1 组成特征信号:不同物种的DNA"笔迹"不同

第一个信号是序列组成特征,最常用的是k-mer频率分布。你可以把它想象成每个物种在DNA序列里留下了自己的"文风"——某个长度为k的碱基组合(比如k=4的四联体)出现在某段序列中的频率,在不同物种间有差异,但在同一物种内部相对稳定。

为什么同一物种的基因组各区域会保持相似的k-mer频率?这背后有很多因素:不同菌的GC含量偏好、密码子使用偏好、DNA复制起始区域的碱基偏向、甚至水平基因转移留下的印记等。这些因素共同导致同一基因组的不同区域在统计特征上"长得像一家人"。

实际操作里,k-mer通常取4或5。k值太小,区分度不够;k值太大,稀有k-mer导致特征矩阵过于稀疏,同样影响聚类效果。很多工具内部封装了这一步,不需要你手动指定,但理解它在做什么,会让你在调试参数时有方向感,而不是瞎试。

3.2 覆盖度信号:丰度变化规律是第二个维度

第二个信号是覆盖度(coverage),也叫测序深度。同一物种在不同样品里的相对丰度变化趋势是相似的。

举个例子:你取了10个不同时间点的肠道样品,某个菌在样品1里丰度高、样品2里低、样品3里中等……它的contigs在这10个样品里的覆盖度会呈现一条特征曲线。另一个丰度变化趋势完全不同的菌,曲线形状就完全不同。分箱算法利用这个多维信号,可以把来自同一个基因组的contigs聚到同一类里。

这也就解释了为什么多样品联合分箱的效果通常比单样品分箱更好:单样品只能靠组成特征和单个覆盖度值这两个维度,信息有限;多种品数据提供了覆盖度随样品变化的多维向量,相当于给每个contig打了一个"指纹标签",大大增强区分能力。

这一点是我在实际项目中感受最深的:同样一批数据,单样本分箱出来可能只能得到10来个中质量的MAGs,而把同一批样品联合起来做分箱,数量和质量会有明显提升。建议你在设计实验之初就考虑:如果要做分箱,务必设置生物学重复或者多个时间点/处理组,不要只送一个样品。

4. 主流分箱工具的选型逻辑:单兵作战还是军团协同

4.1 常用的自动分箱工具

做分箱这些年,我先后用过CONCOCT、MetaBAT2、MaxBin2以及后续的MetaBinner和SemiBin等工具。每个工具的实现路径不同,先简单做个对比:

工具核心方法优势主要局限
CONCOCT基于k-mer频率+覆盖度,采用高斯混合模型聚类思路直观,适合小规模数据对大规模数据运行较慢,聚类不稳定
MetaBAT2基于四核苷酸频率和覆盖度,使用图聚类算法速度快,结果稳定,多样品支持好对高污染或近缘菌株区分可能不够细
MaxBin2基于期望最大化(EM)算法,结合覆盖度和k-mer对低丰度物种有一定优势对高复杂度样品容易碎片化
DAS Tool整合多个工具的bin结果,做自动化筛选合并能充分利用各工具优势,提高回收率需要先跑多个分箱工具作为输入,流程较长
SemiBin基于自编码器深度学习方法对短contig有一定程度的恢复能力依赖训练模型,对特殊环境泛化有待验证

这么多工具,到底选哪个?我的建议是不要只跑一个,尤其不要只跑一个就下结论。学术界目前比较推荐的做法是:至少跑两个独立工具,再用DAS Tool进行整合,最后用CheckM评估并挑选最优质的bin集合。

4.2 什么时候可以信任自动分箱结果

自动分箱工具的聚类结果,直接拿去用是有风险的。分箱工具本身不会告诉你"这个bin是否可信",它只会输出聚类结果。判断可信度要靠下一步的质量评估。

一个很重要的认识是:分箱工具输出的"bin"并不一定等于"物种"。同一个bin里可能存在两个亲缘关系很近、基因组结构高度相似的物种,它们因为组成特征和覆盖度曲线几乎一致,被错误聚到一起。这种情况在菌株水平上尤其常见。反过来,同一个物种的基因组如果含有大量水平转移区域或可移动元件,也可能被拆到不同的bin里。

所以,分箱结果的生物学解释一定要结合后续的基因组质量评估、物种分类注释、甚至单基因系统发育分析来交叉验证。这也是我见过很多初学者最容易犯的错误:MetaBAT2跑完输出20个bin就直接当20个物种开始分析,完全跳过质量验证。

4.3 DAS Tool整合的实际经验

DAS Tool不是我见过最快的工具,但它确实能改善最终结果,尤其是召回率。它的思想是:多个分箱工具同时把某个contig聚在一起,那么这个聚类的可信度就高;如果某些contig只在一个工具的结果里出现,就要检查是不是噪音。

实际运行时,如果你只有一个样品,推荐输入MetaBAT2和MaxBin2的结果就够了,工具太多反而引入噪音。多样品时,可以再加入CONCOCT的结果。注意运行时需要指定搜索范围(--search_engine),默认是BLAST,速度慢;换成Diamond可以显著加速。这一步我踩过坑——第一次跑DAS Tool,默认BLAST跑了一晚上没跑完,换成Diamond后一个多小时就搞定了。

5. 分箱质量的"体检报告":完整度与污染度怎么读

5.1 CheckM的两项核心指标

分箱出来以后,必须做质量评估。现在通用的标准是CheckM,它基于基因组中普遍保守的单拷贝基因(比如细菌中常见的几十个必需基因)来判断。

原理很简单:一个完整的微生物基因组,这些单拷贝基因应该恰好出现一次。如果某个bin里这些基因只检出一部分,说明基因组不完整,**完整度(completeness)**不够;如果某些单拷贝基因出现多次,说明可能有其他物种混入,**污染度(contamination)**偏高。

好的MAGs一般要求完整度大于70%、污染度小于10%,这是MIMAG的最低标准。如果想做更精细的学术分析,中高质量MAGs往往需要完整度大于90%、污染度小于5%。你可以根据下游分析任务来调整:如果只是做门水平的粗注释,70%完整度够用;如果你想宣称发现了新物种、修订某个属的分类,那95%以上完整度、污染物低于5%是最低要求。

5.2 CheckM运行细节和结果过滤

CheckM的命令比较多,但核心流程就两步:先用lineage_wf(或者更快但稍旧一点的taxonomy_wf)评估,再用outlier步骤来识别可能混入的错误单拷贝基因区域。

运行时的坑我简单列一下:

  • 依赖数据库需要提前下载配置。第一次运行会提示下载HMMER的数据库文件,网络不好时容易卡住。建议在正式项目开始前先跑通一次。
  • 输入数据用的是分箱结果目录,格式为每个bin一个FASTA文件。DAS Tool的输出默认就是这种结构,但单个工具的原始输出可能是bin编号命名,注意统一文件名规范。
  • 评估结果会生成一个表格,包含Completeness和Contamination两列。建议用脚本过滤并统计,同时记录每个bin的N50、序列总数、基因组大小等信息。

提示:在做质量过滤时,建议同时考虑"基因组大小是否合理"。如果一个bin的基因组大小只有0.5 Mbp,哪怕完整度报了80%,也要警惕。正常细菌基因组是1-10 Mbp,低于1 Mbp能完整到80%是反常的,很可能是数据库里保守基因数量少导致的误判。

5.3 提高bin质量的精细化手段:分箱后优化(bin refinement)

检查完质量之后,常常会发现一批"中游"bin:完整度70%-80%,但污染度也在10%左右。直接丢弃有点可惜。这时可以做分箱后优化,代表性的工具是RefineM和Binning_refiner。

原理也很直观:利用一个bin中单拷贝基因的种类和数量,结合GC含量、四核苷酸频率、覆盖度一致性等信息,找到可能是外源混入的contigs,把它们剔除出去,或者把分散到多个低质量bin里的同一物种contigs合并。操作上它不是完全自动的,需要你根据提示手动筛选,适合有耐心的研究者。

我自己处理过的一个案例非常典型:一个MetaBAT2给出的bin,完整度85%,污染度12%。初步看污染主要来自一类重复区域。用RefineM做了精细检查,发现约8%的contigs可能是质粒或其他可移动元件序列。剔除后,完整度略有下降(82%),但污染度降到2%以下,符合中高质量MAGs标准。这个bin最终在后续功能分析里表现很好。可见,工具输出的低质量结果,未必全是坏的,值得再救一救。

6. 学术价值从哪来:从MAGs到新物种、代谢通路和生态功能

分箱技术对学术研究的贡献,绝不仅仅是"多拼出几个基因组"这么简单。这些年,宏基因组学领域的几个重要突破都离不开分箱技术。我在这里梳理几类常见的应用场景和学术价值。

6.1 发现未培养微生物的新物种和新谱系

环境中大量微生物无法培养,它们的系统发育位置、代谢特性、生态功能此前无从得知。通过分箱恢复基因组后,研究者可以做系统发育分析,确定这些MAGs属于哪个门、纲、目、科、属,甚至发现全新的谱系。

一个我印象深刻的例子:某课题组从地下深层水样品中恢复了若干个MAGs,序列相似性和系统发育分析表明它们代表了一个此前从未被描述的候选门。这个发现直接改写了微生物系统发育树的一个分支。如果只做扩增子测序,这些微生物会被归为"unclassified"就结束了,很难产生如此清晰的分类学结论。

实际操作上,MAGs做分类注释的常规流程是:用GTDB-Tk对比GTDB数据库,获得物种分类信息;再用保守蛋白的串联序列构建系统发育树。GTDB-Tk依赖较多,需要下载数据库文件,建议在服务器上用conda安装,一次配好。

6.2 重建代谢通路,预测生态功能

知道"有谁"之后,更重要的问题是"它们在干什么"。MAGs的学术价值很大程度上体现在功能基因注释上。通过对每个MAG做基因预测(Prodigal或者MetaProdigal)、功能注释(eggNOG-mapper、KEGG、COG等),可以重建特定菌株的代谢通路。

比如在肠道微生态研究中,分箱得到的某种产丁酸菌MAG,你可以具体看到它有没有完整的丁酸合成途径、利用哪些底物、有没有能力合成特定维生素。这样的信息远比"该菌丰度增加"有说服力得多。这也让"菌群变化与疾病关联"的研究从相关性走向机制性。

6.3 抗生素耐药基因与毒力因子的宿主溯源

另一个热门应用是ARG(抗生素抗性基因)溯源。环境宏基因组里能检测到大量ARGs,但问题是:这些ARGs在哪个物种的基因组上?如果抗性基因位于质粒或转座子上,又可能在不同菌之间传播。分箱提供了一种"宿主追溯"的途径。

具体操作:在一个高质量MAG中检测出某个抗生素抗性基因,基本可以认为这个菌携带此基因;如果多个不同分类的MAGs都含有同一ARG序列,就要高度警惕水平基因转移。这种分析是传统总DNA宏基因组测序无法直接做到的。

6.4 比较基因组学与微进化研究

恢复同一环境不同样品中的多个MAGs之后,还能做群体遗传学和微进化分析。比如分析同一个物种在不同时间点/不同地理位置的基因组差异,寻找正选择信号、重组事件和代谢基因的增减。这为理解微生物如何适应环境提供了直接证据。

这类分析对MAG质量要求很高,通常要完整度90%以上,且需要严格的菌株级判定。建议用dRep或FastANI来确认两个MAGs是否属于同一个物种/菌株水平基因组簇,再做下游比较。

7. 做宏基因组分箱最常踩的五个坑,以及我踩出来的解决方法

7.1 坑一:多样品数据直接把原始reads全拿来共组装

共组装可以增强低丰度物种的恢复能力,但并非样品越多越好。样品来自完全不同的环境类型时(比如土壤和海水硬放到一起),组装会大量产生嵌合体,分箱结果自然也好不了。

解决思路是:先做β多样性分析,确认样品间差异程度;同类型样品可以共组装,跨类型的建议分组装好,再对各自的contigs做分箱。组装时还要注意降低低质量reads的干扰,建议先运行fastp或Trimmomatic做质控。

7.2 坑二:分箱时只用了默认参数,完全不看数据特点

每个数据的特点都不一样,默认参数只是"平均可用"而非"最优"。比如MetaBAT2有些参数可以调节使聚类更精细;涉及大量低丰度物种时,覆盖度均一化方式也要调整。实际跑之前先看看自己的数据规模和覆盖度分布,别直接一把梭。

还需要注意高覆盖度样品的共组装污染:测序深度极高的样品(比如超过100x)会导致重复区域过度拼接,产生人为嵌合contigs。这种情况下可以适当降低覆盖度再进行组装(比如用samtools按比例抽样子集reads)。

7.3 坑三:bin的质量评估只看完整度和污染度

完整度和污染度重要,但不是唯一标准。一个合格的MAG还应满足:N50足够长(建议>5kb),序列数量不要过多(几十个或几百个contigs是正常,上千个就要怀疑),bin里所有contigs的覆盖度曲线大致相同(如果曲线差异巨大,说明不同菌混入)。

这些信息可以通过CheckM的输出表格加seqkit stats等工具获得。我现在做分箱总结时都会附上一张表格,包含bin名称、完整度、污染度、大小、N50、contig数量、物种注释等多列信息,方便后续筛选和论文补充材料。

7.4 坑四:休要忽视污染物的生物学意义

上面讲的都是如何降低污染,但污染并不一定是"错误"。分箱出来的bin里偶尔携带的质粒、噬菌体序列,可能是真实存在于该菌体内的。过度清理把它们剔除,反而损失了可移动元件的宿主信息。

因此在做进一步功能分析时,我建议保留原始bin和优化后的bin两套版本。如果需要分析抗性基因转移、噬菌体整合等场景,用原始版;如果做系统发育、物种界定等依赖于染色体核心基因的分析,用优化版。

7.5 坑五:不同数据库注释出来的分类结果大相径庭

MAGs做分类注释时用不同数据库会导致结论不同。比如用GTDB和用旧的NCBI分类体系,同一个MAG可能归到不同的门级别。这并非错误,而是不同分类体系的界定标准不同。

写作和汇报时,务必写明你用的是哪个数据库版本。现在的学界趋势是GTDB成为宏基因组分类注释的主流参考,尤其在处理未培养微生物时更可靠。NCBI数据库对未培养谱系覆盖有限,容易把新谱系错误归到已有物种。

8. 一条可以直接照搬的分箱分析流水线与我的参数建议

说了这么多,最后给出一套我自己在实际项目中反复使用、稳定可靠的分箱分析流程。你可以把它当作一个起点,根据自己的数据情况微调。

8.1 主要流程步骤

  1. 质控:fastp去除低质量reads和接头,得到干净reads。
  2. 组装:MEGAHIT或metaSPAdes组装成contigs。
  3. 过滤:过滤小于1000bp的contigs,保留长片段。
  4. 覆盖度计算:将clean reads比对回contigs,用jgi_summarize_bam_contig_depths计算每个contig在多样品中的覆盖度。
  5. 分箱:分别运行MetaBAT2、MaxBin2,可选加CONCOCT。
  6. 整合:DAS Tool整合多个分箱结果,得到优化bin集合。
  7. 质检:CheckM评估完整度和污染度,过滤出高质量MAGs。
  8. 优化:针对中等质量的bin再做RefineM精修。
  9. 注释:GTDB-Tk做分类注释,Prodigal预测基因,eggNOG-mapper做功能注释。
  10. 下游分析:根据研究目标开展系统发育、代谢通路、比较基因组等分析。

8.2 我常用的一些参数

MetaBAT2的运行命令相对简单,但需要提前生成深度文件。这里给一个典型流程的示例:

# 1. 质控 fastp -i R1.fastq.gz -I R2.fastq.gz -o clean_R1.fastq.gz -O clean_R2.fastq.gz # 2. 组装(多样品共组装时把多个clean文件放一起) megahit -1 clean_1.fastq.gz -2 clean_2.fastq.gz -o assembly -t 32 # 3. 过滤短contig seqkit seq -m 1000 assembly/final.contigs.fa > filter.contigs.fa # 4. 比对得到覆盖度 bwa index filter.contigs.fa bwa mem -t 32 filter.contigs.fa clean_1.fastq.gz clean_2.fastq.gz | samtools sort -o contigs.sorted.bam jgi_summarize_bam_contig_depths --outputDepth depth.txt contigs.sorted.bam # 5. MetaBAT2分箱 runMetaBat2.sh filter.contigs.fa contigs.sorted.bam -o metabat_output # 6. MaxBin2分箱 run_MaxBin.pl -contig filter.contigs.fa -abund_list depth_list.txt -out maxbin_output # 7. DAS Tool整合 DAS_Tool -i metabat_bins.txt,maxbin_bins.txt -l metabat,maxbin \ -c filter.contigs.fa -o das_tool_out --threads 16 # 8. CheckM评估 checkm lineage_wf -x fa das_tool_out_DASTool_bins checkm_results

以上命令中涉及到具体的文件路径请替换为你的实际路径。如果想自动完成全流程,可以用snakemake或者nextflow串起来。但第一次建议还是手动跑,每一步都理解了再上流程,否则出现奇怪的错误不好排查。

8.3 我推荐的分析顺序

对刚接触分箱的朋友,我的建议是从"先利用现成组合流程"开始。别一上来就自己组装管道,先用上面的命令行流程跑通一遍,再用Anvio等图形化工具对少数重点bin做精细查看。

图形化工具有个好处是可视化:你能直观看到分箱过程中哪些contigs边界模糊、哪个bin的覆盖度和GC偏离大。虽然批量化不如命令行,但在确认某个关键bin的质量时,这个"眼见为实"的过程能极大提升后续论文审稿时的信心。

9. 分箱之后的"最后一公里":数据提交与论文呈现

学术价值最终要落地到发表成果上。分箱得到的MAGs在论文中如何呈现,有几个关键点新手常常忽略。

9.1 数据公开和NCBI/ENA提交

现在主流期刊普遍要求MAGs数据上传公共数据库。一般需要提交组装后的基因组fasta文件,以及与样品相关的元数据、分箱质量指标。很多期刊还要求提供MIMAG标准描述表格。

前几年在NCBI提交MAGs时还需要做一个Biosample的metadata描述,最近流程简化了一些,但依旧比较繁琐。我的经验是提前准备好样品的经纬度、环境类型、采集深度等信息,一次性填完,避免反复修改。

9.2 论文中的MAG质量描述规范

在Methods里,必须写明:分箱工具及版本、参数、CheckM版本和数据库版本、质量阈值(比如完整度>70%,污染度<10%)、数据总量和组装统计等。很多审稿人会仔细核对这部分,含糊的描述会被直接要求补充。

结果里展示MAGs时,一张汇总表是标配。表里至少包含:Bin ID、系统分类、基因组大小、Contig数量、N50、GC含量、完整度、污染度、tRNA数量、是否含16S rRNA基因。这些数据越齐全,审稿人越难挑毛病。

9.3 16S rRNA基因缺失问题

不少MAGs中检不出完整的16S rRNA基因序列,这让许多做传统微生物学研究的人不太习惯。原因是16S rRNA基因在基因组中属于重复区域,组装时往往无法跨过全长的重复单元,导致在contigs里不完整或缺失。

现在学界对MAGs的分类鉴定不再强依赖16S rRNA,而是以系统发育基因集(如GTDB-Tk用的120个细菌标记基因)为主。如果你的MAG 16S rRNA缺失,不要恐慌,文章中写清楚"基于GTDB的120 marker gene分类结果"即可。这一点审稿人也普遍接受。

10. 我的几个实操体会

从第一个宏基因组项目跑到今天,分箱这个环节我改写过无数次流程,也推翻过不少自己之前的结论。最深的体会是有三条。

第一,分箱不是一个一劳永逸的过程,它是一个需要反复调整迭代的环节。新工具不断出现(我目前还在关注SemiBin的更新),参数选择和环境适配永远是进行时。每次拿到新数据,先小范围试跑,确认结果合理,再全量运行,能省下大量返工时间。

第二,分箱结果的解读要有生态学知识兜底。一个bin分类到某个属,结果该属已知物种全是嗜热菌,你样品却是深海冷泉,那就要高度怀疑注释有误或分箱污染。这类"解释与背景冲突"的问题,自动工具和数据库永远发现不了,只能靠研究者的判读。

第三,不要为了追求bin数量牺牲bin质量。一些组会汇报时,大家喜欢比谁的MAGs数量多。但几十个低质量"半个基因组",学术贡献并不一定大于几个打磨精细的高质量MAG。一个好到可以做种群遗传分析的MAG,价值远胜一堆只能注释到门水平的碎片。

希望这篇文章能帮你把宏基因组分箱这件事从"黑盒操作"变成"有章法的分析流程"。如果你正拿着自己的数据准备跑分箱,建议照着上面的流程先过一遍,再针对问题来讨论。实践出真知,跑过的数据多了,自然会对binning的味道越来越敏感。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询