POPGENE遗传多样性分析实战:从数据格式到结果解读
2026/9/20 13:43:27 网站建设 项目流程

简介:POPGENE是一款基于Windows的免费物种遗传分析软件,这份图文版中文使用教程正是为它而写的,适合从事群体遗传学、分子生态学研究的科研人员和研究生快速上手。内容依托软件实际界面展开,系统介绍了POPGENE的窗口构成、八大菜单功能,并围绕Haploid Data Analysis与Diploid Data Analysis两大对话框,逐一讲解了基因频率、等位基因数、多态性位点、基因多样性、Shannon信息指数、Hardy-Weinberg检验、F统计量、基因流、遗传距离、UPGMA树形图及中性检验等常用分析模块的操作要点,还说明了数据文件表头与记录格式的编写方法。资源以1份PDF文档呈现,体积仅1.03MB,方便随时翻阅,目前已有344人学习。对于需要完成遗传参数计算、种群结构评估和亲缘关系分析的学者而言,这份中文教程能节省大量摸索英文软件界面的时间,是一款实用性强、可读性好的入门参考。 手头这份《POPGENE中文使用教程参照.pdf》,是我近几年见过流传最广、也最劝退新手的一份遗传学分析资料。POPGENE 是老牌的种群遗传多样性分析软件,很多实验室至今还在用它算遗传参数,可它的英文界面、老版本兼容性和严格的数据格式,让不少人一打开就懵。很多人下载完教程 PDF,真正卡住的往往不是软件装不上,而是数据格式到底该怎么排、分析结果里哪一列才是自己论文要的那个数字。这篇稿子就围绕这份 PDF 的核心内容,把从软件安装、数据整理到结果解读的完整流程重新拉一遍,特别适合正在做微卫星、SSR、RAPD、AFLP 等分子标记的硕士生和研究人员参考。

1. 项目概述与整体思路

1.1 POPGENE 是什么?解决什么问题?

POPGENE 是加拿大阿尔伯塔大学团队在上世纪九十年代后期发布的一款免费种群遗传学分析软件,它最早主要为等位酶、RAPD、AFLP 和微卫星标记设计,后来被许多农林和生态方向的课题组沿用至今。它的核心能力可以分成三块:一是计算基础遗传多样性参数,比如每个位点的等位基因数、期望杂合度、多态位点比例;二是做群体遗传结构检验,比如哈代-温伯格平衡、群体分化指数和基因流;三是输出遗传距离矩阵,方便后续做聚类图。用一句通俗的话说,把基因型数据丢进去,它能帮你回答“这一个物种的群体是不是分化了”“哪些地理群体更接近”“遗传多样性是高是低”这类问题。

1.2 为什么一本老教程还能被反复“参照”

很多学校实验室的公共电脑上还装着 POPGENE 1.31/1.32,因为审稿人和老一代老师认这套软件的输出格式。于是网上流传的各种中文 PDF 就成了一种“操作手册”,但这类 PDF 大多来自不同年份的转载或翻译,菜单名称、数据示例、输出结果表经常对不上号。更麻烦的是,软件本身不更新,和 Windows 10、11 的兼容性问题越来越多,按 PDF 里的说明点击却弹不出窗口的情况很常见。所以我更愿意把这本 PDF 当成“关键词对照表”来用,真正的操作细节,还是需要一遍一遍跑示例数据。这篇稿子就从这份 PDF 出发,把那些容易踩坑的地方全部补齐。

2. 软件准备与数据整理

2.1 版本选择与运行环境

我建议直接使用 POPGENE 1.31 或 1.32 的 Windows 版本,32 位绿色软件。下载后放到一个纯英文路径下,比如 D:\popgene,文件夹名不要带中文和空格。如果你的电脑是 Win10 或 Win11,右键主程序图标,进入“属性 -> 兼容性”,勾选“以兼容模式运行”,下拉选择 Windows XP Service Pack 3,再勾选“以管理员身份运行”,可以解决大部分启动不了的问题。高分屏下字体偏小的话,在兼容性设置里点击“更改高 DPI 设置”,勾选替代高 DPI 缩放行为,让 Windows 来缩放,界面会清楚一些。老软件别放 C 盘 Program Files 里,权限和虚拟化设置容易干扰它读写文件。

2.2 一个能直接抄的数据格式模板

POPGENE 对数据文件极其严格,多数人都是在这一步被劝退的。我平时用的模板是这样的:第一行是说明文字;第二行依次写“群体数、每个群体的个体数、位点数”;第三行开始是第一个群体的群体名,然后每个样本占一行;每个样本先写个体编号,再按位点顺序写等位基因。共显性标记(比如 SSR、SNP)每个位点要用两列,例如某个位点的两个等位基因是 101 和 101,就写“101 101”;显性标记(RAPD、AFLP)每个位点只有一列,写 1 或 0,分别代表有带和无带。缺失的等位基因用 0 占位,不要留空,也不要用“NA”。我实际常用的模板如下,可以直接复制改数据:

My SSR data for POPGENE 3 6 4 PopA A01 101 101 203 207 152 152 88 88 A02 101 103 203 203 150 152 88 90 A03 101 101 207 207 152 154 88 88 A04 101 101 203 203 152 152 88 88 A05 101 103 207 207 150 152 88 88 A06 101 103 203 207 152 152 88 88 PopB B01 101 101 203 203 150 150 88 88 ... PopC C01 101 101 203 207 152 152 88 88 ...

上面这个例子声明了 3 个群体、每个群体 6 个个体的前一部分、共 4 个位点,所以每条数据行里就应该包含 8 个数字(四个位点乘以两个等位基因)。如果你的数据文件是从 Excel 直接粘贴生成的,一定要检查是不是把 tab 或者逗号带进去了;POPGENE 通常只认空格分隔。

2.3 从 Excel 整理数据时最容易出的问题

我自己习惯先在 Excel 里把不同群体的数据分成不同的区块,因为每个群体的个体数一致时,第二行的数字才不容易填错。整理完成以后另存为文本文件,再用记事本打开,把所有连续空格替换成单个空格;如果 Excel 保存的是制表符分隔,用记事本里的“编辑 -> 替换”把 tab 替换成空格,这一步能减少非常多的解析错误。文件名和路径全部用英文和数字,不要出现中文。很多新手把群体名写成“北京群体”“四川群体”,结果程序读出来乱码不说,第二行的个体数还会对不上,数据根本跑不出来。再强调一遍:缺失值写 0,不要写 NA 或留空;如果某个位点两个等位基因都缺失,就写“0 0”。

3. POPGENE 实操全流程

3.1 打开数据文件后首先检查什么

双击 POPGENE 主程序后,先别急着点统计菜单。大部分版本在菜单栏提供 File、Data、Statistics 这样的入口,你需要在 File 菜单里打开或新建项目,然后指定刚才准备好的 txt 文件作为输入数据。数据加载正常时,菜单栏里的 Statistics 应该从灰色变为可用状态;如果还是灰色,基本可以断定是数据格式没读进去。这时候回到 POPGENE 自带的示例数据,对照它原样的文件头,逐行检查第二行的三个数字是否与实际数据行列数一致,尤其是“每个群体的个体数”这一项。不同群体个体数不一样时,POPGENE 老版本很难处理,宁可补上缺失个体行再用 0 填充缺失位点,也不要把个体数写成不整齐的数字。

3.2 参数设置:共显性数据和显性数据绝对不能混用

数据读入后,进入 Data 或 Options 相关菜单,确认分析类型是 Codominant 还是 Dominant。用 SSR、微卫星、SNP 的结果,选 codominant;用 RAPD、AFLP 这类显性标记,选 dominant。这个选项会直接影响后面一大堆计算逻辑,因为显性带型数据无法区分杂合子,很多参数只能按频率近似估计。如果在分析前不确认,可能最后得到的 Ho、He 完全是错的,但程序不会报错,这一点很“阴险”。另外,如果你研究材料是多倍体或者单倍体,也要在相应选项里设置,POPGENE 默认多数是三倍体或二倍体的格式,需要改成与你实验设计一致的模式。

3.3 核心分析流程与结果保存

我通常按固定顺序操作:先算遗传多样性,再检验哈代-温伯格平衡,最后算遗传距离。遗传多样性一般通过 Statistics 菜单里的 Summary Statistics 输出,勾选所有位点和所有群体,可以得到 Na、Ne、I、Ho、He、Fis 等参数。Hardy-Weinberg 检验在 Statistics 菜单里单独进入,选择全部位点后输出到结果窗口,里面包含卡方值和 P 值。遗传距离则在 Statistics 菜单里的 Genetic Distance 子菜单选择,常用的是 Nei 1972 或 Nei 1978,程序会输出遗传距离矩阵和遗传相似度矩阵。结果窗口的内容可以直接复制,也可以保存成文本,保存时注意输出路径同样不要有中文。要是想继续画聚类图,把遗传距离矩阵复制出来,用 MEGA 或 R 画 UPGMA 树,POPGENE 自带的作图模块出图太古老,放到论文里不好看。

3.4 用 R 快速从距离矩阵画 UPGMA 树

如果在 3.3 里把遗传距离矩阵保存成了文本文件 distance.txt,那么用 R 画 UPGMA 树其实很简单。打开 R 或 RStudio,执行下面几行:

d <- as.dist(read.table("distance.txt")) hc <- hclust(d, method = "average") plot(hc, hang = -1, main = "UPGMA tree")

这里的 method = "average" 就是 UPGMA 算法,hclust 的横坐标默认是群体编号,你可以把行名改成实际群体名。画完以后用 ggtree、ape 包再美化也行。这一步虽然不是 POPGENE 必须做的,却是论文出图常用流程,很多 PDF 教程没细讲,我在旁边补一句。

4. 核心结果参数解读

4.1 遗传多样性参数速查表

拿到 POPGENE 输出后,新手最容易做的一件事是把整个结果窗口截图丢进论文,截图里其实充斥着无关信息。我建议只从输出里摘下面这几个关键值,按群体整理成表格:

缩写全称/含义论文里怎么写
Na观测等位基因数,反映位点上的等位基因丰富度The observed number of alleles (Na) ranged from...
Ne有效等位基因数,根据等位基因频率换算Effective number of alleles (Ne) was...
IShannon 多样性指数,综合了丰富度和均匀度Shannon's information index (I)...
Ho观测杂合度,某个位点上实际杂合个体比例Observed heterozygosity (Ho)...
He期望杂合度/Nei 基因多样性Expected heterozygosity (He)...
Fis群体内近交系数The fixation index (Fis) was negative/positive...
PPL多态位点比例Percentage of polymorphic loci (PPL)...

表格里的 Na、Ne 都先按位点算,再对群体做平均;He 比 Ho 更常用做多样性水平的标准指标,因为 He 受样本量影响更小。PPL 要注意你采用的判定标准,通常用 0.95 或 0.99 多态标准,不同标准算出来的数值不同。

4.2 Fst、Nm 与群体分化判断

POPGENE 的群体分化分析里,最常被引用的两个数字是 Fst(或者 Gst)和基因流 Nm。Fst 越大说明群体间分化越明显。经验上可以粗略用 Wright 的划分:Fst 在 0 到 0.05 之间表示分化很弱,0.05 到 0.15 是中等分化,0.15 到 0.25 分化较大,超过 0.25 分化很大。当然这只是经验值,物种差异、标记类型都会影响判断。基因流 Nm 则由 Fst/Gst 估算而来,一般 Nm 大于 1 表示基因流足以抵抗遗传漂变,群体间难以因为随机漂变产生明显分化;Nm 小于 1 时,漂变占上风,群体更容易各自分化。写论文时不要只丢一个 Fst 值,要把位点数量、样本量和计算方法写清楚,这样才经得起推敲。

4.3 Hardy-Weinberg 检验和 Fis 要配合着看

很多人看到 P < 0.05 就赶紧写“偏离哈代-温伯格平衡”,但这只是一个统计结论,生物学原因需要结合 Fis 一起解释。微卫星数据里出现显著偏离,最常见的原因不是自然选择,而是无效等位基因或基因分型误差。无效等位基因会导致明显纯合过剩,Fis 变成显著正值;如果 Fis 是显著负值,说明杂合子偏多,可能是种群存在选择压力,或者样本混了不同亚种群。我在写文章时通常先检查数据质量:重复样品的基因型是否一致、缺失率是否过高,然后再决定把这个偏离归因给近交、群体结构化还是技术误差。

5. 常见问题与排查技巧实录

5.1 数据读不进去?先做一张排错表

每次有学弟学妹带着“文件打不开”来找我,我都让他们先把这些情况对一遍:

现象可能原因解决办法
打开后只显示标题行,后面没有数据第二行的三个数字和实际行列数对不上数一遍群体数、每个群体个体数、位点数
提示数据行数不足或读取错误群体之间保留空行,导致程序误以为数据结束删除所有空行
报错说 missing value缺失值写了 NA、空格或者点号全部替换成 0,两个等位基因缺失写“0 0”
结果里位点数量感觉少了一半共显性数据每个位点只给了一列改成每个位点两列
打开文件是乱码群体名或路径带中文全部改成英文数字,文件另存为 ANSI 编码

5.2 老软件在 Win10/11 下打不开的完整处理顺序

如果你双击 POPGENE 后界面闪一下就没反应,先不要重新下载。按这个顺序试:右键主程序 -> 属性 -> 兼容性 -> 勾选以兼容模式运行并选择 Windows XP SP3;再勾选“以管理员身份运行”;接着把整个程序文件夹移动到 D 盘根目录或纯英文目录;最后关闭杀毒软件对老版绿色软件的限制,或把它加入信任区。如果还想根治界面中文乱码,可以在 Windows 的区域设置里勾选“Beta 版: 使用 Unicode UTF-8 提供全球语言支持”,但这会影响其他软件,不太建议开。多数情况兼容模式就够了。

5.3 结果截图抵御审稿人的小技巧

POPGENE 自带结果窗口的字体和边框都比较原始,直接截图放进论文里确实不好看。我的做法是不截图,直接选中结果文字复制到 Excel,然后只保留需要的参数列,做成规范的三线表。遗传距离矩阵同理,复制到 Excel 再转置。这样做一方面避免截图模糊,另一方面也方便后续做聚类图或者算其他统计。如果必须使用 POPGENE 自带的图,建议把窗口背景设为白色,并拉大窗口再导出,至少别把灰色工具条截进去。

6. 做 POPGENE 分析的一点个人建议

6.1 先把自带示例数据跑通一遍

这是我能给的最直接建议。网上下载的 POPGENE 压缩包里通常会带一个示例数据文件,打开软件后先打开这个示例,把所有菜单点一遍,看生成的输出长什么样。等熟悉了每个参数对应的结果位置,再把自己的数据替换进去。我当时花了整整一个下午卡在数据格式上,后来把示例文件里的数字一个个替换成自己的数据,才意识到第二行那个“每个群体个体数”必须严格一致。这个小动作,能省下你和导师反复沟通的很多时间。

6.2 把数据整理模板固化下来,一劳永逸

既然格式这么容易错,我建议你做一个固定 Excel 模板。第一列写个体编号,后面每个位点占两列,分别是等位基因 1 和等位基因 2;不同群体之间用颜色区分。每次拿到新的测序结果,只要把位点名和基因型填充进去,再通过一个简单的“文本拼接”公式把行生成好,另存成 POPGENE 需要的空格分隔 txt。这样不但省时间,还降低了漏列、错行的概率。我用这个办法帮实验室处理过十多个物种的数据,再没有因为文件格式被卡过。

本文还有配套的精品资源,点击获取

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询