☰
CUTTag联合RNA-seq解析乳酸化修饰驱动增生性疤痕的机制
2026/10/9 8:57:39 网站建设 项目流程

上个月我在一个瘢痕相关的病例讨论会上,看到一张烫伤后疤痕增生的照片,伤口早就愈合了,但红褐色的疤痕组织却从皮面一点点拱起来,摸上去又硬又韧,患者说晚上痒得睡不着。增生性疤痕就是这么麻烦的东西,它本质上不是“没修好”,而是修得太猛,成纤维细胞和胶原沉积彻底失控。以前我们聊这类病,习惯盯着TGF-β、胶原合成这些老面孔,但这两年有一类新机制冒出来了:乳酸。乳酸不再只是糖酵解的代谢废料,它会被“写”进组蛋白上,形成一种叫组蛋白乳酸化的表观遗传修饰,直接影响基因转录。Nat Commun上有一篇新工作,正是用CUT&Tag加RNA-seq两条技术线,把“乳酸化修饰—基因表达—疤痕形成”这条链条完整串了起来。这篇博文我打算把这篇文章的实验设计、技术原理和分析流程逐层拆开,也会把我自己实际操作中踩过的坑、摸索出的经验一起放进去,给正在做表观遗传、组织纤维化或者想入门CUT&Tag的朋友做个参考。

1. 增生性疤痕、乳酸化与CUT&Tag:三个关键词先对齐

1.1 增生性疤痕:修复过程“过拟合”的产物

增生性疤痕是皮肤在深度烧伤、手术切口或外伤后修复异常的结果。正常伤口愈合要经历炎症、增殖、重塑三个阶段,成纤维细胞在适当的时候增殖,分泌胶原把伤口“补”上,之后再由基质金属蛋白酶把多余的细胞外基质降解清理。这个过程讲究动态平衡,但增生性疤痕里,平衡彻底被打破:肌成纤维细胞一直不退场,表达α-SMA的细胞持续大量产生COL1A1、COL3A1和纤连蛋白,胶原合成明显压过降解,病灶就慢慢隆起,形成又红又硬、边界清楚的肿块。

临床上处理这种疤痕非常头疼。硅酮贴、压力治疗、激素注射、激光甚至手术切除都试过,但复发率不低。更关键的是,增生性疤痕不只是影响外观,它会引发顽固性瘙痒和刺痛,长在关节部位还会限制活动。所以领域里一直在找驱动成纤维细胞“失控”的更上游机制,不只是抑制某一个胶原分子,而是找到那个控制全局的开关。

这里要稍微区分一下增生性疤痕和瘢痕疙瘩:前者一般局限于原始损伤范围,后者会像螃蟹一样向外侵袭性生长。但这篇文章本质上聚焦的是过度修复的共同逻辑。有趣的是,疤痕组织有个很明显的代谢特点:长期的炎症和局部缺氧会迫使细胞更多依赖糖酵解供能,糖酵解的终产物乳酸因此大量堆积。而乳酸恰恰在近年的表观遗传学里拿到了“新身份”,这个交叉点才是整篇文章的起点。

1.2 组蛋白乳酸化:乳酸怎么变成染色质上的“开关”

把乳酸和组蛋白修饰联系起来,是2019年才发生的事情。当时的研究首次报道赖氨酸乳酸化(Kla)作为一种全新的组蛋白翻译后修饰存在,简单说就是:乳酸分子可以被酶催化连接到组蛋白赖氨酸残基上。这个发现的意义在于,它把代谢状态和基因转录直接连了起来——细胞一旦糖酵解旺盛、乳酸堆积,多出来的乳酸不只是排出去或者当燃料,还能被“写”进染色质,改变基因的表达程序。

这个逻辑很像我们更熟悉的组蛋白乙酰化。乙酰化是乙酰CoA作为底物,由p300/CBP等乙酰转移酶催化,把乙酰基加到赖氨酸上,中和组蛋白正电荷,让染色质变得开放;乳酸化同样是利用乳酸基团,很多研究也指向p300/CBP这类酶参与写入,去乳酸化的擦除机制则涉及HDAC家族和Sirtuins。所以乳酸化不是一个孤立的修饰,它和乙酰化共享一部分酶学机器,却在特定病理条件下有自己独特的靶基因偏好。

纤维化领域这两年已经有不少证据显示乳酸化参与其中。比如巨噬细胞里的乳酸化可以推高炎症基因表达,成纤维细胞中乳酸化水平上升往往伴随着胶原相关基因的激活。但这类研究大多停留在某个候选基因或蛋白水平,缺少全基因组范围的“修饰地图”。要用一张地图看清乳酸化在疤痕组织里到底标记了哪些基因、这些标记又如何对应到表达变化,这就把CUT&Tag和RNA-seq推到了台前。

1.3 这篇文章的科学假说链:多组学到底要证明什么

把整篇文章浓缩成一条假说链大概是这样的:疤痕组织缺氧和炎症→糖酵解增强→乳酸堆积→组蛋白乳酸化水平整体上升→疤痕相关基因的启动子或增强子区域被乳酸化修饰覆盖→这些基因持续高表达→肌成纤维细胞激活、胶原沉积→疤痕增生。听起来很有逻辑,但真要发表到Nat Commun这个级别,光有逻辑不够,得有全基因组水平的硬证据,必须回答三个问题。

第一,乳酸化修饰在疤痕组织里是不是真的升高,升高到什么程度;第二,这些升高的修饰位点在全基因组上是怎么分布的,有没有富集到胶原合成、TGF-β信号这些疤痕核心通路的基因附近;第三,修饰的增加和基因表达的上升在单基因水平能不能对上,阻断乳酸化能不能把这条链打断。第一个问题靠组化和蛋白印迹基本能解决,第二个问题就需要CUT&Tag提供修饰位点的全基因组分布,第三个问题的表达维度由RNA-seq负责,功能验证再交给细胞和动物实验。

我特别想强调为什么这篇文章选择CUT&Tag而不是传统的ChIP-seq。疤痕组织活检样本非常珍贵,量本身就少,组织又硬,很难拿到大量细胞去跑ChIP-seq;CUT&Tag对细胞量要求低得多,信噪比也好,几百到几万个细胞就能做。文章里用的正是CUT&Tag来定位组蛋白乳酸化位点,这决定了后面所有机制推断的可靠性。技术选型选对了,后面分析才有底气。

2. 技术方案拆解:CUT&Tag与RNA-seq如何形成证据闭环

2.1 CUT&Tag是一个什么水平的技术

CUT&Tag的全称是Cleavage Under Targets and Tagmentation,核心思路就是用抗体引导Tn5转座酶,把目标组蛋白修饰周围的DNA直接切下来并加上测序接头。流程大致是:先把细胞膜通透化,让一抗进入细胞结合目标修饰,然后用二抗做信号放大增强结合,接着加入融合了Protein A/G的Tn5转座酶,让它被招募到抗体所在的位置;最后加入镁离子激活Tn5,在局部完成DNA片段化与接头连接,PCR扩增建库后直接上机测序。

这个技术相比ChIP-seq的优势非常明显。ChIP-seq需要超声打断染色质、免疫沉淀和末端修复,步骤多、样本量大,背景噪声也比较高;CUT&Tag把片段化这一步做在了“原位”,Tn5只在抗体富集的位置剪断DNA,因此特异性好、背景干净。更重要的是细胞量门槛極低,我在项目里用少到几千个细胞也能拿到稳定信号。对于疤痕组织这种消化后活细胞数量捉襟见肘的样本,这个优势几乎是决定性的。

实验中最需要重视的是抗体。CUT&Tag的原则是“抗体质量决定天花板”,同一管组织,换个抗体结果可能天差地别。文章中针对乳酸化修饰的抗体,实验前最好做一下预实验滴定,看看浓度在什么范围信噪比最优。另外,一抗的种属来源也要考虑:如果用了兔源一抗,Protein A可以直接结合它;如果是鼠源一抗,建议补一个抗鼠二抗来增强信号,不然Tn5招募效率会打折扣。

2.2 RNA-seq补上“表达”这块拼图

CUT&Tag能告诉你修饰“在哪里”,但修饰变了不必然等于基因表达变了,这时候必须靠RNA-seq来补表达维度。RNA-seq是成熟得多的技术,简单说就是把细胞里的全部mRNA反转录成cDNA,建库测序,通过比对和定量得到每个基因的表达量,再用DESeq2这类工具筛选疤痕和正常组织之间的差异表达基因。

在整篇文章的证据链里,RNA-seq的作用不只是给一个基因清单,而是要回答“乳酸化修饰改变之后,转录层面到底发生了什么”。差异表达基因富集在哪些通路,哪些关键基因正好落在CUT&Tag检测到的差异修饰区域内,这些都能帮助把表观修饰与下游功能“对账”。有一点必须提醒:疤痕组织内部其实是混合细胞群,如果直接用整块组织做bulk RNA-seq,不同细胞亚群的变化信号会彼此稀释,得到的差异基因往往是占比例最大的细胞类型主导的结果。文章如果能把这一步交代清楚,甚至用分离纯化的成纤维细胞单独做转录组,说服力会强很多。

2.3 实验设计:对照、分组与功能验证闭环

好的组学文章一定在实验设计上留足了对照组。这一类研究最常见的分组是:正常皮肤组织和增生性疤痕组织,每一组都做CUT&Tag和RNA-seq。然后把两组之间的差异乳酸化位点和差异表达基因分别找出来,再做交集分析。候选基因锁定之后,体外细胞模型就要跟上,最常用的刺激是TGF-β,这是公认的成纤维细胞活化诱导剂;再配合乳酸钠或乳酸处理,模拟疤痕微环境里的高乳酸状态,观察乳酸化水平是否随之上升、胶原基因是否被进一步激活。

要证明因果关系,“阻断”实验不可或缺。文章中会设计抑制试验,比如用LDHA抑制剂降低内源乳酸生成,或者用p300抑制剂C646干扰乳酸化写入,观察下游基因表达和细胞表型是否回落。条件允许的话再加上siRNA或CRISPR敲除,把链条里的某个环节具体敲掉,看表型变化。功能实验最常做的几类是CCK-8检测增殖、Transwell或划痕实验检测迁移、胶原凝胶收缩实验模拟疤痕挛缩,这些结果一起放在文章最后,形成“修饰→表达→表型”的完整闭环。

3. 从数据到机制:CUT&Tag+RNA-seq核心分析流程拆解

3.1 从fastq到peak:CUT&Tag的质控与Calling

拿到CUT&Tag原始数据后,第一步从来不是急着跑peak calling,而是先把质量关。先用FastQC和下机数据质控报告看测序质量、接头残留情况,再用bowtie2把reads比对到参考基因组。比对时建议加--local --very-sensitive参数,只保留比对质量高且唯一比对的reads。比完之后必须做一个容易被忽略的过滤:去掉线粒体reads。CUT&Tag数据里线粒体DNA占比经常能到百分之三四十,留着它们会让基因组上的目标信号被稀释,peak数量明显缩水。

去重也是个需要拿捏的环节。CUT&Tag文库里的PCR重复率通常很低,一旦重复率偏高,先怀疑建库出了什么问题。常规流程会用samtools markdup或Picard去重,去重之后再call peak。片段长度分布是判断实验做得成不成的直观指标,正常情况下会看到清晰的单核小体峰,说明Tn5确实在核小体之间切开,抗体识别有效;如果这个峰模糊不清,后面的分析也难有说服力。

Peak calling这一步,我个人的习惯是SEACR和MACS2结果交叉着看。SEACR是专门针对CUT&Tag这类高信噪比数据设计的,可以用IgG或单独用阈值控制背景;MACS2则是通用工具,参数上可以针对Tn5偏移做调整。可以先用SEACR跑一版,再用MACS2以BAMPE模式跑一版,把两种方法共有的peak作为后续分析的核心集合。质控指标要盯三样:peak数量是否合理、FRiP值(peak上的reads占总有效reads的比例)通常明显高于ChIP-seq,以及TSS附近信号富集是否锐利。

3.2 差异peak注释与通路富集:修饰到底落在了基因的哪里

拿到全基因组peak集合之后,关键一步是知道这些peak落在基因组的哪些功能区域。我一般用ChIPseeker做注释,它会自动把peak归类到启动子、外显子、内含子、5'UTR、3'UTR和远端基因间区。对于激活型的组蛋白修饰,启动子区域的富集是正常现象;但整篇文章的亮点往往藏在那些远端增强子区域的变化里,因为增强子上的修饰变化往往和细胞身份、病理激活状态关系更密切。

差异peak分析通常有两种路线。一种是把基因组按窗口或注释区域划分,统计每个窗口里的reads数目,再用DiffBind或edgeR做差异检验,比较疤痕组和正常组之间修饰信号的强弱变化。另一种是先分别call peak,再把重叠和特有的peak可视化对比。得到差异peak后,把peak关联到最近的基因,做GO和KEGG通路富集分析。疤痕相关文章跑出来的通路通常高度集中在ECM受体互作、PI3K-Akt信号、TGF-β信号和局灶黏附这些条目,这些结果与增生性疤痕的病理特征是对得上的。

这里有个经常被误解的细节:把peak用“最近基因”来关联,只是一种快速注释策略,不代表该peak就一定调控这个基因。尤其是落在增强子区域的peak,完全可能跨过中间好几个基因去调控远距离靶点。如果文章里出现某个差异修饰基因和差异表达基因对不上的情况,先别急着认为是数据矛盾,仔细检查peak落在基因体的哪个位置,再决定怎么解读。

3.3 表观与转录整合:把两套数据“对账”

将CUT&Tag和RNA-seq真正整合起来,是这类文章分析里最有含金量的部分。常见做法是取差异peak关联到的基因集合和RNA-seq显著差异表达基因集合做交集,再以四象限图的形式呈现:横轴是修饰信号变化量,纵轴是基因表达变化量,右上角是修饰增强且表达上调的基因,这是文章重点锁定的一批“嫌疑基因”。正常皮肤和疤痕组织之间,这类基因越多,代谢表观和病理表型的关联就越扎实。

但实际操作中经常出现一种情况:某些基因peak信号增加了,表达却没怎么变,甚至有些peak减少基因反而上调。这未必是分析出错。组蛋白修饰往往起“许可”作用,它把染色质调到可以被转录的状态,但最终要不要转录还需要转录因子等其他因素配合。另外,一个基因同时受几十个修饰位点调控,单一修饰的变化不一定能主导表达方向。遇到这种情况,更聪明的策略是先把四象限图右上角那些稳健的基因抓出来做通路富集,看整体趋势是否符合预期,再针对个别基因去IGV里肉眼确认轨迹,而不是拘泥于单个基因必须完全对应上基因表达。

Motif分析是机制层面的点睛之笔。用HOMER对差异乳酸化peak做转录因子结合基序富集,会得到一批显著富集的转录因子候选,常见的可能是SP1、AP-1家族、STAT家族或E2F家族。把这些转录因子对照RNA-seq里的表达变化,就能拼出一条更完整的逻辑链:某个转录因子在疤痕组织里高表达,同时它的结合位点富含乳酸化修饰,下游靶基因被大规模激活。这样文章就从“修饰分布”进阶到了“调控模型”。

3.4 功能实验闭环:从关联到因果的最后一击

组学数据说到底揭示的是相关性,要让审稿人和读者信服“乳酸化驱动疤痕形成”,必须有机制闭合实验。这类文章通常会用Western blot和免疫组化确认疤痕组织里总乳酸化水平以及H3K18la等特定位点的修饰确实升高;然后用CUT&Tag数据挑出最感兴趣的基因,比如COL1A1,在细胞模型里用ChIP-qPCR验证乳酸化抗体确实富集在该基因的启动子区域。这一步看起来简单,实际上是把全基因组水平的结论落回到单个基因层面,完成尺度的切换。

体外功能实验一般会围绕“改变乳酸化水平看表型变化”来设计。乳酸钠处理后,成纤维细胞的增殖和胶原收缩能力会变强;LDHA抑制剂或p300抑制剂处理后,乳酸化回落,胶原基因表达也随之下调,细胞增殖和迁移受到抑制。更严谨一点还会做回复实验,比如乳酸化被抑制后人为补充乳酸,看表型能否部分恢复。体内部分则往往用小鼠皮肤损伤模型,局部给予代谢干预或药物处理,观察疤痕面积、胶原密度和修饰水平的变化。只有这一整套做下来,文章才能稳站在“机制阐明”的高度。

4. 实操视角:复现这套分析,关键细节别错过

4.1 CUT&Tag湿实验的几个关键操作点

做CUT&Tag实验,最心疼的就是组织样本消化这一步。疤痕组织细胞外基质丰富,消化要软硬兼施:常用胶原酶和Dispase组合,在4摄氏度消化过夜,第二天再温和吹打分离细胞。消化时间太短细胞产量低,时间太长细胞活率掉得快,活率低于百分之七八十,后面的Tn5反应信号会明显变差。有条件的话尽量在消化后用Percoll梯度离心或者流式分选把成纤维细胞富集一下,纯度对后续CUT&Tag的信号强度影响非常大。

细胞量方面,CUT&Tag通常在1000到10000个细胞这个区间表现最好,细胞太多了反而可能因为Tn5酶量相对不足导致片段化不彻底,细胞太少则需要增加PCR循环数。PCR循环数务必控制好,我一般从6个循环起摸条件,如果产物量不够再逐步加,加到10到12个循环是上限,再多就会出现明显重复序列,文库复杂度骤降。另外,Tn5反应时间和温度也需要单独优化,37摄氏度反应一小时是常见起点,反应时间过长容易过度打断,时间太短则片段偏大、文库质量下降。

抗体力价这件事我想特别多说一句。不同品牌的乳酸化抗体特异性差异很大,有的多抗对乳酸化和乙酰化存在交叉反应。最好先做一个小型dot blot或者Western预检,再定一个梯度做CUT&Tag预实验,用IgG对照来评估背景。一个靠谱的抗体比任何后续分析技巧都重要,这是我做这个技术一年半以来最深的体会。

4.2 生信流程与工具参数:一条可以直接上手的路径

我自己复现这类分析时有一套固定的流程。比对用bowtie2,惯用参数可以写成bowtie2 --local --very-sensitive -x refgenome -1 R1.fastq.gz -2 R2.fastq.gz,比对结果转成bam后只保留比对质量高于20并且唯一比对的reads,随后标记并去除重复reads。过滤线粒体可以这样处理:先构建一个包含线粒体序列名字的列表,用samtools view -L mt.bed或者直接按染色体名排除chrM。

Peak calling我建议同时跑两套:

# SEACR(需要先转成bedgraph) SEACR_1.3.sh treatment.bedgraph IgG.bedgraph norm stringent # MACS2(BAMPE模式) macs2 callpeak -t treatment.bam -c control.bam -f BAMPE -g hs -n sample -q 0.05 --nomodel --extsize 200

两个结果出来后,可以取交集作为保守peak集,也可以分别做下游再对照。RNA-seq那边就是常规动作:fastp或trim_galore做质控和接头处理,STAR或HISAT2比对,featureCounts定量,DESeq2跑差异表达,显著阈值一般用padj小于0.05且表达变化倍数绝对值大于1。整合阶段用ChIPseeker做注释、clusterProfiler跑富集,可视化和IGV确认很重要,我通常在圈定候选基因后会专门去IGV截图,看看疤痕组和正常组在COL1A1、ACTA2这些位点上的peak轨迹和覆盖深度差异是不是肉眼可见。这种确认很花时间,但能让结论扎实很多。

4.3 出图与展示:怎么把数据讲清楚

数据展示的功夫直接决定文章审稿体验。CUT&Tag最常用的是一张全基因组或某条染色体关键区域的修饰信号热图:以基因TSS为中心,用deepTools的computeMatrix和plotHeatmap绘制两组样本的信号强度分布。修饰信号整齐地集中在转录起始位点附近,说明数据质量很好;如果信号发散、杂乱无章,就要回头检查比对过滤和去重步骤。IGV轨迹图用于展示单个基因位点,可以让读者一眼看到修饰峰在疤痕和正常组织间的存在与强弱差别。

RNA-seq部分的主图通常是一张火山图,横轴是表达变化倍数,纵轴是显著性p值,把符合阈值的关键基因名字标出来。整合部分则用四象限图或维恩图说明修饰与表达的对应关系。组学文章的主图顺序也要讲究,我通常按“现象发现→机制定位→功能验证”来组织,先让读者看到乳酸化与疤痕的关联,再看到修饰的基因组分布规律,最后看到阻断修饰带来的表型逆转,层层递进,逻辑清晰。

5. 常见问题与避坑指南

5.1 CUT&Tag峰少、背景高,最该查哪几个环节

峰少这件事,十次里有八次出在比对后过滤上。线粒体reads没过滤干净,基因组上有效reads只有一小部分,peak数量自然少得可怜。先统计一下bam里比对到chrM的比例,如果占比超过百分之三十,优先把线粒体reads过滤掉再看peak。背景高则要怀疑Tn5反应时间太长或者抗体非特异性结合太强,可以增加IgG对照样本,用背景reads比例评估特异性。还有一个小细节别忽略:样本固定与否会影响实验表现,有些组蛋白修饰抗体对交联状态敏感,如果固定后的结果一直不理想,不妨试试不固定的流程。

5.2 修饰信号变了但表达没变,数据“对不上”怎么处理

这个问题会挡住很多人。我先解释一个常见的误解:CUT&Tag注释时按“最近基因”把peak归给基因,但这只是距离上的最近,不一定是功能上的最近。一个peak落在外显子区域,它可能根本不调控这个外显子所在的基因,而是作为一个远端增强子去影响隔壁几十kb外的靶标。所以第一步是重新确认注释关系,去看peak和基因的相位置,而不是盯着一个基因名死磕。第二步则是放低对单基因的期待,组蛋白修饰更像“整体打开染色质状态”的前置条件,表达最终还要看转录因子等协同因素;如果整体通路层面的富集趋势是符合预期的,就不必纠结个别基因。第三步,如果确实怀疑某个位点的调控关系,就补充3C或Hi-C这类实验去验证染色质互作,而不是在网页工具里硬凑结论。

5.3 审稿人和读者最常追问哪几个问题

做这类文章时要提前想清楚几个必问题。第一个问题一定是抗体特异性:你怎么证明这种乳酸化抗体没有和乙酰化交叉反应。应对手段是提供抗体特异性验证数据,比如多肽竞争实验或者敲除写入酶后的信号变化。第二个问题是从相关性到因果的论证:乳酸化升高是疤痕形成的原因还是伴随结果。这需要功能实验给出遗传或药物层面的阻断证据,而且最好在体内模型里也看到表型逆转。第三个问题是修饰和转录的直接联系:增强子修饰变化如何传递到启动子。可以补充ATAC-seq数据展示染色质可及性的变化,或者用Hi-C把增强子-启动子环的物理连接证据摆出来。能在投稿前把这三个问题想清楚并提前补实验,命中率会高很多。

5.4 这套方法还能往哪些方向扩展

读完这篇文章,我最直接的感受是CUT&Tag加RNA-seq的组合已经成了“修饰-表达”研究的标准范式。顺着这个思路,完全可以做单细胞层面的扩展,比如用单细胞CUT&Tag在疤痕组织里看不同细胞亚群的乳酸化程序差异,再配合单细胞转录组,把成纤维细胞里的异质性彻底拆开。技术层面再往前一步,可以尝试空间组学直接把乳酸化修饰和疤痕组织结构对应起来,在组织切片上看到修饰高低的空间分布。疾病方向更是顺理成章:肺纤维化、肝纤维化、心肌纤维化这些领域都等着类似的机制故事,乳酸化作为代谢信号和表观开关连接点的角色,应该还会有更多文章出现。

最后再分享一个我自己的习惯:分析这类联合组学数据时,别只盯着统计显著性和富集分数,一定要在IGV里一次次打开那些候选基因的轨迹,亲眼看一看修饰峰和转录覆盖在两组样本之间的差异。数据被肉眼确认过之后,你对它的信心是完全不同的。这篇文章能发到Nat Commun,靠的不只是漂亮的技术和丰富的组学数据,更是那种从修飾位点一路追到表型反转的完整性,这套研究思路本身,才是真正值得反复琢磨的地方。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询