做药物研发早期靶点验证的同行,应该都体会过这种拧巴:手里握着一个理论上很有潜力的候选基因,但要证明它真实参与疾病通路,首先得过蛋白表达这一关。过去我大概率要先克隆、转染、诱导、纯化,整套流程一两周起步,遇到毒性蛋白还得反复改载体;后来开始用无细胞蛋白表达技术(cell-free protein synthesis,CFPS)做靶点验证,节奏完全变了。这篇文章以nuclera这类集成式无细胞蛋白表达平台为例子,聊聊它在靶点验证里怎么落地,以及从产量、活性到稳定性几个维度怎么优化。内容偏实操,会尽量把背后原理和参数选择逻辑讲清楚。
1. 为什么靶点验证要把实验搬到细胞外
1.1 传统细胞表达路线的三个高墙
靶点验证的核心问题,是先拿到“足够接近生理状态”的目标蛋白。很多人觉得选一个商业化表达系统,按照说明书诱导就完事了,但实际操作中,传统活细胞表达路线至少有三堵墙绕不过去。
第一堵是时间。从接到序列到拿到纯化蛋白,克隆到表达载体需要1天,转化和测序1天,诱导表达1天,裂解和纯化保底2天,乐观估计也要一周。如果要设置多个突变体对照,比如验证某个磷酸化位点是否影响活性,工作量直接乘以突变体数量。做靶点验证的人常处于一种“需要快速推翻自己假设”的状态,等一个纯化结果等两周,实验节奏会很被动。
第二堵是毒性。很多真核靶点蛋白,比如激酶结构域、转录因子、膜蛋白,在原核细胞里高表达就会杀死宿主。我碰到过一个激酶,挑菌后平板长得很好,但一诱导就停止生长,最后只能降低IPTG浓度,用16℃过夜表达勉强拿到一点点,纯度还不行。这种情况下,问题不在于表达系统选得不对,而在于活细胞本身会对蛋白表达产生应激反应,这是细胞系统的天然约束。
第三堵是体内调控带来的偏差。活细胞不会让你舒舒服服地“想要什么蛋白就堆什么蛋白”,它会降解错误折叠的产物,会限制能量分配,会把外源蛋白拖进包涵体。这导致你最终拿到的蛋白,可能和你想验证的靶点状态其实并不一致。举个例子,我在验证一个转录因子时,细胞表达得到的蛋白总是部分降解,后来才发现是蛋白内部有一个强的蛋白酶敏感位点。这类问题在细胞里很难精准控制,因为细胞会自主优化蛋白稳态,不按照你的实验目的来。
1.2 无细胞系统是怎么绕开这些墙的
无细胞蛋白表达的思路很直接:把细胞裂解,保留里面的转录翻译机器(核糖体、tRNA、聚合酶、伴侣蛋白等),然后你直接在试管里加入DNA模板、氨基酸、能量物质,让它体外合成目标蛋白。这里的关键不是“没有细胞”,而是“不再需要维持生命活动”。
没有细胞壁和代谢网络,意味着你不用考虑蛋白对宿主的毒性和生长抑制。许多在活细胞里致死或者难以高表达的蛋白,在无细胞体系里反而能顺利合成,因为体系里没有完整细胞去“感受”压力。没有细胞膜周转和蛋白酶体调控,产物可以直接暴露在环境中,便于你添加去垢剂、辅因子、分子伴侣,甚至脂质体来模拟膜环境。没有复杂的转染建株过程,PCR扩增出的线性DNA就能作为模板,省掉分子克隆这一步。
时间上的优势更明显。常规CFPS反应普遍在2到6个小时内完成表达,一个96孔的平行实验可以同时处理几十个靶点变体,第二天就能做活性初筛。对于靶点验证这种需要反复试错、快速迭代的场景,这个特点几乎是决定性的。
做个粗浅类比:传统表达像是去餐厅点菜,后厨要备料、炒菜、上桌,中间有任何一步出问题你就得重新排队;无细胞表达像是把调料和锅都放在眼前,你只管调配方、定火候,几分钟后就能尝到成品的味道。
1.3 nuclera这类平台在靶点验证中的定位
需要先澄清一个容易混淆的点:nuclera这类平台并不只是一个“卖了试剂盒让你自己做反应”的工具,而是一套把DNA模板构建、无细胞表达、转移取样整合到一块的工作站。
它的典型流程是这样的:你把目标基因的序列输入软件,平台上的芯片合成模块先直接合成线性DNA片段,然后自动转移到无细胞表达模块,配置好反应液后平行表达,最后把产物导向下游检测孔位。这个流程覆盖了“序列到靶点候选蛋白”的完整通路,而不是像传统方法一样,你在多个仪器和手工操作之间来回切换。
它适合的场景,比较典型是早期靶点验证团队:需要几天内同时评估多个靶点突变体的可表达性、可溶性、活性和互作能力,但暂时不想投入大规模真核表达和蛋白纯化的人力。也能给晶体学、抗体制备、生化筛选这些下游提供前置筛选数据。换句话说,它像是一个“蛋白快速原型平台”,用于在投入重资源之前,把候选靶点矩阵收敛到少数几个真正值得做的事。
2. 平台设计的底层逻辑与建系统前的硬性判断
2.1 裂解物来源的选择逻辑
无细胞系统的“引擎”是裂解物,选择哪种裂解物,几乎决定了你的蛋白产量、折叠质量和可修饰性。市面上常见的有几类。
大肠杆菌S30提取物是目前用得最广的,产量高、成本低、操作成熟,适合表达原核蛋白、激酶结构域、可溶性重链抗体片段等。它的翻译速度很快,但偏向原核的折叠环境,对复杂多结构域真核蛋白的支撑偏弱。兔网织红细胞裂解物和麦胚提取物属于真核系统,提供更接近哺乳动物的分子环境,更容易帮助含二硫键和复杂折叠的蛋白获得活性构象,但产量通常不如大肠杆菌系统。人源细胞裂解物更先进,能提供一定程度的翻译后修饰,适合最接近生理环境的表达,但成本和制备门槛都高。
选型逻辑很简单:看靶点蛋白的复杂性,再权衡产量和真实性。我通常的建议是,如果验证的是激酶、磷酸酶、酶活性等主要依赖催化核心的蛋白,用大肠杆菌系统效率最高;如果是膜蛋白、转录因子复合物、泛素化通路相关蛋白,建议优先考虑真核或无细胞人源系统。这不是说大肠杆菌系统一定不行,而是避免在一开始就陷入“表达出来了但没有活性”的尴尬。
有些平台会提供模块化裂解物选项,比如nuclera可以在同一个工作流里切换不同表达环境,这是它做靶点验证很占便宜的地方——你可以在同一批模板上跑两套系统,快速对比哪一种产物状态更符合预期的活性数据。
2.2 反应体系的基础组分与能量平衡
无细胞反应体系看起来就是一管“汤”,但里面每个组分都有明确的职责。基础配方大致包括裂解物、DNA模板、氨基酸、核苷三磷酸(NTP)、能量再生系统、镁离子、缓冲液。
能量再生系统是里面最容易被人忽略、也最容易翻车的环节。核糖体每合成一个肽键都要消耗两分子GTP,而转录消耗高能磷酸键,体系必须在数小时内持续供给能量。常用方案是磷酸肌酸/肌酸激酶,或者磷酸烯醇式丙酮酸(PEP)系统。回头复盘过我遇到过的产量偏低案例,多半是能量系统提前耗竭,表现为反应前两小时产物逐渐增加,之后完全停止。解决办法通常是提高能量底物浓度,或换成持续供给型能源系统。
镁离子浓度则是一个更微妙的变量。镁是维持核糖体大小亚基结合所必需,也参与聚合酶的催化活性。浓度低了,翻译起始效率上不去;高了,又容易导致核酸沉淀或聚合反应偏移。在常见的E. coli S30体系里,醋酸镁的最优浓度通常在10到20 mM区间,但精确值会随着模板结构和裂解物批次漂移。做参数优化时,镁离子浓度扫描应该是你早期必做的项目之一。
氨基酸的配置也有讲究。20种标准氨基酸都要齐,且最好有适当冗余,因为表达量高了以后,某个稀有氨基酸耗竭会成为瓶颈。大肠杆菌系统对亮氨酸、精氨酸这些密码子的偏好会影响翻译延伸速度,必要时可以针对序列做稀有密码子分析,提前补充对应氨基酸。
2.3 DNA模板的样式选择与用量
无细胞表达的一个独特点在于,它不像活细胞那样必须先建立稳定的质粒株系,线性PCR产物就可以直接作为模板。这为靶点验证省掉了大量克隆工作。但线性模板有个天然软肋:会被体系里的核酸外切酶降解,导致产量随时间衰减。
解决思路一般有几个方向。一是给模板两端加上稳定结构,比如T7终止子序列,或者特殊的发夹结构;二是在反应体系里补充核酸酶抑制剂;三是使用平台自动合成的线性DNA,这类产物通常设计好了末端修饰,抗降解能力比手搓PCR产物好很多。此外,质粒模板依然在需要高产量或长期保存模板的场景里不可替代,只是它在平行筛选中的成本和时间不划算。
模板用量也不是越多越好。很多第一次用无细胞系统的人会不自觉把DNA浓度往上加,结果产量不但没升高,反而剧烈下降。原因在于,翻译起始阶段核糖体数量是有限的,如果转录出来的mRNA过量而核糖体不够,大量mRNA会被RNase降解或被翻译机器浪费。常见的最适模板量在0.1到0.5 μg/50 μL反应之间,具体数值可以用一个两倍梯度实验快速扫出来。参考这个小操作能省不少试剂。
2.4 优化到底在优化什么
很多人第一次接触无细胞蛋白表达,以为“优化”就是机械地把产量调高。实际做下来你会发现,优化是产量、完整性、活性、均一性几个指标之间的平衡。对一个靶点蛋白有效的最优条件,换一个蛋白可能完全失效。
比如温度。同一个激酶蛋白,在37℃下表达量也许很高,但可能因为折叠过快导致形成包涵体;在25℃下,产量虽然打折,但可溶性蛋白比例反而更大,酶活也更好。这个规律很像做菜的火候:大火炒得快但容易糊,小火慢炖肉才透。靶点验证真正需要的不是最大产量,而是“够用且具备生理活性”的蛋白样本。
再比如体系的氧化还原环境。表达含有二硫键的蛋白时,必须在反应体系里添加氧化型谷胱甘肽(GSSG)和还原型谷胱甘肽(GSH)的缓冲配对,模拟内质网的氧化折叠环境。缺少这一步,产物可能量很大但全部以错误折叠状态存在。这种细微之处,是通用说明书不会告诉你的。
所以我的判断标准一直是:优化成功不是看考马斯亮蓝染色条带有多深,而是看你的下游检测信号是否特异、可重复,并且和已知的阳性对照一致。
3. 靶点验证中的实操路线与关键参数
3.1 从序列到表达模板的标准化动作
实操层面,我习惯把流程整理成一套固定的标准动作。拿到某个候选靶点后,第一步不是立刻合成基因,而是先花十几分钟把序列“修理”到适合无细胞表达的状态。
首先是启动子和表达元件的设计。T7启动子是CFPS最常用的转录启动序列,反应体系中需要额外补充T7 RNA聚合酶。设计线性模板时,结构顺序一般是T7启动子、5UTR、翻译起始元件(比如大肠杆菌系统的Shine-Dalgarno序列)、目标蛋白编码序列、标签序列、T7终止子。中间哪一个元件缺失或顺序不对,都会直接影响表达效率。我当时踩过最无语的坑是,模板上少了一段5UTR,导致mRNA直接不被有效翻译,Western blot完全没信号。
其次是标签选择。靶点验证阶段常用的标签组合是N端His标签加上C端Strep标签,前者用于金属螯合纯化和Western blot检测,后者提供温和的亲和纯化手段。两条标签同时存在还有一个好处:可以用双标签夹心法判断产物的全长完整性,如果C端标签信号弱于N端标签,说明发生了C端降解。这个细节对评估靶点稳定性很有用。
最后是密码子检查。如果目标基因来自人源,而你使用的是大肠杆菌无细胞系统,应优先检查稀有密码子密集区域。遇上连续多个AGG/AGA、CCC等低频密码子时,翻译延伸会停滞甚至提前终止。现代基因合成服务普遍会把序列优化成宿主偏好密码子,但你在手工设计PCR模板时不要跳过这一步。
3.2 表达条件扫描的标准做法
条件扫描的核心是“先平铺,后逐点收窄”。我通常会用一块96孔板做三组变量:温度、时间、镁离子浓度。
温度梯度设25℃/30℃/37℃,反应时间设2小时/4小时/6小时,镁离子浓度设12/16/20 mM。每个条件做三到四个重复。反应结束后每个孔取少量样品跑SDS-PAGE,配合Western blot和可溶性分析。这个矩阵跑下来,基本就能锁定合适的条件区间。
如果目标蛋白定位为膜蛋白,或者预测有跨膜螺旋,在条件扫描里还应加一个变量:去垢剂类型和浓度。常用的有Brij-98,Triton X-100,DDM等。去垢剂的作用是给疏水区域提供一个模拟膜环境,防止新合成的膜蛋白在水相里立刻聚沉。我见过一类G蛋白偶联受体的胞外结构域,不加去垢剂时表达产物呈现高比例沉淀,加了0.1%的DDM后,可溶性比例显著上升,下游配体结合实验才顺利跑通。
扫描结束后,不要只关注总表达量,建议把样品分两部分,一部分全细胞总蛋白,一部分离心后的上清,分别比较。可溶性蛋白的比例,往往比总产量更影响后续靶点验证的成功率。
3.3 下游活性检测接口怎么设计
无细胞表达产物常常可以直接进入下游检测,不需要纯化。这一点对靶点验证非常有用,因为它把“表达”和“功能”测试之间的人工步骤压缩掉了。
如果做蛋白-蛋白相互作用验证,典型的做法是把表达产物离心澄清后取上清,直接做pull-down。用融合标签把目标蛋白固定在磁珠上,然后加入候选互作蛋白或细胞裂解液,孵育后洗脱,跑胶或做质谱鉴定。需要注意,无细胞裂解物本身背景蛋白很杂,必须设置无模板反应的阴性对照孔,否则分不清是特异结合还是裂解物自带背景。
如果验证酶活性,比如激酶,一般用ADP-Glo这类均相检测方法。把激酶反应直接在无细胞产物上清里进行,不纯化,加入底物和ATP后反应,然后检测ADP生成量。这里有一个容易忽略的问题:无细胞体系本身含有内源激酶和ATP酶活性,会造成高背景。解决方案是同时跑一个“无模板阴性对照”和“已知抑制剂抑制对照”,用净信号评估目标激酶活性。
如果目标蛋白是治疗性靶点,还想看小分子结合能力,推荐微量热泳动MST或差示扫描荧光DSF。这两种方法都可以用粗表达产物做,不需要高纯度。DSF尤其适合做靶点稳定性扫描,通过熔解温度变化判断有没有配体结合。不过这一类检测对体系内杂质浓度敏感,条件允许的话,简单纯化一下结果会更干净。
3.4 平行表达一个靶点家族的实际收益
举一个比较典型的案例。一个激酶家族有8个成员,都含有相似的催化结构域,但底物偏好和调控机制差异很大。传统做法是对每个成员逐一克隆、表达、纯化,算上失败重试,两到三个月跑完算顺利。用无细胞平台做这件事,流程被压缩成三步:把8条序列设计成线性模板送合成,同时在96孔板上表达,48小时之内拿到全部成员的总蛋白表达量和可溶性数据。
这只是起点。基于这些表达量数据,团队可以马上把后续的抑制剂选择性筛查材料分装给下游,把互作蛋白筛选也并行启动。整个过程省掉的是大量重复的克隆、转化和诱导表达的时间。更重要的是,一旦某个成员的蛋白表达量不稳定,你可以当天重新设计模板,第二天再表达一轮,而不是被传统体系的一个月周期卡住。
这个场景的核心价值,不是把单个蛋白表达做得更好,而是把“批次内一致性”做出来。靶点家族之间的横向比较,如果靠不同批次、不同纯化批次拼凑出来,实验结论的质量会大打折扣。
4. 常见问题与排查实录
4.1 问题速查表
做久了之后,我整理出一套自己的问题排查表格,遇到翻车基本先对照它定位,省掉很多重复劳动。
| 现象 | 可能原因 | 处理建议 |
|---|---|---|
| 完全没有目标条带 | T7聚合酶缺失或模板无T7启动子 | 确认体系补加了T7 RNA聚合酶;检查模板结构 |
| 表达量极低但阳性对照正常 | DNA模板量过高导致转录-翻译失衡 | 做2倍梯度稀释模板,找到平台区 |
| 表达量高但全部在沉淀里 | 缺少二硫键氧化折叠环境或去垢剂 | 添加GSH/GSSG氧化还原缓冲液;膜蛋白加DDM |
| 表达的蛋白大小不对或不均一 | 目标蛋白容易被蛋白酶降解 | 加蛋白酶抑制剂;降低反应温度到25℃;缩短时间 |
| 背景信号过高 | 裂解物自身含有活性干扰物 | 设置无模板对照;做免疫清除或小分子抑制剂对照 |
| 批次间产量波动大 | 裂解物批次差异或能源配置不准 | 记录批次号,尽量同一批次完成平行实验;核对能量系统 |
这条表格是我压箱底的东西。对无细胞表达没经验的人,看到“表达量低”容易扎进模板优化里,其实很多问题出在体系组分的平衡上。
4.2 一个转录因子从包涵体到可溶的排查过程
有一个做转录因子靶点验证的项目让我印象很深。目标蛋白在活细胞系统里无论如何都是包涵体,我决定换无细胞系统试试。第一轮,37℃表达4小时,目标蛋白确实出现了,但离心后上清里几乎看不到,说明还是以不溶形式存在。
当时我没有急着加去垢剂,而是先跑了一个温度梯度。把条件降到室温,并把反应时间从4小时延长到6小时,上清里的可溶蛋白比例明显提高。进一步排查后,发现这个蛋白的活性依赖锌离子,于是我在反应体系里补加了适量ZnCl2。加完之后,不仅可溶性进一步改善,后续的电泳迁移率实验(EMSA)里能看到明确的DNA结合迁移带。这说明,锌离子的螯合状态与结构稳定性直接相关。整个过程从发现问题到拿到有活性的蛋白,只用了三天。
这里面最关键的一条经验是:物理解释优先。先做温度和时间梯度,让折叠动力学慢下来,再考虑添加功能性金属辅因子。很多蛋白在无细胞系统里不溶,不是因为系统不支持折叠,而是合成速度太快,折叠跟不上了。
4.3 高背景信号的排除逻辑
靶点验证最怕的不是没信号,而是有信号但分不清真假。有一次做互作实验,候选靶蛋白和一个已知伴侣对照都能拉下某个标记蛋白,细看发现无模板空白对照也能拉下来,说明裂解物里本身就有能结合标记蛋白的组分。
这个问题的排查逻辑是:先确认空白对照的背景水平,再把候选蛋白的Bait固定在磁珠上,用更高严谨度的洗涤条件(提高盐浓度和去垢剂浓度)洗去非特异结合。如果背景依然压不下去,就要考虑换一个更特异的检测接口,比如把pull-down换成与SPR/BLI类似的实时结合分析。让靶蛋白固定在传感器表面,候选蛋白流过表面,结合和解离曲线会告诉你真实的亲和力,而不是靠一次pull-down的条带深浅下结论。
无细胞表达产物的背景问题不是无解的,但要求你从一开始就设计好对照组。没有对照的表达产物数据,尽量不要拿去支撑靶点验证结论。
5. 容易被忽略的实操细节与长期维护建议
5.1 裂解物的分装与批次管理
裂解物是整个反应体系里最贵、最敏感的原料。它本质上是细胞破碎后的复杂混合物,里面含有大量活性酶和辅因子,反复冻融会直接导致无细胞翻译活性陡降。我的习惯是拿到一支商品化裂解物后,先分装成25 μL或50 μL的小份,-80℃保存。用的时候取出一管,一次性用完,绝不把剩余的部分重新冻回去。
批次管理是另一个容易被忽略的点。不同批次的裂解物,即使来自同一家供应商,基础表达活性也可能差30%以上。做靶点验证时,如果必须在多天完成一批平行实验,建议把同一次实验需要的所有裂解物提前算好总量,使用同一个批次。相关批次号、反应日期、模板批号都要记录在实验笔记里。等出了问题回查的时候,这些信息能帮你快速定位究竟是模板、体系还是裂解物批次的问题。
5.2 产物收获后处理与保存
无细胞反应结束后,不是一个跑胶验证就完事了。产物里的能量系统会持续消耗,残余的蛋白酶和核酸酶也会继续工作,如果不及时终止,即使放4℃也会有缓慢的质量下降。常规做法是反应结束后马上把孔板放在冰上,然后根据下游需求统一处理。
短期保存,4℃放几个小时做活性检测一般没问题,但超过过夜就不好说了。更稳妥的方法是加入嘌呤霉素抑制翻译延伸,或者离心去除裂解物碎片后,把含有目标蛋白的上清加20%甘油后,在-80℃冻存。需要注意的是,不同蛋白对冻融的耐受性差异巨大,有些激酶冻一次活性损失超过一半,有些却很稳。最好在进入大规模保存之前,对重点靶点做一次“冻融前vs冻融后酶活对比”。这个数据以后会非常有用。
5.3 成本控制与自动化整合的经验
无细胞表达单次反应看似便宜,但如果做整板全因子扫描,试剂消耗会快速累积。我的经验是,先做一个小规模的1到2个因子的预实验,确定平台期和最适条件,再放开来跑大矩阵。不要一上来就让所有条件矩阵同时跑。另外,可以在不影响数据质量的前提下,把标准反应体积从50 μL缩小到25 μL甚至10 μL。表达量检测用灵敏度更好的荧光标记抗体或者基于活性的发光检测,小体积完全够用。
如果你所在团队有液体处理工作站,建议把无细胞反应板的配制流程转移到自动化平台。反应体系的分液精度对产量影响不小,自动化操作能把孔间差异降下来,平行比较的数据会更可信。我见过手工加样引起的边缘孔产量偏高问题,用自动化后这个问题基本消失了。
5.4 表达平台与下游工作流的衔接
无细胞表达平台用顺之后,最好不要只把它当作一个“快速表达工具”,而是要在整个靶点验证工作流里给它一个清晰的衔接位置。序列设计、模板合成、无细胞反应、初步生化检测、候选确认后的规模化真核表达,这些环节应该融为一体。
我的做法是,定义“前端快筛-后端深度验证”的两段式流程。前端用无细胞表达快速过滤掉表达困难或活性异常的靶点,后端只对通过前筛的少数靶点投入稳定的细胞表达或大规模纯化。这样可以显著减少后端资源占用。团队里只需要一个人负责前端平台的操作,后端纯化团队就可以集中精力服务更成熟的靶点项目。
另外,无细胞平台积累的数据本身就是资产。把每批靶点的表达量、可溶性比例、活性检测结果、模板序列和反应条件存成结构化数据,下一次拿到新靶点的时候,可以直接依据历史规律做条件推荐,而不是每次从头扫描。
6. 一点个人体会
用这类系统做了几年靶点验证,我最明显的感受是心态变了。以前拿到一个蛋白后,第一反应是“终于有材料可以做实验了”,会省着用;现在则是“这周内可以再验证两个突变体,直接把假设迭代一轮”。无细胞蛋白表达技术把靶点验证前期的不确定性大大压缩了。它当然不是万能的,产物质量不代表最终的生理真实性,很多结论最后仍然要回到细胞和动物模型里去确证。但对早期靶点验证而言,能以小时为单位拿到候选蛋白、快速做一轮功能数据,这个能力实在太重要了。