代谢组学面临数据难题:这场竞赛能否化解困局?
借助全新数据集,学界期待小分子领域迎来属于自己的「AlphaFold时刻」
#暗代谢组 #质谱 #CASMI #Enveda #小分子识别 #AI生物信息 #串联质谱 #代谢物注释 #AlphaFold #代谢组学
Enveda公司实验室内的首席执行官Viswa Colluru。
植物可生成大量次生代谢物,其中多数尚未被纳入代谢组学参考数据库。研究人员希望新算法能够帮助识别这类化合物。
图片来源:Enveda
在利用质谱(MS)解析生物样本中小分子代谢物的常规实验中,科学家无法确定90%可检测分子的化学结构。质谱技术虽已迭代升级,但这片被称作「暗代谢组」的分子集合依旧令研究人员束手无策。
代谢组学正遭遇数据层面的难题。专注挖掘天然产物生物活性的生物技术企业Enveda,试图通过重启Critical Assessment of Small Molecule Identification (CASMI)竞赛攻克该难题。CASMI借鉴了蛋白质结构预测关键评估竞赛(CASP)的模式,但Enveda表示,希望本次新竞赛的影响力可以跳出质谱‑代谢组学圈子,吸引更广泛的机器学习领域研究者参与。
竞赛目标是开发可依据串联质谱谱图(分子电离后裂解形成的碎片指纹)正确判定分子结构的算法。AI化学语言模型扒拉出数10种既往未知代谢物
Enveda首席执行官Viswa Colluru称:「有望实现规模化解析全球化学物质,其意义基本等同于测序技术对DNA领域带来的变革。」
Enveda首席技术官August Allen表示:「CASMI的灵感来源于CASP。区别在于CASMI尚未迎来属于自己的AlphaFold时刻,而这正是想要促成的局面。」CASP竞赛曾助推DeepMind实现蛋白质结构预测的重大突破。
但CASP参赛者能够依托积累近50年的公开实验数据集,而代谢组学可获取的数据质量参差不齐。获取高质量训练数据至关重要:缺少真实基准信息,算法便无法开展预测。
作为2026年度CASMI赛事的部分,Enveda开放了自有纯化天然产物的串联质谱谱图训练数据集,同时整理标准化了1批开源代谢组学数据集供参赛者训练模型。Allen称,这可以吸引并无深厚代谢组学背景的计算机科学家参与。
为测评参赛模型,Enveda整理构建测试集,谱图全部来自尚未在公开数据集完成表征的分子。
加州大学戴维斯分校计算化学家Oliver Fiehn曾主导往届CASMI赛事。他指出,本次竞赛用于测评的数据集复杂度低于真实代谢组样本。Fiehn谈道:「该测试集并未纳入共流出重叠组分、嵌合谱图、异常加合物等真实场景数据;选用的均为分离纯化化合物的质谱谱图,即便如此,其难度依旧不容小觑。」
Fiehn表示,竞赛早期参与者热情高涨,但他并不期待本次赛事就取得突破性成果。「AlphaFold也是在CASP历经多年迭代才问世。」他补充道,代谢组学领域「真实基准数据有限,可用信息相对匮乏。」
过往针对质谱注释机器学习方法的分析表明,模型很难适配不同实验条件采集的数据,也难以泛化预测训练集之外的分子结构;现有训练数据集对已知代谢物的覆盖广度不足。
Allen在致C&EN的邮件中反驳称,上述痛点恰恰是CASMI竞赛意在解决的问题。
本次竞赛报名截止至12月中旬,设置总奖金50,000美元,将由排名靠前的参赛者共同分得。
Laurel Oldach
Laurel Oldach是C&EN的高级编辑、生命科学方向记者。
详细总结
思维导图
基础信息
核心信息
各方观点
争议部分
参考
Metabolomics has a data problem. Could this competition fix it?
https://cen.acs.org/analytical-chemistry/mass-spectrometry/competition-identify-small-molecules-capture/104/web/2026/09
注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。