FAIR Chemistry 论文全景:OCP 仓库背后的原子模拟机器学习研究体系
2026/9/18 11:52:40 网站建设 项目流程

FAIR Chemistry 论文全景:OCP 仓库背后的原子模拟机器学习研究体系

【免费下载链接】ocpFAIR Chemistry's library of machine learning methods for chemistry项目地址: https://gitcode.com/GitHub_Trending/oc/ocp

本文系统梳理当前仓库所依托的 FAIR Chemistry(Meta)团队研究论文体系,覆盖通用模型与架构、大规模数据集、生成模型、采样与分子动力学、催化与材料发现应用、训练方法以及电子结构预测等主题。结合仓库内 docs/core/uma.md、docs/catalysts/datasets/oc20.md、docs/core/generative_models.md 等文档与 src/fairchem/core/models 下的实现,读者可以按图索骥,把论文中的方法对应到可运行的模型、配置与数据上。

一、论文体系的整体版图

FAIR Chemistry 团队的研究围绕"用机器学习加速原子模拟"展开,覆盖分子、材料与催化剂三大领域。从 docs/core/fair_chemistry_papers.md 可以提炼出八条主线:

  1. 通用模型与架构:UMA、eSEN、EquiformerV2、eSCN 等神经网络结构;
  2. 数据集:OC20、OC22、OC25、OMol25、OMat24、OMC25、ODAC23/25、OCx24、OPoly26 等大规模开源数据;
  3. 生成模型:ADiT、FlowMM、FlowLLM、Crystal-text-llm 等材料/分子生成方法;
  4. 采样与分子动力学:Adjoint Sampling、Adjoint Schrödinger Bridge 等扩散采样方法;
  5. 应用与发现:CatTSunami、AdsorbML、Catlas 等催化应用;
  6. 训练方法与技术:DeNS、JMP、FINETUNA、主动学习、共形预测;
  7. 电子结构与性质:HELM、电子密度衍生性质、XRD 损失景观分析;
  8. 观点与综述:大模型在催化剂发现中的挑战、电催化剂设计入门等。

这些论文与仓库代码高度对应:模型类论文对应 src/fairchem/core/models 下的uma/escaip/allscaip/目录;应用类论文对应 packages/fairchem-applications-AdsorbML、packages/fairchem-applications-cattsunami 等应用包;数据集论文对应 docs/catalysts/datasets、docs/molecules/datasets、docs/inorganic_materials/datasets 下的数据文档。

二、通用模型与架构:从等变 GNN 到通用原子模型

UMA:面向原子的通用模型家族(2025)

UMA(Universal Models for Atoms)是当前仓库中最重要的模型,论文 arXiv:2506.23971。其核心设计为混合线性专家(Mixture of Linear Experts, MoLE):在 5 亿以上结构的训练规模下,模型总参数量达 14 亿,但通过动态路由,每个结构实际只激活约 5000 万参数,兼顾容量与推理速度。

从仓库 docs/core/uma.md 可以看到 UMA 的路由输入需要四类信息:

输入说明
Task指定要模拟的 DFT 理论层级:omoloc20omatodacomc(UMA-1.2 另增oc25oc22
Charge体系总电荷(仅omol任务使用,默认 0)
Spin体系总自旋多重度(仅omol任务使用,默认 1)
Elemental Composition无序的元素总组成;每个元素有原子嵌入,组成嵌入取所有原子嵌入的均值

UMA 训练自 5 个不同 DFT 理论层级的数据集,每个 task 对应一种理论层级嵌入,推理时必须显式指定使用哪一个。仓库中 UMA 的实现位于 src/fairchem/core/models/uma,包含escn_md.py(等变主干)、escn_moe.py(MoE 层)、escn_md_block.pyoutputs.pynn/triton/子模块;预训练 checkpoint 配置见 configs/uma/benchmark/checkpoint 下的uma_sm.yamluma_md.yamluma_lg.yaml等。

各 task 的适用域(依据 docs/core/uma.md 整理):

  • omol(wB97M-V/def2-TZVPD,ORCA6):生物、有机化学、小分子药物、均相催化、聚合物等;需要电荷与自旋多重度,训练数据均为非周期性体系;
  • omc(PBE+D3,VASP):药物包装、生物启发材料、有机电子与 OLED;
  • omat(PBE/PBE+U,VASP):无机材料发现、光伏、合金、超导、电子与光学材料;
  • oc20(RPBE,VASP):可再生能源、催化、燃料电池、化肥生产、塑料合成/升级回收;
  • odac(PBE+D3,VASP):直接空气捕获、碳捕获与封存、CO₂ 转化;
  • oc25(RPBE+D3,VASP 6.4,含偶极校正,仅 UMA-1.2):固液界面电催化;不提供功函数输出;
  • oc22(PBE+U,自旋极化,仅 UMA-1.2):氧化物催化与载体、能量转换与存储。

eSEN:平滑且富有表现力的原子间势(2025)

eSEN(arXiv:2502.12147)通过能量守恒测试,在热导率、声子与材料稳定性预测上取得当时的最优结果。它同时解决了两类问题:平滑性(对结构扰动的连续响应)与表现力(对复杂相互作用的拟合能力)。仓库中对应实现位于 src/fairchem/core/models/escaip(EScAIP.py为入口,配套configs.pycustom_types.pymodules/utils/),训练配置示例见 configs/escaip/training/backbone(如H1024L8.yamlH512L10.yamlH640L10.yaml)。

EquiformerV2:改进的等变 Transformer(2023)

EquiformerV2(arXiv:2306.12059)在力预测上最高提升 9%、能量预测提升 4%,并将吸附能计算所需的 DFT 计算量减少约 2 倍。其核心思路是用更高效的注意力机制取代传统 SO(3) 卷积中的张量积运算。仓库中保留有该模型的快照测试 tests/core/models/snapshots/test_equiformer_v2_deprecated.ambr。

eSCN:将 SO(3) 卷积约简为 SO(2)(2023)

eSCN(arXiv:2302.03655)把等变卷积的复杂度从 O(L⁶) 降至 O(L³),在 OC-20 与 OC-22 上取得当时最优。它的思想是沿 z 轴将 SO(3) 卷积分解为 SO(2) 上的快速运算,大幅降低计算与显存开销。UMA 的等变主干(escn_md.py)正是 eSCN 的扩展形态,相关单元测试可见 tests/core/models/uma/test_escn_md.py。

更多架构论文

  • GemNet-OC(arXiv:2204.02782,2022):面向更大、更多样的分子模拟数据集设计的图神经网络。作者指出新数据集在化学多样性、体系尺寸、数据规模与领域偏移四个维度上与旧数据集显著不同;GemNet-OC 在 OC20 上超越此前最优 16%,同时将训练时间降低 10 倍。
  • Spherical Channel Network(SCN)(arXiv:2206.14331,2022):将原子嵌入表示为球谐函数定义的球面函数,在 Open Catalyst 大规模数据集上取得当时最优结果。
  • ForceNet(arXiv:2103.01436,2021):不施加显式物理约束,而是通过基于物理的数据增强隐式施加,从而在保持计算效率的同时灵活设计高表现力模型;力预测精度超过基于物理约束的 SOTA GNN 且推理更快。
  • Spin Conv(Rotation Invariant GNN)(arXiv:2106.09575,2021):引入逐边局部坐标系与自旋卷积建模原子间角信息,在 OC20 上取得当时最优。
  • Towards Training Billion Parameter GNNs(arXiv:2203.09697,2022):提出 Graph Parallelism 图并行方法,将输入图分布到多张 GPU 上,支持数十亿参数 GNN 的训练;在 OC20 上相对提升 15% 的力 MAE。仓库中 src/fairchem/core/common/parallelism 即对应图并行/张量并行实现,配套测试见 tests/core/common/parallelism/test_graph_parallel.py。

三、数据集:支撑下一代化学 ML 模型的大规模开放数据

四大旗舰数据集卡片

数据集年份规模领域
OMol25(arXiv:2505.08762)20251 亿+ DFT 计算,83 种元素,分子最大 350 原子分子
OMat24(arXiv:2410.12771)20241.1 亿+ DFT 计算无机材料
OMC25(arXiv:2508.02651)20252700 万+ 分子晶体结构(含 DFT 标签)分子晶体
ODAC25(arXiv:2508.03162)20256000 万 DFT 计算MOF 吸附剂发现

更多数据集论文

  • OPoly26(arXiv:2512.23117,2025):含 657 万+ 聚合物团簇 DFT 计算、总计 12 亿+ 原子,覆盖单体组成、聚合度、链构型与溶剂环境的化学多样性。
  • OC25 固液界面数据集(arXiv:2509.17862,2025):7,801,261 个计算、1,511,270 个显式溶剂环境,是目前最大的固液界面数据集,覆盖 88 种元素与常用溶剂/离子。
  • OMol25 细节(docs/molecules/datasets/omol25.md):wB97M-V/def2-TZVPD(ORCA6)层级,含总能量(eV)与力(eV/Å)标签,以 ASE DB 兼容的*.aselmdb格式提供;总电荷与自旋多重度保存在atoms.info字典中(ASE 不支持这两个默认属性)。
  • OMC25(arXiv:2508.02651):2700 万+ 分子晶体结构、12 种元素、单胞最多 300 原子,源自 23 万+ 结构的含色散 DFT 弛豫轨迹。
  • ODAC25(arXiv:2508.03162):近 6000 万次 CO₂/H₂O/N₂/O₂ 在 15,000 个 MOF 中的吸附 DFT 计算,通过官能团化 MOF、GCMC 衍生位点与合成框架引入化学多样性。
  • OMat24(arXiv:2410.12771):1.1 亿+ DFT 计算,聚焦结构与组成多样性;论文报告 EquiformerV2 模型在 Matbench Discovery 上取得 F1 分数超过 0.9 的最优结果。
  • OCx24 实验数据集(arXiv:2411.11783,2024):572 个合成样品、441 个气体扩散电极用于 CO₂RR 与 HER 评估,DFT 验证吸附能覆盖约 2 万种材料,需要 6.85 亿次 AI 加速弛豫。
  • OC22 氧化物数据集(arXiv:2206.08917,2022):62,331 次 DFT 弛豫(约 985 万单点计算),覆盖氧化物材料、覆盖度与吸附质,面向 OER 催化剂开发。与 OC20 的关键差异在于 OC22 使用 DFT 总能量而非吸附能训练(见 docs/catalysts/datasets/oc22.md)。
  • ODAC23(arXiv:2311.00341,2023):3800 万+ 次 DFT 计算,覆盖 8400+ 个含 CO₂/H₂O 吸附的 MOF,面向直接空气捕获。
  • OC20(arXiv:2010.09990,2020):1,281,040 次 DFT 弛豫(约 2.65 亿单点评估),是 Open Catalyst Project 的基石数据集。仓库 docs/catalysts/datasets/oc20.md 给出了完整的下载与预处理方式:IS2* 任务 LMDB 可直接使用;S2EF 训练/验证集需先下载轨迹并用脚本预处理:
python scripts/download_data.py --task is2re python scripts/download_data.py --task s2ef --split SPLIT_SIZE --get-edges --num-workers WORKERS --ref-energy

其中--split可取200k2M20Mallval_idval_ood_adsval_ood_catval_ood_both--get-edges会把边信息写入 LMDB(存储约增加 10 倍、预处理慢 3~5 倍,但训练期显存更省);--ref-energy使用参考能量而非原始能量。仓库中还提供了oc20_data_mapping.pkl(吸附质-催化剂体系到材料属性的映射,含miller_indexadsorption_siteanomaly等字段)与mapping_adslab_slab.pkl(吸附质-催化剂体系到催化剂体系的映射)。

四、生成模型:新分子、新材料的自动生成

四张核心方法卡片

模型年份一句话定位
ADiT(All-atom Diffusion Transformers)(arXiv:2503.03965)2025分子与材料的统一生成模型,共享潜空间
FlowMM(arXiv:2406.04713)2024黎曼流匹配用于材料生成,发现稳定材料效率约 3 倍
FlowLLM(arXiv:2410.23405)2024LLM + 流匹配,稳定材料生成率约 3 倍
Space Group Conditional Flow Matching(arXiv:2509.23822)2025面向空间群与 Wyckoff 位置的对称感知晶体生成

从 docs/core/generative_models.md 可了解各模型的设计动机:

  • ADiT:分子生成与材料生成以往是两个独立任务,ADiT 用基于 Transformer 的潜扩散把两者编码进同一潜空间,获得协同学习收益;
  • FlowLLM:观察到 Crystal-text-llm 生成组成远比生成晶体结构出色,于是采用"LLM 生成待研究组成 + Flow Matching 生成晶体结构"的组合;
  • FlowMM:将黎曼流匹配推广到含平移、旋转、置换与周期性边界条件的晶体;
  • Crystal-text-llm(arXiv:2402.04379,2024):微调后的 LLaMA-2 70B 生成材料被预测为亚稳态的比例约为 CDVAE 的两倍(49% vs 28%),约 90% 的采样结构满足物理约束,说明 LLM 在原子级数据上具有出乎意料的适用性。

更多生成模型论文

  • Fine-Tuned Language Models Generate Stable Inorganic Materials(arXiv:2402.04379):即 Crystal-text-llm 论文,详见上表。
  • FastCSP(arXiv:2508.02641,2025):随机结构生成 + UMA 驱动的弛豫与自由能计算;单个体系可在数十块 GPU 上数小时内出结果,使高通量晶体结构预测(CSP)变得可行。仓库中对应应用包见 packages/fairchem-applications-fastcsp。
  • ADiT 细节:自动编码器把分子与材料映射到共享潜空间,再以扩散生成新嵌入;在 MP20、QM9、GEOM-DRUGS 上取得当时最优,并较等变扩散模型显著加速。

五、采样与分子动力学:面向非归一化密度的扩散采样

  • Adjoint Sampling(arXiv:2504.11713,2025):首个可扩展到大规模问题的 on-policy 扩散采样算法,允许梯度更新次数显著多于能量评估次数;可用于跨多个分子体系的摊销构象生成。
  • Adjoint Schrödinger Bridge Sampler(ASBS)(arXiv:2506.22565,2025):基于 Schrödinger Bridge 的动力学最优输运,训练时无需目标样本,可泛化到任意源分布,用于分子玻尔兹曼分布采样。
  • Enhancing Diffusion Sampling with Collective Variables(arXiv:2510.11923,2025):沿集体变量施加序列偏置以改进模式发现并估计自由能,首次用扩散采样器完成反应性采样,配合通用原子间势捕捉断键与成键过程。

这些方法与仓库中的动力学与采样组件相关,例如 src/fairchem/core/components/dynamics、src/fairchem/core/modules/transforms.py,以及 LAMMPS 接口 src/fairchem/lammps。

六、应用与发现:催化剂与材料的加速发现

应用年份核心结论
CatTSunami(arXiv:2405.02078)2024反应网络枚举加速约 1500 倍
AdsorbML(arXiv:2211.16486)2022吸附能计算加速约 2000 倍、准确率 87%
Catlas(arXiv:2208.12717)2022合成气转化的高通量筛选自动化框架
GA-Accelerated LCP Discovery(arXiv:2505.13477)2025遗传算法 + 第一性原理用于 VR/AR 材料
  • CatTSunami 细节:基于 OC20 训练的 GNN 势 91% 的情况下在 0.1 eV 内找到 DFT 过渡态,加速 28 倍;以 12 GPU 天复现含 61 个中间体、174 个反应的 DFT 分辨率反应网络(对比 52 GPU 年),即 1500 倍加速。仓库对应包 packages/fairchem-applications-cattsunami,教程见 docs/catalysts/examples_tutorials/cattsunami_tutorial.md。
  • AdsorbML 细节:ML 势以 87.36% 的准确率识别低能吸附质-表面构型,同时实现约 2000 倍加速;论文同时发布 Open Catalyst Dense 数据集(约 1000 个表面、10 万构型,见 docs/catalysts/datasets/oc20dense.md)。仓库对应包 packages/fairchem-applications-AdsorbML,教程见 docs/catalysts/examples_tutorials/adsorbml_walkthrough.md。
  • Catlas 细节:无需前期训练,直接用预训练 ML 模型探索大规模设计空间;对合成气制含氧化合物转化,探索了 947 种二元金属间化合物,识别出 144 个候选材料,包括 Pt-Ti、Pd-V、Ni-Nb、Ti-Zn。
  • LCP 细节:将第一性原理计算与遗传算法结合,发现低可见光吸收、高折射率的液晶聚合物,用于 VR/AR/MR 技术。
  • Adapting OC20-trained EquiformerV2 for High-Entropy Materials(arXiv:2403.09811,2024):通过能量过滤与少样本微调,EquiformerV2 在高熵合金(Ag-Ir-Pd-Pt-Ru)上取得当时最优精度,证明有序结构上的基础知识可外推到无序固溶体。

七、训练方法与技术:预训练、去噪与主动学习

  • DeNS(Generalizing Denoising to Non-Equilibrium Structures)(arXiv:2403.09549,2024):将非平衡结构去噪作为辅助训练任务,用编码后的力指明正在去噪的结构,在 OC20 与 OC22 上取得新最优,同时在 MD17 上显著提升训练效率。
  • JMP(Joint Multi-domain Pre-training)(arXiv:2310.16802,2023):在 OC20、OC22、ANI-1x、Transition-1x 等约 1.2 亿体系上以多任务框架联合预训练,相对从零训练平均提升 59%,40 个任务中 34 个达到或追平 SOTA。
  • FINETUNA(Fine-tuning Accelerated Simulations)(arXiv:2205.01223,2022):在线主动学习框架,融合预训练模型先验,将 DFT 计算量减少 91%,同时 93% 的情况满足精度阈值。
  • Generalization of Graph-Based Active Learning Relaxation(arXiv:2311.01987,2023):研究 FINETUNA 在域外体系(更大吸附质、自旋极化金属氧化物、沸石与 MOF 等三维结构)上的表现,将 DFT 计算量减少 80%(醇类/三维结构)与 42%(氧化物)。
  • Conformal Prediction 不确定性估计(arXiv:2208.08337,2022):将共形预测与潜空间距离结合,估计神经力场的不确定性,校准良好、尖锐且可扩展到百万级训练数据。
  • Robust Offline Active Learning(arXiv:2008.10773,2020):Δ-机器学习方法通过规避非物理构型实现稳定的离线主动学习收敛,将第一性原理计算减少 70~90%。

这些训练方法在仓库中均有落地:微调数据准备脚本见 src/fairchem/core/scripts/create_finetune_dataset.py 与 src/fairchem/core/scripts/create_uma_finetune_dataset.py,微调配置模板见 configs/uma/finetune/uma_sm_finetune_template.yaml,训练/微调流程说明见 docs/core/common_tasks/fine_tuning.md。

八、电子结构与性质:超越能量与力的预测

  • HELM(Hamiltonian-trained Electronic-structure Learning)(arXiv:2510.00224,2025):面向周期表 58 种元素、100+ 原子结构与大型基组的哈密顿量预测模型,随论文发布 'OMol_CSH_58k' 数据集;"哈密顿量预训练"在低数据场景下可改善能量预测。
  • Chemical Properties from GNN-Predicted Electron Densities(arXiv:2309.04811,2023):无需训练预测电荷,仅从模型预测的电子密度出发,用成熟物理方法推导化学性质,原子电荷误差比原子密度叠加法低一个数量级。
  • XRD Loss Landscape Analysis(arXiv:2512.04036,2025):研究粉末 XRD 到结构的映射,常用 XRD 相似度指标导致高度非凸的损失景观;将优化约束到真实晶体族可显著改善结构恢复。
  • Physically-informed Graph-based Order Parameter(arXiv:2106.08215,2021):通用、可迁移的图基序参数用于表征原子结构,在高达 300 GPa 的液态锂、含纳米管的碳相与多种铝构型上验证,优于既有晶体序参数。

九、观点与综述论文

  • Open Challenges in Developing Large Scale ML Models for Catalyst Discovery(arXiv:2206.02005,2022):总结 OC20 开发中的挑战与发现,涵盖能量守恒、局部极小值寻找与离平衡数据增强。
  • An Introduction to Electrocatalyst Design using Machine Learning(arXiv:2010.09435,2020):面向可再生能源存储的电催化剂发现挑战、ML 应用方式与 OC20 数据集使用入门。
  • Computational Catalyst Discovery: Active Classification(arXiv:2102.01528,2021):提出 myopic multiscale sampling,将多尺度建模与自动化 DFT 选择结合,催化剂分类相对随机采样加速约 7~16 倍。

十、如何从论文走向仓库实践

读论文的同时,可以直接在仓库中找到对应实现与配置:

  1. 模型:src/fairchem/core/models/uma(UMA 系列)、src/fairchem/core/models/escaip(eSEN)、src/fairchem/core/models/allscaip(统一化学势/全 scaip 模型);
  2. 预训练权重配置:configs/uma/benchmark/checkpoint、configs/uma/evaluate/checkpoint;
  3. 数据集详情与下载:docs/catalysts/datasets(OC20/OC22/OC25/OCx24 等)、docs/molecules/datasets(OMol25/OMC25 等)、docs/inorganic_materials/datasets(OMat24);
  4. 应用包:packages/fairchem-applications-AdsorbML、packages/fairchem-applications-cattsunami、packages/fairchem-applications-fastcsp、packages/fairchem-applications-ocx;
  5. ASE 计算器与推理:src/fairchem/core/calculate/ase_calculator.py、src/fairchem/core/calculate/pretrained_mlip.py 及 docs/core/common_tasks/ase_calculator.md;
  6. 测试验证:UMA 测试见 tests/core/models/uma,eSEN 测试见 tests/core/models/escaip,MLIP 单元测试见 tests/core/units/mlip_unit。

上述论文共同构成了当前仓库的技术底座:从 OC20 等基础数据集出发,经过 eSCN/EquiformerV2/eSEN 等架构演进,到 UMA 实现跨域通用的单模型能力,再到生成模型、采样方法与主动学习等外围工具,形成了一套从数据、训练到推理的完整研究-工程闭环。读者在阅读论文时,建议始终以仓库中的 docs 目录、configs配置与tests测试为对照,从而把学术方法快速映射为可运行的实践。

【免费下载链接】ocpFAIR Chemistry's library of machine learning methods for chemistry项目地址: https://gitcode.com/GitHub_Trending/oc/ocp

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询