☰
Science Skills药物化学技能集:ChEMBL、PubChem与openFDA如何驱动AI智能体完成药物研发数据查询
2026/9/30 16:44:29 网站建设 项目流程

Science Skills药物化学技能集:ChEMBL、PubChem与openFDA如何驱动AI智能体完成药物研发数据查询

【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills

Science Skills是谷歌 DeepMind 开源的科学智能体技能集,其中ChEMBL、PubChem、openFDA三大药物化学技能可以让 AI 智能体直接完成分子结构检索、生物活性数据(IC50/Ki)查询、化学品安全信息获取和 FDA 不良反应统计等药物研发数据查询任务——你只需要用自然语言提问,无需自己写 API 调用代码。

🧰 一套技能集,覆盖三大数据库

做药物研发数据查询的传统方式,是分别对接多个数据库的 API、处理鉴权、限流和 JSON 解析。Science Skills 把这些工作封装成了"技能(Skill)":每个技能目录都包含三类文件,智能体读取指令后就能按最佳实践操作 📦

  • SKILL.md—— 给 AI 智能体的操作指令(含前置条件和核心规则)
  • scripts/—— 封装好的查询脚本(自动处理限流、重试、输出落盘)
  • references/—— API 参考、查询配方等文档
技能数据源一句话定位你可以问智能体的问题
chembl_databaseChEMBL(EMBL-EBI)药物靶点与生物活性数据的"源头""EGFR 靶点的 IC50 数据有哪些?"
pubchem_databasePubChem(NCBI)化学物质的"完整档案卡""伊布uprofen的分子量、logP 和 GHS 危害声明?"
openfda_databaseopenFDA(美国 FDA)上市后药物安全数据的"账本""二甲双胍报告的不良反应 Top10 是什么?"

💡 项目整体结构说明见 README.md,它还集成了 UniProt、AlphaGenome 等 30+ 其他数据库与工具。

🎯 ChEMBL 技能:药物靶点与生物活性数据一步查

ChEMBL 是全球最大的生物活性小分子数据库之一,这个技能通过单一入口脚本 scripts/chembl_api.py 提供 9 大类查询能力。

分子、靶点、活性三大核心入口

  • 分子查询:按 ChEMBL ID、名称(如 "aspirin")搜索,或直接按分子量等属性过滤
  • 靶点查询:按名称搜索蛋白靶点(如 "EGFR"),支持批量 ID 拉取
  • 活性数据:查询 IC50、Ki、EC50 等生物活性记录;--normalize参数可把不同单位(nM/µM/pM)统一换算为 nM,方便跨研究比较

结构相似性搜索与 2D 结构图

  • 相似性搜索:给出一个 SMILES 字符串和相似度阈值(0-100),直接在服务端完成检索,无需本地安装 RDKit
  • 子结构搜索:查找包含指定子结构(如苯环c1ccccc1)的所有分子
  • 结构图下载:image子命令可下载 2D 结构图(SVG 矢量格式,适合论文出版)

跨库交叉引用

ChEMBL 技能可与 UniProt、PubChem 等互相打通:例如用 UniProt 登录号(如P00533)反查 ChEMBL 靶点。完整的端点列表与 Django 风格过滤操作符(__range、__flexmatch等)见 references/api_endpoints.md。

💊 PubChem 技能:从化学名称到完整档案卡

PubChem 是 NCBI 的化学品数据库,该技能通过 scripts/pubchem_api.py 封装了 12 项能力,智能体按"先解析、再取数"的路径完成查询。

名称解析与理化性质

子命令作用
resolve把通用名/商品名/InChI 解析为 CID、SMILES、InChIKey
properties获取分子量、XLogP、TPSA 等计算性质
synonyms列出同义词与品牌名(如商品名 "Advil" ↔ 通用名 ibuprofen)

安全、药理与结构检索

  • safety:获取 GHS(全球统一制度)危害声明与操作注意事项
  • pharmacology:获取 FDA 药理数据、作用机制和治疗用途
  • similarity/substructure:结构相似性与子结构搜索,配合assays子命令可找出这些化合物相互作用的基因/蛋白靶点
  • range:按分子量、重原子数、XLogP 等性质区间筛选候选化合物

内置查询工作流清单

技能内置了面向复杂任务的操作清单(见 references/workflows.md):

  1. 化学品完整画像:名称解析 → 理化性质 → GHS 安全 → 药理信息 → 汇总成报告,共 5 步
  2. 结构导向的靶点发现:结构相似性搜索 → 筛选 Top 5-10 个 CID → 批量查 BioAssay → 归纳共同靶点

技能还有一条重要规则:凡用户问具体事实,智能体必须用数据库查询验证,不能只靠模型记忆——这对药物研发场景至关重要。

📋 openFDA 技能:美国 FDA 不良反应与药品标签查询

openFDA 提供 FDA 监管数据的开放 API,该技能通过 scripts/openfda_query.py 覆盖全部 28 个端点,横跨药品(drug)、器械(device)、食品(food)、烟草(tobacco)、化妆品(cosmetic)等 8 大类。

三大命令:search、count、download

  • search:按查询串检索记录,如patient.drug.medicinalproduct:aspirin
  • count:对某个字段做去重计数并给出 Top-N 高频值——统计"二甲双胍最常见的不良反应"就用它
  • download:自动翻页批量下载,单次下载有 2.5 万条的安全上限,常见药物可加日期范围限流

精确匹配与不良反应术语解读

  • 搜索药品名、品牌名时使用.exact后缀可得到精确匹配(如openfda.brand_name.exact:"ADVIL"),避免分词带来的噪声结果
  • 不良反应数据使用MedDRA术语(Preferred Term),智能体可联动 embl_ebi_ols 等本体技能查询术语的层级分类
  • 现成的查询配方(NDC 查询、短缺药物、药物-药物共现、召回类型统计等 18 种)都在 references/recipes.md,端点与字段语法见 references/api_endpoints.md

API Key 与速率限制

⚠️ 无 Key 时每日仅 1,000 次请求,智能体一次研究会很快耗尽;配置免费FDA_API_KEY后可提升至 12 万次/天。技能会调用 credentials 技能的安全凭证协议引导用户把 Key 写入.env,全程不用手动操作。

🔗 三技能联动:一条典型的药物研发数据查询流水线

三个技能各有分工,联动起来就是一条完整的"从分子到上市后安全"的数据流水线:

  1. PubChemresolve:把药物名称解析为 CID 和标准 SMILES
  2. ChEMBLactivity:用该结构查询靶点生物活性(IC50/Ki,--normalize统一单位)
  3. PubChemsafety/pharmacology:补充 GHS 危害声明与药理机制
  4. openFDAcount:统计上市后不良反应分布、适应症分布、报告国分布
  5. openFDAsearch(label 端点):核对官方药品标签

例:问智能体"查一下阿司匹林的靶点活性、安全信息和 FDA 不良反应 Top5",它会自动按上述路径依次调用三个技能,并把 JSON 结果汇总成一份带引用出处的报告。

🧬 向上延伸:药物靶点基因的调控变异分析

药物研发不只是查数据——当靶点基因本身存在遗传变异时,还会直接影响药物疗效。Science Skills 的 AlphaGenome 技能可对靶点基因的调控变异做基因组多轨道分析。下图是APOA1(脂蛋白代谢相关基因、心血管药物的经典靶点)启动子区域变异的分析图:

同一变异的肝脏组织多轨道细节视图(21 条 ChIP-seq/DNASE 轨道),可见变异位点在启动子区引起局部染色质状态改变:

完整分析示例见 apoa1_promoter/report.md,该目录还收录了剪接变异(外显子跳跃、外显子扩展)等更多案例。

🚀 快速上手:如何一步启用三大药物化学技能

一键安装

在终端执行(README 推荐方式):

npx skills add google-deepmind/science-skills/

也可以先克隆仓库浏览技能源码:

git clone https://gitcode.com/gh_mirrors/sc/science-skills

前置条件

  • uv包管理器:首次触发技能时智能体会请求批准并自动安装(流程见 skills/uv/SKILL.md)
  • API Key:ChEMBL、PubChem 无需 Key 即可使用;openFDA 强烈建议配置免费FDA_API_KEY以提升速率上限
  • 各数据源均有自己的许可条款,技能首次使用时会提示用户确认,并记录在.licenses/目录

📁 核心文件速查表

文件说明
skills/chembl_database/SKILL.mdChEMBL 技能指令(9 类查询 + 分页)
skills/chembl_database/references/api_endpoints.md端点清单与过滤操作符
skills/pubchem_database/SKILL.mdPubChem 技能指令(12 项能力)
skills/pubchem_database/references/workflows.md多步查询工作流清单
skills/pubchem_database/references/endpoints.mdPUG-REST 原始端点构造参考
skills/openfda_database/SKILL.mdopenFDA 技能指令(28 端点)
skills/openfda_database/references/recipes.md18 种现成查询配方
skills/openfda_database/references/api_endpoints.md查询语法、字段名与日期范围
skills/credentials/SKILL.mdAPI Key 安全存储协议

总结

Science Skills 用"指令 + 脚本 + 参考文档"三件套,把 ChEMBL、PubChem、openFDA 三大药物研发数据库变成 AI 智能体的"随取随用工具":查生物活性、看安全声明、统计 FDA 不良反应,都从"写代码调 API"变成了"一句话提问"。对新手和科研团队来说,这是把药物研发数据查询效率提升一个量级的实用方案 🚀

【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询