Science Skills药物化学技能集:ChEMBL、PubChem与openFDA如何驱动AI智能体完成药物研发数据查询
【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills
Science Skills是谷歌 DeepMind 开源的科学智能体技能集,其中ChEMBL、PubChem、openFDA三大药物化学技能可以让 AI 智能体直接完成分子结构检索、生物活性数据(IC50/Ki)查询、化学品安全信息获取和 FDA 不良反应统计等药物研发数据查询任务——你只需要用自然语言提问,无需自己写 API 调用代码。
🧰 一套技能集,覆盖三大数据库
做药物研发数据查询的传统方式,是分别对接多个数据库的 API、处理鉴权、限流和 JSON 解析。Science Skills 把这些工作封装成了"技能(Skill)":每个技能目录都包含三类文件,智能体读取指令后就能按最佳实践操作 📦
SKILL.md—— 给 AI 智能体的操作指令(含前置条件和核心规则)scripts/—— 封装好的查询脚本(自动处理限流、重试、输出落盘)references/—— API 参考、查询配方等文档
| 技能 | 数据源 | 一句话定位 | 你可以问智能体的问题 |
|---|---|---|---|
| chembl_database | ChEMBL(EMBL-EBI) | 药物靶点与生物活性数据的"源头" | "EGFR 靶点的 IC50 数据有哪些?" |
| pubchem_database | PubChem(NCBI) | 化学物质的"完整档案卡" | "伊布uprofen的分子量、logP 和 GHS 危害声明?" |
| openfda_database | openFDA(美国 FDA) | 上市后药物安全数据的"账本" | "二甲双胍报告的不良反应 Top10 是什么?" |
💡 项目整体结构说明见 README.md,它还集成了 UniProt、AlphaGenome 等 30+ 其他数据库与工具。
🎯 ChEMBL 技能:药物靶点与生物活性数据一步查
ChEMBL 是全球最大的生物活性小分子数据库之一,这个技能通过单一入口脚本 scripts/chembl_api.py 提供 9 大类查询能力。
分子、靶点、活性三大核心入口
- 分子查询:按 ChEMBL ID、名称(如 "aspirin")搜索,或直接按分子量等属性过滤
- 靶点查询:按名称搜索蛋白靶点(如 "EGFR"),支持批量 ID 拉取
- 活性数据:查询 IC50、Ki、EC50 等生物活性记录;
--normalize参数可把不同单位(nM/µM/pM)统一换算为 nM,方便跨研究比较
结构相似性搜索与 2D 结构图
- 相似性搜索:给出一个 SMILES 字符串和相似度阈值(0-100),直接在服务端完成检索,无需本地安装 RDKit
- 子结构搜索:查找包含指定子结构(如苯环
c1ccccc1)的所有分子 - 结构图下载:
image子命令可下载 2D 结构图(SVG 矢量格式,适合论文出版)
跨库交叉引用
ChEMBL 技能可与 UniProt、PubChem 等互相打通:例如用 UniProt 登录号(如P00533)反查 ChEMBL 靶点。完整的端点列表与 Django 风格过滤操作符(__range、__flexmatch等)见 references/api_endpoints.md。
💊 PubChem 技能:从化学名称到完整档案卡
PubChem 是 NCBI 的化学品数据库,该技能通过 scripts/pubchem_api.py 封装了 12 项能力,智能体按"先解析、再取数"的路径完成查询。
名称解析与理化性质
| 子命令 | 作用 |
|---|---|
resolve | 把通用名/商品名/InChI 解析为 CID、SMILES、InChIKey |
properties | 获取分子量、XLogP、TPSA 等计算性质 |
synonyms | 列出同义词与品牌名(如商品名 "Advil" ↔ 通用名 ibuprofen) |
安全、药理与结构检索
safety:获取 GHS(全球统一制度)危害声明与操作注意事项pharmacology:获取 FDA 药理数据、作用机制和治疗用途similarity/substructure:结构相似性与子结构搜索,配合assays子命令可找出这些化合物相互作用的基因/蛋白靶点range:按分子量、重原子数、XLogP 等性质区间筛选候选化合物
内置查询工作流清单
技能内置了面向复杂任务的操作清单(见 references/workflows.md):
- 化学品完整画像:名称解析 → 理化性质 → GHS 安全 → 药理信息 → 汇总成报告,共 5 步
- 结构导向的靶点发现:结构相似性搜索 → 筛选 Top 5-10 个 CID → 批量查 BioAssay → 归纳共同靶点
技能还有一条重要规则:凡用户问具体事实,智能体必须用数据库查询验证,不能只靠模型记忆——这对药物研发场景至关重要。
📋 openFDA 技能:美国 FDA 不良反应与药品标签查询
openFDA 提供 FDA 监管数据的开放 API,该技能通过 scripts/openfda_query.py 覆盖全部 28 个端点,横跨药品(drug)、器械(device)、食品(food)、烟草(tobacco)、化妆品(cosmetic)等 8 大类。
三大命令:search、count、download
search:按查询串检索记录,如patient.drug.medicinalproduct:aspirincount:对某个字段做去重计数并给出 Top-N 高频值——统计"二甲双胍最常见的不良反应"就用它download:自动翻页批量下载,单次下载有 2.5 万条的安全上限,常见药物可加日期范围限流
精确匹配与不良反应术语解读
- 搜索药品名、品牌名时使用
.exact后缀可得到精确匹配(如openfda.brand_name.exact:"ADVIL"),避免分词带来的噪声结果 - 不良反应数据使用MedDRA术语(Preferred Term),智能体可联动 embl_ebi_ols 等本体技能查询术语的层级分类
- 现成的查询配方(NDC 查询、短缺药物、药物-药物共现、召回类型统计等 18 种)都在 references/recipes.md,端点与字段语法见 references/api_endpoints.md
API Key 与速率限制
⚠️ 无 Key 时每日仅 1,000 次请求,智能体一次研究会很快耗尽;配置免费FDA_API_KEY后可提升至 12 万次/天。技能会调用 credentials 技能的安全凭证协议引导用户把 Key 写入.env,全程不用手动操作。
🔗 三技能联动:一条典型的药物研发数据查询流水线
三个技能各有分工,联动起来就是一条完整的"从分子到上市后安全"的数据流水线:
- PubChem
resolve:把药物名称解析为 CID 和标准 SMILES - ChEMBL
activity:用该结构查询靶点生物活性(IC50/Ki,--normalize统一单位) - PubChem
safety/pharmacology:补充 GHS 危害声明与药理机制 - openFDA
count:统计上市后不良反应分布、适应症分布、报告国分布 - openFDA
search(label 端点):核对官方药品标签
例:问智能体"查一下阿司匹林的靶点活性、安全信息和 FDA 不良反应 Top5",它会自动按上述路径依次调用三个技能,并把 JSON 结果汇总成一份带引用出处的报告。
🧬 向上延伸:药物靶点基因的调控变异分析
药物研发不只是查数据——当靶点基因本身存在遗传变异时,还会直接影响药物疗效。Science Skills 的 AlphaGenome 技能可对靶点基因的调控变异做基因组多轨道分析。下图是APOA1(脂蛋白代谢相关基因、心血管药物的经典靶点)启动子区域变异的分析图:
同一变异的肝脏组织多轨道细节视图(21 条 ChIP-seq/DNASE 轨道),可见变异位点在启动子区引起局部染色质状态改变:
完整分析示例见 apoa1_promoter/report.md,该目录还收录了剪接变异(外显子跳跃、外显子扩展)等更多案例。
🚀 快速上手:如何一步启用三大药物化学技能
一键安装
在终端执行(README 推荐方式):
npx skills add google-deepmind/science-skills/也可以先克隆仓库浏览技能源码:
git clone https://gitcode.com/gh_mirrors/sc/science-skills前置条件
uv包管理器:首次触发技能时智能体会请求批准并自动安装(流程见 skills/uv/SKILL.md)- API Key:ChEMBL、PubChem 无需 Key 即可使用;openFDA 强烈建议配置免费
FDA_API_KEY以提升速率上限 - 各数据源均有自己的许可条款,技能首次使用时会提示用户确认,并记录在
.licenses/目录
📁 核心文件速查表
| 文件 | 说明 |
|---|---|
| skills/chembl_database/SKILL.md | ChEMBL 技能指令(9 类查询 + 分页) |
| skills/chembl_database/references/api_endpoints.md | 端点清单与过滤操作符 |
| skills/pubchem_database/SKILL.md | PubChem 技能指令(12 项能力) |
| skills/pubchem_database/references/workflows.md | 多步查询工作流清单 |
| skills/pubchem_database/references/endpoints.md | PUG-REST 原始端点构造参考 |
| skills/openfda_database/SKILL.md | openFDA 技能指令(28 端点) |
| skills/openfda_database/references/recipes.md | 18 种现成查询配方 |
| skills/openfda_database/references/api_endpoints.md | 查询语法、字段名与日期范围 |
| skills/credentials/SKILL.md | API Key 安全存储协议 |
总结
Science Skills 用"指令 + 脚本 + 参考文档"三件套,把 ChEMBL、PubChem、openFDA 三大药物研发数据库变成 AI 智能体的"随取随用工具":查生物活性、看安全声明、统计 FDA 不良反应,都从"写代码调 API"变成了"一句话提问"。对新手和科研团队来说,这是把药物研发数据查询效率提升一个量级的实用方案 🚀
【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考