AI FOR SCIENCE · 学术报告

从预测到设计:
让机器参与决定
下一个该做哪个分子

黎育权 副教授(特聘教授)· 硕士生导师

贵州省大数据实验室 · 贵州大学计算机科学与技术学院

Nature Machine Intelligence 共同第一作者 · 四项主持或负责在研 · The Innovation、iMeta、Exploration 青年编委

伊马替尼
伊马替尼 · 可拖动旋转 · RDKit ETKDGv3 构象
靶标 分子 合成 测试 学习
yuquan.li · 20261

背景 · 从哪里来

计算机出身,化学落地,两边都待过

计算机化学信息学 × AIAI for Science 2015–2019 · 青海大学计算机科学与技术 · 本科 2019–2024 · 兰州大学化学信息学 · 硕博连读 2020–2023 · 产业与研究院腾讯量子实验室 联合培养北京智源人工智能研究院 研究实习 2024.10 起 · 贵州大学贵州省大数据实验室计算机科学与技术学院
Source: 个人主页 yuquan.li 教育与经历(2026-09)2

提纲

六个部分:从问题出发,落到能怎么一起做

段宽=时长(共约 55 分钟) 一 问题8′设计空间近乎无限,验证机会极少第 4–7 页 二 做法8′让设计—合成—测试—学习闭环转起来第 8–10 页 三 方法18′表征、生成、合成、靶标八项工作第 11–18 页 四 数据与平台9′数据集、在线平台、智能体与边界第 19–23 页 五 产出与服务6′论文、在研项目编委与专利第 24–27 页 六 团队6′构成、培养与合作方式第 28–31 页
报告结构(六部分,约 55 分钟+交流)3

第一部分 · 问题

一 问题

先把困难说清楚:
空间太大、验证太少、关键处最难

真正值得做的那几个
第一部分4

一 问题 · 量级

能设计的分子近乎无限,能验证的却极少

类药化学空间 生成与虚拟筛选 打分与排序 一轮湿实验
1060

类药分子空间的常用估计;每一轮真正送去做实验的,只是其中极小的一部分

一个公开报道的实例

21天
4个生化实验
有活性
2个通过
细胞实验验证
Source: Bohacek et al., Med Res Rev 1996, 16:3–50;实例:Zhavoronkov et al., Nat Biotechnol 2019, 37:1038–10405

一 问题 · 难点

只差一个原子,5-HT1A 活性就差近 9 倍:模型最该做对的地方

四氢萘类分子
四氢萘骨架 · 5-HT1A Ki 185 nM
色满类分子
色满骨架 · 5-HT1A Ki 20.7 nM(CH₂ 换成 O)
结构相似度(Tanimoto,Morgan r=2)Ki 比值 185 / 20.7 ≈ 8.9 倍 0.58 01(完全相同)

对模型:关键差异被平均掉

对评测:随机划分下悬崖样本很少

Source: Xie et al., Adv Sci 2026, Fig. 3f;MoleculeACE CHEMBL214_Ki(原始数据 Costantino et al., J Med Chem 2005);Tanimoto 由 RDKit 计算6

一 问题 · 根源

光靠堆规模解决不了:数据少、要外推、要解释

所列 11 个公开基准:642–9,998 个分子

数据少

所列 11 个公开基准每个只有数百到数千个带标注分子;阴性结果在文献里越来越少见

训练分布 新骨架

要外推

真正要预测的常在训练分布之外

为什么是它?

要解释

化学家要知道是哪个基团起作用

Source: MoleculeNet: Wu et al., Chem Sci 2018, 9:513;Commun Chem 2026, Table 6;Fanelli, Scientometrics 2012, 90:891;三幅图为概念示意7

第二部分 · 做法

二 做法

让"设计—合成—测试—学习"
自己转起来

设计 合成 测试 学习 研究者
第二部分8

二 做法 · 需要哪几种能力

四种能力接进同一个环:人出判断,机器出通量

分子设计 闭环 专家智慧提出问题 · 判断取舍 通用智能大模型读文献 · 编排流程 专用工具性质预测 · 生成 · 逆合成 自动实验合成与测试 · 数据回流
结构示意9

二 做法 · 布局

围绕设计—合成—测试—学习闭环,三条线同时往前走

同一个问题 该做哪个分子、为什么设计 → 合成 → 测试 → 学习 · 人在环上做取舍 方法 算法:看懂分子自适应图学习 · 谱分解已发表多约束生成在研 数据 数据:可训练、可复用在建多模态高质量数据集与公开基准 平台 平台:从服务到智能体在线预测服务已上线CODD-Pred,参与开发智能体编排在建
结构示意(DMTA:Design–Make–Test–Analyze)10

三 方法 · 表征 ① 自适应图学习(GLAM)

建模里靠人拍板的那几步,交给流程自动完成

GLAM表内最好的对照RMSE,越低越好 · 纵轴自 0 起AUC,越高越好 · 纵轴自 0.5 起0.5920.704ESOL1.3191.371FreeSolv0.5960.724Lipophilicity0.8880.868BACE0.9320.911BBBP0.6590.654SIDER0.8410.813Tox210.7440.726ToxCast 自绘 · 数据:原文 Table 2

人工流程架构、超参、优化器、损失靠人定,效果差就返工

GLAM 流程采样配置、筛选、融合,中间各步不用人定

GLAM 表内最好的对照 Table 1 · AUC,越高越好 · 纵轴自 0.5 起 0.7610.694ALDH10.6660.616ESR1_ant0.7090.650KAT2A0.7300.683MAPK10.9540.937BindingDB

Table 1 五个、Table 2 八个数据集上均为表内最好,且未做人工调参

同一框架:分子间相互作用与分子性质两类任务

Source: 数据来自 Li, Hsieh et al., Nat Mach Intell 2022, Table 1、Table 2(均值,自绘柱图;本人共同第一作者)11

三 方法 · 表征 ② 层次交互学习(HimNet)

原子、基团、整个分子,三层之间显式交互

Commun Chem 2026 原文 Fig. 1:HIMPM 模块与 HimNet 框架总览 原文图 · Fig. 1

a 中:三种交互原子—原子、基团—基团、原子—基团,分开建模

a 右:全局节点一个代表整个分子的节点,同时看全部原子与基团

b:HimNet 框架层次图表征再与五种分子指纹做注意力融合

Commun Chem 2026 原文 Fig. 4:八个数据集上的消融对比 原文图 · Fig. 4
消融:八个数据集,逐个去掉一个模块。w/o M 双重消息传递 · I 层次交互 · C 共识指纹增强 · A 注意力融合 · H 层次消息传递
Source: Hong et al., Commun Chem 2026, 9:150, doi:10.1038/s42004-026-01922-x, Fig. 1、Fig. 4(原文整图未改动,CC BY-NC-ND 4.0;本人共同通讯)12

三 方法 · 表征 ③ 化学语义谱分解

把分子拆成“骨架”与“关键改动”两个频段分别看

分子表示低频 · 骨架(整体相似)高频 · 关键改动(活性悬崖处)

同表回归任务:ESOL RMSE 0.558,同样低于所列对比方法

高频通道专门盯住少数原子的改动,正对活性悬崖

Source: Xie et al., Adv Sci 2026, TABLE 1 · FreeSolv/ESOL RMSE(均值,越低越好;本人为共同通讯);数值与划分以原文为准;左图示意13

三 方法 · 生成 ① 多约束生成

生成不难,难的是同时满足一堆约束

活性 选择性 成药性 可合成性
候选分子

逐项优化会互相打架

活性上去了,成药性或可合成性常常掉下来

交集才是可用分子

约束由项目给定,系统只在交集里找解

在研:多约束小分子生成设计新方法(贵州大学,2024–2028)

Source: 在研项目(贵大特岗合字〔2024〕29号);中心分子仅为结构示意,概念图14

三 方法 · 生成 ② 多目标梯度引导

每一步都朝几个目标同时变好的方向走

目标 A:活性目标 B:成药性 两者兼顾的区域 起点分子 A 的梯度 B 的梯度 合成方向 概念示意

先生成再筛

大量候选在事后被丢掉,轮次花在无效分子上

梯度引导

生成过程中合成各目标的梯度,每步都往交集走

报告:多目标梯度引导分子生成(2025.10 第十四届全国生物信息学与系统生物学学术大会)

Source: 本人邀请报告(2025.10 全国生物信息学与系统生物学学术大会);左图为概念示意15

三 方法 · 合成 逆合成规划

设计出来还要做得出来:单步逆合成预测

RetroPrime · 流程示意(自绘)
产物COC(C)=O乙酸甲酯标出反应中心C–O 键模型给出断键位置合成子CC(=O)* + *OC断开后的两个片段反应物CC(=O)O + CO乙酸 + 甲醇第一步 · 产物到合成子(Transformer P2S)第二步 · 合成子到反应物(Transformer S2R)示例分子取自原文 Fig. 1;两步各由一个 Transformer 完成

产物 → 标出反应中心 → 拆成合成子 → 预测反应物

授权发明专利 · 第一发明人

基于人工智能的化学反应设计方法、系统及计算机设备

ZL 2026 1 0390758.3 · 2026.09.15 授权

下一步方向

把可合成性接进生成端(在研方向,尚未完成)

Source: 流程据 Wang, Li et al., Chem Eng J 2021(RetroPrime,本人共同一作)自绘;专利 ZL 2026 1 0390758.316

三 方法 · 靶标 关键基因挖掘

再往上游一步:先找对靶点,再设计分子或核酸

组学数据 蛋白结构 文献知识 候选关键基因附证据链 广谱 dsRNA序列设计 约束:脱靶稳定性 · 递送

国家自然科学基金 · 主持

RNA 干扰靶基因与 dsRNA 设计

在研(2026 年起) · 地区科学基金

与小分子共用方法论

目标:带证据链的候选清单,而非单个名字

Source: 国家自然科学基金地区科学基金(2026–2029,主持);左图为流程示意17

三 方法 · 小结

八项工作,指向同一件事:挑出的分子值得做

该做哪个分子为什么是它 表征:看懂分子 生成:做对分子 合成:做得出来 靶标:找对靶点 自适应图学习 · Nat Mach Intell 2022层次交互学习 · Commun Chem 2026化学语义谱分解 · Adv Sci 2026 多约束生成 · 在研项目多目标梯度引导 · 2025.10 报告 RetroPrime · Chem Eng J 2021化学反应设计 · 授权专利 2026 关键基因挖掘 · 国自然(在研)
Source: 见第 11–17 页各方法页出处18

第四部分 · 数据与平台

四 数据与平台

方法之外,
数据与平台决定能走多远

20数据集国家数据局 高质量数据集课题(先行先试)在建 21在线平台CODD-Pred · 参与开发已上线 22智能体编排架构示意,工具栏为示例在建 23边界现在还做不到的三件事
第四部分19

四 数据与平台 · 数据集

数据集本身就是一项科研产出

多源采集 统一治理与标注 高质量数据集 模型 平台 公开基准

国家数据局 高质量数据集课题

先行先试 · 课题负责人
2025–2027

贵州省实验室重大科研项目

公共数据能力可信
供给与协同流通
课题三负责人 · 2026–2029

入选《中国农业农村年鉴》

2025 卷「科教兴农」专版

Source: 国家数据局 高质量数据集课题(先行先试);《中国农业农村年鉴》2025 卷;黔科合平台SSYS〔2026〕重大01620

四 数据与平台 · 在线平台

参与开发的在线预测平台:CODD-Pred

CODD-Pred · 活性预测页面(局部)
CODD-Pred 活性预测页面顶部:导航栏、提交说明与分子输入方式

做什么

靶点识别与活性预测,网页提交分子即可

本人角色

参与开发(J Chem Inf Model 2023,本人第 3 作者)

Source: Yin et al., J Chem Inf Model 2023, doi:10.1021/acs.jcim.3c00685(本人第 3 作者);页面实拍局部21

四 数据与平台 · 智能体编排

大模型的位置是编排,不是直接生成分子

研究者提出目标靶标 · 约束 · 可接受的代价 智能体:拆解任务 · 调度工具决定先做什么,失败了改哪一步 性质预测CODD-Pred(已上线)等 分子生成多约束 · 多目标 合成规划RetroPrime · 可合成性 检索文献与数据库 结果+出处结果+出处 通用智能负责编排,专用工具负责准确 在建 · 架构示意
架构示意(智能体编排在建):研究者 → 智能体 → 专用工具;工具栏为可调用的公开工具(示例)22

四 数据与平台 · 边界

这套东西现在还做不到的三件事

?模型:先做哪几个实验:行不行
边界 01

不能替代湿实验

给出的是"先做哪几个",不是"这个一定行";最终判据仍是实验

需要:合成与测试的实验合作
靶标 A数据多 · 已调好靶标 B数据少 · 要重来
边界 02

跨靶标迁移仍弱

一个体系上调好的模型,换靶标常要重来;根子在数据偏置

需要:更多靶标的高质量数据
设计合成测试学习计算端靠排期
边界 03

闭环还不是全自动

合成与测试仍靠合作实验室排期;自动实验是方向,不是现状

需要:自动化实验平台对接
能力边界(按当前工作实况整理);三幅图为示意23

五 产出与服务 · 论文

期刊论文 27 篇,2025 年起明显加快

2025 年至 2026 年 9 月共 15 篇,占 2020 年以来 27 篇的 56%

10h-index
531总被引

h-index 与被引:Semantic Scholar,按 ORCID 的 DOI 逐条匹配后统计(取数 2026-09-30);预印本不计入论文篇数

Source: ORCID 0000-0003-2756-0449+Crossref(取数 2026-09-25);Semantic Scholar 按 ORCID DOI 匹配(取数 2026-09-30)24

五 产出与服务 · 合作面

2025.9 起的 14 篇期刊论文,分布在 10 种期刊

6 篇 综合类期刊 5 篇 化学与药物化学 2 篇 农业与食品化学 1 篇 人工智能

综合类:Adv Sci、Nat Commun、The Innovation(综述 · 共同第一作者,17 位之一)

化学与药物化学含 TIDD 观点文 1 篇

领域归类为本组整理;多数为合作署名

Source: Crossref 在线日期 2025-09-01 起的期刊论文 14 篇、10 种期刊,按领域归并(归类为本组整理),不含预印本(取数 2026-09-25)25

五 产出与服务 · 在研项目

四项主持或负责在研,覆盖方法、数据与应用

2024 2025 2026 2027 2028 2029 2030 2026.09 基于人工智能的多约束小分子生成设计新方法研究 贵州大学 · 主持 2024.10–2028.10 国家数据局 高质量数据集课题(先行先试) 课题负责人 2025.09–2027.09 RNA 干扰靶基因与 dsRNA 设计 国家自然科学基金(地区) · 主持 2026.01–2029.12 公共数据能力可信供给与协同流通关键技术研究 贵州省实验室重大科研项目 · 课题三负责人 2026.07–2029.06
Source: 贵大特岗合字〔2024〕29号;国家数据局 先行先试课题;国家自然科学基金地区科学基金(主持);黔科合平台SSYS〔2026〕重大01626

五 产出与服务 · 学术服务

两年里:编委、报告与第一发明人专利

编委·评审 报告·荣誉 专利 2024.92025.12026.12026.9 Exploration 青年编委2024.9 · 青委会植物学部副主任 省大数据局 AI 产业方向2025.1 · 评审专家组组长 The Innovation · iMeta2025.8 · 青年编委 全国生物信息学大会 · 报告2025.10 · 多目标梯度引导分子生成 扬州大学 学术大讲堂2025.11 · 邀请报告 The Innovation Drug Discovery2026.1 · 创刊筹委、学术编辑(执行) 国际会议邀请报告 · 特等报告人奖2026.1另获 Exploration 2025 年度杰出青年编委奖 研究生教育评估监测专家库2026.5 · 专家 科学智能大会(北京)· 墙报2026.8 发明专利授权 · 第一发明人2026.9 · 化学反应设计
Source: 个人主页 yuquan.li 学术兼职、报告与荣誉(2026-09);专利授权公告 ZL 2026 1 0390758.327

六 团队 · 构成与方向

十二位同学在读,四个方向并行

7 人 联培博士 3 人 联培硕士 2 人 名下硕士

分子生成与设计

多目标分子生成、智能体分子设计、RNA 小分子抑制剂

靶标发现

AI 靶标发现、细胞表型学习

大分子与递送

大分子药物、靶向蛋白降解、多肽与递送、抗菌肽设计、递送系统

性质预测与合成

分子性质预测、合成规划

合作导师郝格非教授(贵州大学)· 姚小军教授(澳门理工大学)· 杨文超老师(贵州大学)合作伙伴王晓瑞老师(深圳理工大学)
Source: 团队名册(2026-09-25):联培博士 7、联培硕士 3、名下硕士 2、已毕业 128

六 团队 · 培养方式

路子是先跑起来,再做出来,最后写出去

返修意见回到"做出来"补实验 跑起来环境 · 复现 从零带起入学先有入门培训计算机背景补化学,化学背景补算法 做出来改进 · 实验 联合培养与合作单位双导师指导在真问题上练手 写出去投稿 · 返修 署名先说清谁做的工作谁一作合作方的题目通常合作方一作 顺序反了最费劲:先想故事、再补结果,必然返工
培养路径(课题组现行做法)29

六 团队 · 合作实例

一例做成的合作:三家单位,投稿三个月后录用

01

提出问题与设计

本人 · 共同通讯
  • 提出并设计课题
  • 定写作主框架
02

实验与实现

第一作者
  • 设计并完成实验
  • 分析结果、绘图、初稿

两位通讯给关键意见,另一位通讯管理并指导项目

贵州大学 · 华中师范大学 · 澳门理工大学10 位作者计算方法类
约三个月2025-09-08 投稿12-09 修回12-11 录用
03 · 原文图 Fig. 3f

结果

Adv Sci 2026 原文 Fig. 3f:活性悬崖分子对与 Ki 标注

FreeSolv 上 RMSE 0.654
表内对比方法 1.142–1.877

Source: Xie et al., Adv Sci 2026, Author Contributions、TABLE 1、Fig. 3f30

六 团队 · 合作

如果手上有问题,大概能这样一起做

带着这些来第一轮能拿到 一批活性数据 建模与活性悬崖分析 一个靶点 多约束候选与可合成性评估 一份组学数据 带证据链的候选关键基因 第一步:先拿一个边界清楚的小问题试一轮

联合申报

对方得到:申报书里的 AI 方法与数据工程部分

已有基础:主持国自然项目,负责国家数据局与省实验室课题

共同发表

对方得到:建模、计算与撰稿支撑,署名按贡献;合适方向可合办专刊

已有基础:2025.9 起署名期刊论文 14 篇

数据与平台共建

对方得到:数据集、知识图谱、专用模型与在线平台

已有基础:两项数据课题在研,参与开发 CODD-Pred

工程化落地

对方得到:平台开发、部署与长期运维,可对接合作工程团队

Source: Crossref(取数 2026-09-25)31

致谢

这些工作不是一个人做出来的

资金

国家自然科学基金委员会国家数据局贵州省科学技术厅贵州省大数据局贵州大学

导师与合作

姚小军教授(澳门理工大学)郝格非教授(贵州大学)

团队

课题组全体同学与联合培养合作导师

平台

贵州省大数据实验室中斯茶叶绿色防控一带一路国际联合实验室
资金 导师 团队 平台 谢谢
黎育权 · 贵州省大数据实验室 · 贵州大学32

联系 · Q&A

欢迎提问与交流:论文与联系方式都在主页上

yuquan.li

扫码打开个人主页

yuquan.li · 个人主页实拍(2026-09-28)
个人主页首屏实拍:研究方向、交流、收稿与招生说明

微信

yvquanli

贵州省大数据实验室

贵州大学计算机科学与技术学院 · 贵阳

黎育权 · 副教授(特聘教授)· 贵州省大数据实验室 · 贵州大学33
手机上建议看 逐页 PDF(可放大,末页邮箱与主页可点);横屏也能放映,字仍偏小。