浙大张强教授访英AI4Science分享交流会

2026年7月17日,中英人工智能协会(CBAIA)在伦敦举办了一场主题为“AI for Science(AI4Science)”的小型分享交流会。本次活动CBAIA有幸邀请到了浙江大学张强教授,围绕人工智能在生命科学与材料科学领域的应用做了一场深入而扎实的分享。

与许多聚焦“AI 商业化”“AI 落地英国市场”的活动不同,这场交流会把视线拉回到了一个更根本的问题:当大模型技术已经席卷文本、图像乃至视频领域之后,它究竟能不能、以及应该如何,走进 DNA、RNA、蛋白质与分子的世界?

这不是一场面向大众的科普讲座,而更像是一次“同行对话”——张强教授用近一小时的时间,系统梳理了 AI4Science 从仿真时代到大模型时代的技术脉络,介绍了自己团队将生成式语言模型能力迁移到生命科学与材料科学领域的核心方法论,并在随后的问答环节中,与在场嘉宾就模型规模、算法与自动化实验室的配合、以及具体的蛋白质设计案例,进行了相当细致的探讨。

 

 

Warm welcome from CBAIA

从仿真时代到大模型时代:AI4Science 为何成为必然

活动开场由中英人工智能协会代表致欢迎辞:介绍了协会和张强教授的渊源,并对张强教授这次的赴英访问表示热烈欢迎。

张强教授的分享从一段技术演进史讲起。第二次世界大战之后,电子计算机技术逐渐成熟,学界开始出现以计算机仿真为核心范式的研究方法——比如通过分子对接、蛋白质模拟等虚拟仿真手段,去研究不同药物分子与蛋白分子之间的相互作用。进入21世纪后,随着数据规模、算力和 AI 技术的同步跃升,越来越多研究者开始尝试用人工智能的方法直接对蛋白质、分子及其结构与性质进行建模。

这条脉络上的一个标志性节点是 AlphaFold2。2021年,其成果发表于《Nature》;2024年,Demis Hassabis 与 John Jumper 因开发 AlphaFold 获得诺贝尔化学奖。AlphaFold 的成功展示了人工智能在生命科学重大问题上的突破,也成为 AI4Science 发展过程中的重要里程碑。此后,这一方向持续受到科研界广泛关注,吸引越来越多研究者进入这一交叉领域。

张强教授将自己对 AI4Science 的理解概括为:从 AI 的视角出发,去审视生命科学与材料科学领域存在哪些问题、需要处理什么样的数据,进而决定应该采用什么样的 AI 模型来处理这些数据。

他同时指出了一个关键的时间节点:2022年11—12月,ChatGPT 的发布标志着生成式 AI 开始进入大规模应用阶段,也极大提升了产业界与学术界对通用人工智能(AGI)可能性的关注。但在2022—2023年那个阶段,无论是 ChatGPT 还是 Stable Diffusion,当时的大模型主要集中在文本与图像等模态,对于 DNA、RNA、蛋白质等科学数据的建模仍然有限。

 

 

Qiang Zhang from ZJU

核心方法论:把生成式语言模型的能力“翻译”给生命科学与材料科学

正是基于这一判断,张强教授团队的研究方向被概括为:将生成式人工智能模型的能力,从常规的文本、图像、视频等模态,拓展到生命科学领域的 DNA、RNA、蛋白质,以及物质科学领域的分子(包括无机分子与材料)。

这一拓展的合理性,来自于对两类数据特点的观察。在生命科学领域,DNA、RNA 与蛋白质都可以表示为序列,而它们之间的信息流遵循分子生物学的中心法则(Central Dogma);而在化学领域,SMILES 等分子表示方法已经成为描述化学分子的重要语言。既然人类自然语言的序列建模思路(Transformer、BERT、GPT 架构)行之有效,团队很自然地尝试将这套思路迁移到蛋白质序列建模与化学分子建模上。

但张强教授也强调了一个容易被忽视的区别:早期大模型处理“常识知识”的能力很强,处理“科学知识”的能力则相对薄弱,而这背后的核心差异在于科学知识具有更强的结构化属性。他以人体代谢网络为例做了说明——例如,胰岛素与细胞表面的胰岛素受体结合后,会激活细胞内复杂的信号传导网络,进而调控葡萄糖摄取、糖原合成等一系列代谢过程。这些由分子、蛋白质及生化反应共同组成的网络,本身蕴含着丰富的结构化知识。

因此,团队在方法论上采取了“双轨并行”的思路:一方面采用以大模型为代表的序列建模(sequence model)方法,另一方面采用以知识图谱(knowledge graph)为代表的符号化、结构化知识建模方法,将两者结合,作为 AI 侧的核心创新;在科学侧,则与国内外生物学家、化学家、药物学家保持密切合作,共同确定真正值得解决的问题,形成 AI 与科学之间的双向交流。

 

 

Qiang Zhang from ZJU

从元素周期表到蛋白质设计:团队的系列成果下一步

在分享的中段,张强教授较为快速地梳理了团队近年来取得的一系列具体成果:

结构化知识图谱的构建。 团队首先将中学阶段就接触过的化学元素周期表转化为一张知识图谱,并用这张图谱增强化学分子的表示学习,服务于分子毒性预测、代谢能力预测等下游任务。此后,团队进一步将元素簇、化学反应(分子如何与其他分子反应生成新分子)等更全面的化学信息整合起来,形成了一套覆盖元素、分子、反应、实验方案等多个层面的“智库” schema。

表示学习、检索与蛋白质工程。 在表示学习层面团队基于 BERT 类架构开展了分子的表示学习研究。在此基础上,团队尝试将信息检索(如从数据库中检索同源蛋白)这一在自然语言处理与搜索引擎领域常见的思路,迁移到蛋白质序列处理上——针对一条目标蛋白质序列作为 query,从大规模语料库中检索出同源或高度相似的其他序列,从而辅助功能预测等下游任务。此外,团队也开展了已知蛋白质的定向改造工作,例如将蛋白质中特定位置的氨基酸替换为其他氨基酸,从而改变其催化活性或纯化能力。

面向生成的大规模标注数据集与模型训练。 为了让早期大模型真正“理解”生命科学与化学分子,团队手工构建了大规模的分子标注数据集,并基于这一数据集,经历了从预训练、粗粒度微调到细粒度微调等多个阶段的模型训练,最终实现了两项关键能力:根据文本描述设计具有目标功能的蛋白质序列;以及设计能够与目标蛋白结合的小分子。相关工作此前已整理为一篇综述文章发表。

 

 

Qiang Zhang from ZJU & CBAIA Research Fellows

科学智能体与自动化实验室:让 AI 真正“动手做实验”

张强教授分享的另一条主线,是团队近期正在推进的“科学智能体”(scientific agent)工作——用大模型智能体去完成生物化学领域大量工具的调用与编排。这套智能体架构中包含规划器(planner)、执行器(executor)与总结器(summarizer)等模块,并将生物化学家日常面临的常见工具使用需求,封装为可复用的“技能”(skill)。

更进一步,这套智能体已经与自动化实验装置结合:大模型可以生成代码,直接驱动机械臂完成开关盖子、搅拌、称量,乃至在不同实验场景下进行浊度测定等具体操作。张强教授提到,这一方向已经开始与药企展开较深入的合作,因为部分资本化程度较高的药企,本身就存在较大的类似需求。

目前团队已经完成了针对化学分子与蛋白质的设计、构建、性能测试与模型迭代进化的完整闭环,且随着迭代轮次增加,模型性能呈现持续提升的趋势。张强教授也坦言,目前的自动化装置更多还是依照预先写定的代码严格执行既定计划,机器本身的自主决策能力还不强;而“具身智能”这一方向,则希望赋予机器根据当下状态自主决策特定动作的能力,从而真正打通“科学仪器设备—语言决策—真实实验环境—科学发现”这一完整闭环。

张强教授将团队的整体定位总结为:生成式大模型在通用知识处理方面已经展现出强大的能力,但面对高度专业、结构化的科学知识,以及科学推理与科学发现任务,仍然存在较大挑战;团队正是希望借助学术界有限的计算与人力资源,去做一些大厂尚未涉足的工作——即以“知识图谱增强”为代表方式的 AI4Science 研究。过去几年,团队在这一方向上取得了若干高质量的学术发表,也争取到了国内的政策与项目支持,包括若干国家级项目以及与企业的合作。

问答环节:设计—构建—测试—学习闭环的真实细节

分享结束后的问答环节,与会嘉宾就一系列具体技术细节与张强教授进行了深入交流。

关于竞争格局。 有嘉宾提问,蚂蚁、腾讯等互联网企业是否也是竞争对手。张强教授回应,蚂蚁与腾讯本身并不做药,但他们的 AI 技术会为药企、医院等客户提供支持,与药企之间是合作关系而非直接竞争;而与斯坦福等海外高校相比,各团队的研究侧重点存在差异化,他对自己所关注的方向“非常有信心”,团队的相关论文也获得了不错的关注度。

关于模型规模与训练路径。 针对是否应该训练大规模基础模型的问题,张强教授指出,这取决于要解决什么规模的问题:如果目标是训练一个大规模的通用蛋白质语言模型,那么团队目前依赖开源数据(即所有可获取的已知蛋白质序列)构建的方式是合适的;但如果是针对某个具体实验室所关心的特定蛋白质或小分子,可用数据量往往只有几十到几百个样本,需要采用不同的方法应对。团队目前采用的检索系统是借鉴 RAG 的检索增强思想,但其他大多数任务更多依赖模型自身的能力,而非依赖检索。团队既有从零训练的模型,也有基于开源基础模型微调或组合其他方法(如 RoseTTAFold、ProteinMPNN 等)完成的工作,具体选择取决于要解决的问题类型。

一个具体的抗体设计案例。 当被问及是否有真正成功落地的设计案例时,张强教授分享了一个具体项目:将非天然氨基酸引入某一抗体载体中,目标是提高抗体中非天然氨基酸掺入的成功率/比例,从而增强抗体对外源性抗原的抵抗能力,服务于相关疾病的治疗需求。该项目最终取得了成功,团队也因此发现了新的、此前未见的蛋白质代表序列,而不只是对已知方案的复现。

设计—构建—测试—学习闭环的具体节奏。 嘉宾进一步追问了该项目的迭代细节:每一轮迭代中,团队会从模型预测排序结果中挑选前96个最优候选序列,交由自动化实验装置完成合成与实验验证;实验结果反馈回模型后,用于更新模型的预测头与相关参数,模型据此对理论空间重新排序,进入下一轮迭代——整个项目共完成了四轮迭代。自动化实验装置完成约96—100个样本的合成,大约只需要一天时间;相比之下,许多实验室采用传统人工筛选手段完成类似规模的工作,往往需要一到两个月。

在候选序列的筛选标准上,张强教授特别澄清:团队并不单纯依赖 pLDTT 等单一评估指标,而是采用一种基于概率统计的思路——团队希望这96个候选样本既包含预测适应度(fitness)较高的个体,又保持样本之间足够的多样性,从而从概率角度最大化每一轮迭代带来的性能提升。至于算法端(很快)与自动化硬件端(相对较慢)之间如何取得平衡,张强教授将其形容为一种“赛道式”的动态权衡,需要根据具体项目节奏灵活调整。

 

 

Qiang Zhang from ZJU & CBAIA Co-founder

 

 

Workshop Group Photo 1

 

 

Workshop Group Photo 2

结语:AI4Science,仍在路上

如果说本次 CBAIA 活动带来的最大启发,是一种坦率——张强教授并没有回避 AI4Science 领域当前的局限:生成式大模型在通用知识处理方面已经展现出强大的能力,但面对高度结构化的科学知识,依然任重道远。团队选择的路径,不是追求“大而全”的通用科学基础模型,而是把序列建模与知识图谱结合起来,扎扎实实地解决生命科学与物质科学领域中一个又一个具体问题,并通过与自动化实验装置的深度结合,把“设计—构建—测试—学习”的闭环,从几周甚至几个月,压缩到几天之内完成。

对于 CBAIA 而言,这场规模不大的分享交流会,延续了协会一贯的定位——把真正深耕一线研究的学者请到英国,与来自产业界、投资界的嘉宾进行坦诚而具体的交流,让“AI 如何真正落地”这一问题,不停留在概念层面,而是落到具体的算法选择、数据规模与实验节奏之中。

策划 | Tengfei Yin, Zhenhai Li
执行 | Tengfei Yin, Zhenhai Li
主持 | Zhenhai Li
摄影 | Zuoxin Wang

作者 | Tengfei Yin
编辑 | Tengfei Yin
审核 | Qiang Zhang, Zhenhai L