生命的语言:生物基础模型

专题介绍

如何让AI读懂蛋白质与基因组?三场报告分别介绍蛋白质多模态检索、AI辅助基因编辑工具开发和引入物种树的基因组语言模型,并讨论方法的应用与局限。

专题背景

AI 的浪潮正在推动生命科学从“观察与实验”迈向“数据与计算”的全新范式。如果说 DNA、RNA 和蛋白质是生命的源代码,那么迅速崛起的生物基础模型(Bio-Foundation Models)正成为解读这门古老语言的关键钥匙。借助深度学习,我们正在破译跨越亿万年的进化语法,在浩瀚的蛋白质空间中实现语义级导航,并通过算法设计出更高效、更精准的基因编辑工具。AI 正在重新定义我们对生命体系运作方式的理解。

在本期论坛中,我们荣幸邀请三位在生物计算领域深耕且走在前沿的青年学者。他们将分别从蛋白质多模态表征、基因编辑工具开发、以及基因组进化约束建模 三个关键维度,分享最新研究成果,展示生命语言模型在不同尺度上的创新应用。

主持人

翟晶晶

美国康奈尔大学基因组多样性研究所 · 博士后研究员(或研究员)

人物介绍

(Jingjing Zhai)目前是美国康奈尔大学(Cornell University)基因组多样性研究所(Institute for Genomic Diversity)的博士后研究员(或研究员),主要与美国科学院院士 Edward S. Buckler 的团队合作。她的硕博士学位毕业于中国西北农林科技大学(NWAFU)。

BilibiliProTrek:蛋白质多模态检索

本场回放 · 粟锦报告回放

Bilibili 打开回放 ↗

ProTrek:蛋白质多模态检索

粟锦
粟锦

西湖大学 · 博士研究生

西湖大学四年级博士研究生(导师:原发杰教授)。他于2022年获得华中科技大学学士学位,在校期间师从魏巍教授,研究自然语言处理技术。目前,他的研究兴趣集中在蛋白质人工智能领域,主要研究方向为蛋白质表征学习、多模态学习和智能体。

ProTrek 通过对比学习,将蛋白质序列、结构和功能整合到统一的三模态蛋白质语言模型中,从而能够对任意两种模态(包括模态内部)进行全面搜索。在识别功能相关蛋白质方面,ProTrek 在速度和准确性方面均优于现有的比对工具(例如 Foldseek 和 MMseqs2)。计算和湿实验验证表明,存储了超过 50 亿蛋白质的ProTrek 服务器 (www.search-protrek.com) ,能够高效地处理和分析大规模蛋白质数据。

已选择第 1 场:ProTrek:蛋白质多模态检索粟锦

其他参与人

赵程
赵程

中国农业科学院深圳农业基因组研究所 · 研究员

主要研究兴趣为:人工智能与代谢网络建模研究。研究方向为:1. 利用基因组规模代谢网络模型,模拟植物代谢过程,预测限制目标代谢物产量的关键反应,设计天然产物的代谢途径。2. 基于大语言模型框架,开发针对合成通路设计的人工智能大模型。

沈星星
沈星星

浙江大学 · 百人计划研究员

主要研究兴趣:通过整合大规模数据集,结合进化生物学、计算生物学和功能基因组学等多学科手段,解析功能未知的“暗物质”基因在昆虫复杂性状(如求偶、衰老和免疫)中的分子功能与演化规律。此外,他还基于大语言模型和机器学习探索病虫害防治策略,并开发分子系统发育学的理论与算法。

评论(0

登录后即可发表评论。

登录

暂无评论,来发表第一条评论吧!