生命的语言:生物基础模型
专题介绍
如何让AI读懂蛋白质与基因组?三场报告分别介绍蛋白质多模态检索、AI辅助基因编辑工具开发和引入物种树的基因组语言模型,并讨论方法的应用与局限。
专题背景
AI 的浪潮正在推动生命科学从“观察与实验”迈向“数据与计算”的全新范式。如果说 DNA、RNA 和蛋白质是生命的源代码,那么迅速崛起的生物基础模型(Bio-Foundation Models)正成为解读这门古老语言的关键钥匙。借助深度学习,我们正在破译跨越亿万年的进化语法,在浩瀚的蛋白质空间中实现语义级导航,并通过算法设计出更高效、更精准的基因编辑工具。AI 正在重新定义我们对生命体系运作方式的理解。
在本期论坛中,我们荣幸邀请三位在生物计算领域深耕且走在前沿的青年学者。他们将分别从蛋白质多模态表征、基因编辑工具开发、以及基因组进化约束建模 三个关键维度,分享最新研究成果,展示生命语言模型在不同尺度上的创新应用。
主持人
美国康奈尔大学基因组多样性研究所 · 博士后研究员(或研究员)
人物介绍
(Jingjing Zhai)目前是美国康奈尔大学(Cornell University)基因组多样性研究所(Institute for Genomic Diversity)的博士后研究员(或研究员),主要与美国科学院院士 Edward S. Buckler 的团队合作。她的硕博士学位毕业于中国西北农林科技大学(NWAFU)。

本场回放 · 粟锦报告回放
在 Bilibili 打开回放 ↗ProTrek:蛋白质多模态检索
西湖大学 · 博士研究生
西湖大学四年级博士研究生(导师:原发杰教授)。他于2022年获得华中科技大学学士学位,在校期间师从魏巍教授,研究自然语言处理技术。目前,他的研究兴趣集中在蛋白质人工智能领域,主要研究方向为蛋白质表征学习、多模态学习和智能体。
ProTrek 通过对比学习,将蛋白质序列、结构和功能整合到统一的三模态蛋白质语言模型中,从而能够对任意两种模态(包括模态内部)进行全面搜索。在识别功能相关蛋白质方面,ProTrek 在速度和准确性方面均优于现有的比对工具(例如 Foldseek 和 MMseqs2)。计算和湿实验验证表明,存储了超过 50 亿蛋白质的ProTrek 服务器 (www.search-protrek.com) ,能够高效地处理和分析大规模蛋白质数据。
已选择第 1 场:ProTrek:蛋白质多模态检索,粟锦
评论(0)
登录后即可发表评论。
登录暂无评论,来发表第一条评论吧!