生物信息工具开发:序列比对、测序解析与分析平台

专题介绍

序列比对、测序解析与分析平台各自走到哪一步?五场报告覆盖百万级基因组比对、产业界需求、纳米孔 RNA 修饰与高性能计算环境。

专题背景

“科学进步依赖新技术、新发现和新思想,其重要性大概也依此排序。” 这句 Sydney Brenner 的名言指出了技术进步在推动科学突破中的重要性。本论坛将围绕“生物信息工具开发:历程与应用”这一主题,汇聚一线开发者,分享他们在开发尖端生物信息工具中的宝贵经验和多样化的应用场景。通过深入了解这些工具的原理和背后故事,生物学家们能够迅速将前沿技术应用到自己的研究中,从而大幅提升工作效率。此外,论坛还致力于提升对开发人员在科研界重要角色的认知。对于早期开发者,通过论坛可以了解到不同开发人员的职业发展轨迹,为职业发展规划提供参考。

主持人

周通

山东大学生命科学学院 · 博士后

人物介绍

专题负责与主持人:周通,山东大学生命科学学院博士后

BilibiliCGM方法技术专题第二期

活动回放 · CGM方法技术专题第二期

以下为活动回放,未定位到本报告。

Bilibili 打开回放 ↗

LexicMap:百万规模原核基因组的秒级和低内存的DNA序列比对

沈伟

重庆医科大学附属第二医院

毕业于第三军医大学,获理学博士学位;随后在重庆医科大学附属第二医院工作,现为副研究员,硕士生导师。主要研究方向包括基于高通量测序的难培养病原微生物检测技术,微生物基因组、宏基因组、大规模基因组数据检索等生物信息学算法与软件开发。目前以第一作者或共同第一作者在iMeta、Bioinformatics、mSystems、 Journal of Genetics and Genomics等期刊发表多篇论文,单篇最高引用1900余次(SeqKit)。个人主页http://shenwei.me.

序列比对是生物信息学中最基础且最重要的分析方法,其中最经典的工具是BLAST。然而,随着已测序微生物数量的持续增加,公共数据库中原核(细菌、古菌)基因组数量已达百万规模,远超现有序列比对工具的处理能力。本研究介绍LexicMap,一个用于在百万规模原核基因组中对基因、质粒、长读长测序数据进行高效序列比对的工具。其创新点在于:1) 采用基因组素描算法LexicHash计算序列比对种子(seeds),解决了该算法无窗口保证(window guarantee)的问题;2) 增加seeds后缀匹配支持,提高了seeds对突变的耐受能力;3)多级索引提供快速且低内存的可变长度seeds匹配。结果显示,对于长度≥1Kb的查询序列,在序列相似度80%-90%的范围内,LexicMap比Blastn更加敏感。在不同规模的数据库(GTDB、AllTheBacteria、Genbank+RefSeq)中的基准测试结果显示,LexicMap比对敏感度与现有方法相当或更敏感,而运行时间和内存占用远低于其它方法。在234万原核基因组中比对一个基因仅需要36秒(少见基因)-15分钟(16S rRNA基因)。LexicMap支持输出表格格式与直观的BLAST格式,代码开源于https://github.com/shenwei356/LexicMap.

已选择第 1 场:LexicMap:百万规模原核基因组的秒级和低内存的DNA序列比对沈伟

评论(0

登录后即可发表评论。

登录

暂无评论,来发表第一条评论吧!