基因组组装与错误结构比较

CGM第575期:突破 T2T 组装瓶颈:一款兼顾高时效性与低技术门槛的全基因组缺口填补工具

高重复区域的缺口为何难以自动填补?报告介绍GapSuite的可视化序列延伸和组装图工具,展示如何辅助完成复杂基因组的T2T组装。
赵贤嘉
赵贤嘉

上海交通大学生命科学技术学院 · 博士研究生

硕士期间由中国农科院深圳农业基因组研究所和郑州大学联合培养,现于上海交通大学生命科学技术学院攻读博士学位。长期从事基因组组装相关算法的研究,以及基因组组装的相关工作。研究对象主要为水稻。主要参与发表的论文位于《Advanced Science》、《Molecular Plant》以及《Horticulture Research》。

尽管端粒到端粒(T2T)组装已成为基因组学研究的前沿趋势,但其在复杂区域(如高度重复序列、着丝粒及 rDNA)的解析仍面临重大挑战。当前主流自动组装流程往往难以生成无缺口(Gap-free)的染色体序列,后续的手动补洞工作存在以下瓶颈:技术门槛高,极度依赖具备深厚 Linux 命令行及编程功底的生物信息学专家;时间成本昂贵,传统补洞过程通常耗时数周甚至数月,难以支撑大规模群体水平的 T2T 泛基因组分析;

我们开发的 GapSuite 工具盒集成了 Gap-Aid 与 Gap-Graph 两个互补工具,分别从一维序列延伸与多维组装图路径构建两个维度,实现了全流程的可视化操作:

Gap-Aid:基于序列延伸的概率引导策略

机制: 采用概率评分模型直观展示 长读长与缺口侧翼序列的比对一致性,引导逐步选择可靠序列延伸。

算法创新: 引入“一次性读长比对”策略。通过预先构建索引与过滤非缺口区域的读长,规避了传统工具在迭代延伸过程中的高计算负载,显著优化了时空效率。

原文研究示意图

Gap-Graph:基于组装图路径的拓扑识别策略

机制: 将染色体支架(Scaffold)与原始组装图进行联动可视化,使用户能精准识别缺口对应的节点与边,精准填补缺口。

算法创新: 开发了染色体-组装图优化对齐算法,有效解决了在大尺度染色体尺度下传统算法难以高效对齐图结构的难题。

原文研究示意图

实验验证与实证分析:  GapSuite 在多种物种及不同倍性基因组中展现出极高的准确性与鲁棒性:

极高性能指标:在拟南芥 100kb 人工缺口测试中,Gap-Aid 实现了 99.999% 的单碱基准确率,碱基插入率低至 0.02/100kb。对比测试表明,现有自动补洞工具在此复杂案例中均无法获得有效结果。

复杂人类基因组解析:针对人类 HG002 基因组着丝粒等极具挑战性的缺口,Gap-Graph 成功识别出可靠路径,补洞序列与官方参考序列高度一致。

跨物种实战能力:

籼稻: 成功构建首个 9311 T2T 基因组。基因组大小从 393Mb 增至 401.74Mb,QV 值从 31.55 跃升至 50.5。

杨树 : 填补了已发表单倍型基因组中包含线粒体相关基因及串联重复区域的 3 个关键缺口。

多倍体适配性:在模拟三倍体番茄基因组的 100kb 缺口测试中,经 k-mer 分布分析及共线性比对证实,GapSuite 填充序列与真实序列高度吻合。

参考文献

  1. Dong Xu, Xianjia Zhao, Lianguang Shang, Shaolong Tian, Yanchun Li, Huaming Wen, Qiang Xu, Dongxi Li, Weihua Pan. Time‐Efficient and Informatic‐Skill‐Light Gap‐Filling for Telomere‐to‐Telomere Genome Assembly. Advanced Science. 2026;13(14):e18319. DOI: 10.1002/advs.202518319

评论(0

登录后即可发表评论。

登录

暂无评论,来发表第一条评论吧!