
测序、组装与科研分析问答
本文整理自2020年社区讨论,原文未提供发言者姓名。工具建议是历史经验;提及的Hi-C热图未随本次可恢复的来源保存。
问题:各位大佬,有没有什么快点的工具,给一个region,找每个base coverage,然后算下这个region里面coverage的coefficient of variation,谢谢~
pysamstats也许可以。目力所及,只知道这个
minimap2可以从fasta 到SNP
每个base的coverage可以用samtools pileup
我发现samtools pileup和depth算出来不一样,查了一下是因为pileup没算上N的情况,所以最后决定用了countcoverage
问题:请教个小白问题。如何定义genomic diversity 和 genetic diversity?
感觉应该是一个意思。有的文章用genomic diversity可能是因为用了全基因组测序或者别的高通量方法吧。我瞎猜的,请懂的人来答[呲牙]
对我们popgen researcher 而言没听说过genomic diversity。Genetic diversity倒是可以有,可以有nucleiotide diversity across the genome。那推荐你读一读matt Hahn的书Molecular population genetics。以前那些popgen的书都是二代测序之前的,很多新东西没加进去。他这本算是新且总结得不错。这本书适合有一定popgen基础和hands on经验的人
展望未来部分,还有用machine learning做PopGen的
Schrider, DR, and Kern, AD. (2016). S/HIC: Robust identification of soft and hard sweeps using machine learning. PLoS Genetics. 12: e1005928.
**问题:请问有谁做过利用SNP数据 不同品种之间差异的渐渗分析吗?谢谢 **
是这个吗?Mapcaller
问题:請教一下,HiC 圖中出現了一個大十字是什麼意思[捂脸][捂脸][捂脸]怎麼解釋
一般在没有normalize的图中才出现这种现象。normalize以后就好了。
這個怎麼 normalize 呢
ICE就行。juicebox也可以选择normalization的。推一波我的知乎Live~。《3D基因组分析从入门到进阶》。
热图是正常了,但是感觉很多没聚类在一起的contig。可以看看juicebox的youtube频道,他们录了几个操作视频
如果有遗传图谱的话,可以试试唐海宝老师的Allmaps,可以把HiC,遗传图谱结合起来做scaffolding。https://github.com/tanghaibao/jcvi/issues/44
问题:请问了解HiC的朋友可以帮我看看这张热图怎么样么?[捂脸](我给公司draft assembly和植物材料,公司做的HiC sequencing和scaffolding,给了我一个有8个pseudo-molecules的assembly),我之前无比相信这8个pseudo-molecules就是那8条染色体,但把这个assembly和我们实验室之前构建的linkage map比了一下(把建linkage map用的GBS markers align到基因组上),发现一个linkage group里有来自几个pseudo-molecules的片段(反之也是,一个pseudo-molecule里有位于几个linkage groups的markers)
软件默认跑的结果会有很多的链接错误。尤其当组装的contig比较多,或者repeat比例高的时候。
想问一下~有人用过mapcaller么,结果准确性咋样呀~[呲牙]
还可以,但是只能对单样本使用,多样本同时call snp目前还不支持。除了不支持 joint variant calling 用的时候还是有些小问题,比如输出格式有些情况不是很标准等等,不过提 issue 开发者会很快回应。如果确实是为了追求速度可以试试。
问题:想问一下, 有人知道如何鉴定某一转座子家族比如LTR/Gypsy/Athila的single consensus sequence吗?
TEsorter
问题:samtools mpileup calling Indels 是不是有长度的限制?目前发现10bp以下的vcf有显示,好几个大于50bp的,直接不显示。
大于50bp是SV的阈值吧~[呲牙]
自吹自擂下,可以考虑我的软件Varathon (https://github.com/yjx1217/Varathon) , 之前在群里做过一次广告,不过当时还不太成熟,后来又改了很多细节,现在应该比较成熟了,文章还在准备中,比预想的慢很多,唉[捂脸]
问题:请教各位老师,我用EDTA注释TE,最后生成的*EDTA.TElib.fa大小为30M, 12113条sequences,另外一个品种是以前非EDTA注释的,lib大小为70M,22000+条sequences。EDTA运行过程中并未报错,这是否合理?
EDTA会去冗余。做过滤的就是EDTA_processI.pl
顺势请教一下,我有一些te,不是完整的,能搞清楚现在还剩哪些结构单元吗?@区树俊 ISU
通过同源比对可以识别不完整TE, 然后可以看看对应的结构是啥。
同时TEsorter, GenericRepeatFinder, LTR_retriever 和 LTR_Finder都有conda版了。现在安装很方便,运行conda install -c bioconda edta就搞定了
问题:上次有小伙伴说在线go annotation是哪个工具?多谢了先
Toppgene, David, enrichr
对于未知sequence的你可以用我们lab的sever叫phylo-PFP。根据phylogenetic和sequence similarity来predict GO。
问题:求推荐蛋白—蛋白互作的数据库,细菌,酵母,动植物的都可以🙏
CAAS biogrid。基本都全了
请教一下各位老师,我已经将所有的TE序列分类,群里是否有老师做过如何对某一类比如LTR/Gypsy/CRM中的所有序列create consensus sequence?可否推荐一些软件?谢谢
RepeatScout可以
问题:google检索的时候,偶尔能够发现一些国外很不错的博士thesis,那么问题来了,我蛮好奇国内外的博士论文是不是有一个库,可以检索呢?
高校里面有自己的毕业论文库,论文大都是开放的,可以供下载的。或通过学校图书馆进入ProQuest查学位论文 。
问题:可以弱弱问一下大家有没有人做过allele-specific DMR的鉴定?如果从比对文件类似sam file里提取SNP-containing reads, 会不会由于sam file包含一些不完整的clipped reads出现一些问题?有没有人用什么软件这样做过?可以问下用的具体什么软件吗? 如果此方法不行果此方法不行,是否有一个更好的方法?求指教[Salute] 提前谢谢大家…
在此自荐我之前做的DNA甲基化工具BS-Seeker2(http://pellegrini.mcdb.ucla.edu/BS_Seeker2/)和CGmapTools(https://cgmaptools.github.io)。其中,CGmapTools中40个分析功能中,就能实现您提到的DMR,ASM和SNP prediction。这里还有一份我的研究生整理的PPT文档说明:http://guoweilong.github.io/BSseeker2_CGmapTools_tutorial_181014.pdf 。希望能有帮助。
问题:请问有人用过HERA么?
我没有bionano数据,输入了一个canu+scaff10x的assembly和canu corrected PacBio reads,参数都用的默认,然后它把我的assembly分成了Large_Contig.fasta和Small_Contig.fasta,最后输出的结果基本就是Small_Contig.fasta [捂脸] 我想知道是哪里出了问题
这软件bug太多,试了一次没成功就不用了!我们实验室用的bionano scaffolding
问题:准备multi panel 图片怎么效果最好?我目前就是在ppt里面放在一块crop一下,再save成图片。感觉分辨率损失不少?而且许多时候背景镂空,怎么让背景白板,再加一个图框重组和吗?有经验的分享一下工具等?
Inkscape免费。Mac 下面PowerPoint打印,然后选择保存为PostScript格式也能防止分辨率损失。
在地图上高亮几个区域,应该怎么搞。ggplot2, ggmap
这个markdown应该能帮到你 https://www.r-spatial.org/r/2018/10/25/ggplot2-sf.htm
问题:请教大家,使用二代数据call 植物的SV 和 CNV,有没有什么比较好的pipeline的推荐?
我自己的,用拟南芥测试过:https://github.com/yjx1217/Varathon.git
也可以试试https://github.com/dnanexus/parliament2,整合了Breakdancer, Breakseq2, CNVnator, Delly2, Manta, and Lumpy软件,提供docker镜像
问题:我有一个人类的低深度测序数据(6X),想要对某个基因区域重构haplotype,大家知道有什么好的imputation+phasing的平台?
reveel 可以做 genotyping 然後用 beagle 之類的 phase。Depending on the population of your data. 可以用Michigan imputation server, 可以用hrc做phasing reference
**问题:大家好,有没有推荐的call large-size structure variation的工具?我有几个已经用pacbio data assembled的genomes,想从中找一些结构变异。 **
Bionano solve。它是利用restriction enzyme site的pattern来识别的,所以边界不是非常准确
用mummer做alignment,syri找结构变异吧,19年发的GB
如果你已经有pacbioAssembly了可以试试我们合作者开发的mum&co,刚发在bioinformatics上
以上内容整理自CGM微信群(第一群)。感谢各位群友的热心回复。
参考文献
- Schrider DR, Kern AD. S/HIC: Robust Identification of Soft and Hard Sweeps Using Machine Learning. PLOS Genetics. 2016;12(3):e1005928. DOI: 10.1371/journal.pgen.1005928
评论(0)
登录后即可发表评论。
登录暂无评论,来发表第一条评论吧!