GMAP最早用于讲EST/cDNA序列比对到参考基因组上,可以用于基因组结构注释。后来高通量测序时代,又开发了GSNAP支持高通量数据比对,这篇文章主要介绍GMAP,毕竟高通量转录组数据比对大家更喜欢用STAR, HISTA2等软件。

软件安装

下面是我源码安装的代码

wget http://research-pub.gene.com/gmap/src/gmap-gsnap-2018-07-04.tar.gz
tar xf gmap-gsnap-2018-07-04.tar.gz
cd gmap-2018-07-04/
./configure --prefix=$HOME/opt/biosoft/gmap
make -j 20

软件使用

如下步骤假设你有一个物种的基因组序列和对应的CDS序列,分别命名为"reference.fa"和"cds.fa"

第一步:构建GMAP/GSNAP索引数据库

GMAP/GSNAP对FASTA文件中每个记录下的序列的长度有一定限制, 每一条不能超过4G, 能应付的了大部分物种了。

构建索引分为两种情况考虑,第一种是一个fasta文件包含所有的序列

~/opt/biosoft/gmap/bin/gmap_build -d reference reference.fa

第二种则是每个染色体的序列都单独存放在一个文件夹里,比如说你下载人类参考基因组序列解压后发现有N多个fasta文件, 然后你就想用其中几条染色体构建索引

~/opt/biosoft/gmap/bin/gmap_build -d reference Chr1.fa Chr2.fa Chr3.fa ...

注: 这里的-d表示数据K库的名字,默认把索引存放在gmap安装路径下的share里,可以用-D更改.此外还有一个参数-k用于设置K-mer的长度, 默认是15, 理论上只有大于4GB基因组才会有两条一摸一样的15bp序列(当然是完全随机情况下)。

第二步:正式比对

建立完索引之后就可以将已有的CDS或者EST序列和参考基因组序列进行比较。

~/opt/biosoft/gmap/bin/gmap -t 10 -d reference -f gff3_gene cds.fa > cds_gene.gff3

其中-t设置线程数, -d表示参考基因组数据库的名字, 都是常规参数。我比较感兴趣的参数是如何将序列输出成GFF格式. GMAP允许多种格式的输出,比如说-S只看联配的总体情况,而-A会显示每个比对上序列的联配情况, 还可以输出蛋白序列(-P)或者是genomic序列(-E). 但是做结构注释要的gff文件,参数就是-f gff3_gene, -f gff3_match_cdna, -f gff3_match_est

参考文献

要想对一个软件有更好的认识,最好还是看看他们文章是怎么说的。

  • GMAP: a genomic mapping and alignment program for mRNA and EST sequences
    Bioinformatics 2005 21:1859-1875 Abstract Full Text, Thomas D. Wu and Colin K. Watanabe
  • Fast and SNP-tolerant detection of complex variants and splicing in short reads
    Bioinformatics 2010 26:873-881 AbstractFull Text, Thomas D. Wu and Serban Nacu

如何使用GMAP/GSNAP进行转录组序列比对相关推荐

  1. 提取变异的转录组序列

    参考:http://samtools.github.io/bcftools/bcftools.html 装bcftools $ tar -jxvf bcftools-1.8.tar.bz2 $ cd ...

  2. 【转录组】如何进行序列比对?

    经过原始数据的质量评估,去除低质量.含N.含接头等reads的步骤后,我们得到了clean data,然后我们就需要进行序列比对了. 序列比对的目的是:定位,也就是确认每条reads是否在基因组/转录 ...

  3. 如何对基因组序列进行注释

    基因组组装完成后,或者是完成了草图,就不可避免遇到一个问题,需要对基因组序列进行注释.注释之前首先得构建基因模型,有三种策略: 从头注释(de novo prediction):通过已有的概率模型来预 ...

  4. RNA-seq最新利器——全长转录组测序

    RNA-seq最新利器--全长转录组测序 1.三代测序技术PacBio SMRT Sequencing 2005年以来,转录组测序和研究的主流是基于NGS,即所谓的二代测序技术,虽然二代测序技术极大地 ...

  5. RNA-seq技术之转录组从头组装介绍

    RNA-seq技术之转录组从头组装介绍 转载2016-05-31 17:07:39 1.何为转录组组装 说起转录组组装,不得不先说新一代测序技术(next generation sequencing) ...

  6. 转录组分析_肠道菌群:宏转录组测序分析流程解读

    上回给大家讲述了16S测序分析 和 宏基因组测序分析,本期的宏转录组来啦~ 你知道吗?通过16S测序分析 和 宏基因组测序分析,我们只能够知道肠道菌群做好事或坏事的潜力,而并不知道它们此时此刻正在我们 ...

  7. r语言 转录本结构及丰度_肠道菌群:宏转录组测序分析流程解读

    上回给大家讲述了16S测序分析 和 宏基因组测序分析,本期的宏转录组来啦~ 你知道吗?通过16S测序分析 和 宏基因组测序分析,我们只能够知道肠道菌群做好事或坏事的潜力,而并不知道它们此时此刻正在我们 ...

  8. 从RNA-seq结果到差异表达

    从RNA-seq结果到差异表达 2011-09-12 ~ ADMIN 翻译自:From RNA-seq reads to differential expression, Oshlack et al. ...

  9. ALLHiC续: 如何构建Allele.ctg.table

    ALLHiC续: 如何构建Allele.ctg.table Allele.ctg.table是ALLHiC用于过滤多倍体基因组中因等位序列相似引起的HiC噪音的必要输入. 构建的方法有很多种,这里列举 ...

最新文章

  1. 【原创】源智工作流聚合步骤模型
  2. js如何循环拼接字符串
  3. gvim常用的配置及插件 -windows
  4. mysql虚拟机授权错误,windows下用navicat链接虚拟机MySQL数据库的过程和问题解决
  5. [置顶] VS自带工具:dumpbin的使用
  6. 十大震撼谷歌地图卫星照
  7. ARP使用及网络通信(查询、绑定MAC地址)
  8. python 3d游戏引擎哪个好_五大开源游戏引擎介绍
  9. Mcmod模组下载脚本
  10. WOW 最简单的插件入门,适合不知道怎么创建XML/自己写的插件始终不生效的
  11. 软件包管理:rpm和yum
  12. 看我如何破解一台自动售货机
  13. 双十一就该这么薅羊毛,MacBook、iphone13等万元壕礼等你领
  14. 计算机的诞生以及四个发展阶段,计算机发展历史的四个阶段
  15. GAMES101课程学习笔记—Lec 02:Linear Algebra 线性代数回顾
  16. Sublime 中快速打开网页
  17. 2021.05.20最少数量的箭引爆气球
  18. JS维护nginx反向代理,妈妈再也不用担心我跨域了!
  19. 使用URLRewriter进行URL重写失效
  20. linux 替换文件中的字符串

热门文章

  1. 韩国小姐选美连连看----android版
  2. 深入浅出 Laravel 路由执行原理
  3. 湖南省公务员考试计算机专业,湖南公务员考试专科专业分类目录_学科指导目录...
  4. python爬虫、第一个爬虫(基本知识,requests库,BeautifulSoup库,正则表达式re库)
  5. oracle分页改写为mysql_mysql和oracle分页
  6. 22年知网“研究生科学素养提升”在线测试
  7. 只要工具不要“霸”——百度搜霸与百度工具栏
  8. WIN10 WIN8 安装U8 安装IE Web Control 组件 环境检测通不过 所遇到的问题
  9. autojs之悬浮窗按钮暂停脚本~一种很笨的方法,但是可以实现暂停脚本的功能
  10. 这两年大量实体店灭亡,那么商机来了,什么东西又会崛起?