概念 | 英文 | 解释 |
建库 | Library construction | 高通量测序前准备步骤。针对不同的研究目的建库方法不同。通常包括核酸样品检测、片段化、扩增、加接头、片段选择、纯化、浓度检测等步骤。 |
插入片段 | Insert size | 插入片段大小,决定测序的长度。 |
接头 | Adaptor | 接头,用于上机测序。建库时引入的接头序列与测序芯片(flow cell)上固定的接头相互识别。 |
测序的标签 | Barcode/Index | 测序的标签,用于测定混合样本,通过每个样本添加的不同标签进行数据区分,鉴别测序样品。 |
双端测序 | Paried-End | PE150:Paired End 双端。测序策略的一种,PE150指的是双端测序,每端测150bp。转录组测序默认选择的测序策略。 |
单端测序 | Single-End | SE50:Single end 双端。测序策略的一种,SE50指的是双单端测序,测50bp。 |
测序深度 | Sequencing depth | 测序得到的总碱基数与待测基因组大小的比值。假设一个基因大小为 2M,测序深度为 10X,那么获得的总数据量为 20M。 |
生物学重复 | Biological Replicates | 可以定义为使用来自不同抽提的 RNA 样本进行杂交,例如,同一来源独立制备的样本,或者不同来源的样本(不同组织或者一个细胞系的不同培养物)。 |
技术重复 | technical replication; | 使用同一个抽提的核酸进行实验称为技术重复。与生物学重复相比,技术重复不是完全独立的,取平均值不能去除共有的系统偏差。 |
原始数据 | Raw Data / Raw Reads | 测序下机得到的原始图像数据经过base calling转化而来的原始数据。 |
分析数据 | Clean Data / Clean Reads | 去除接头和低质量Reads后的数据,后续分析均基于Clean Data。 |
组装/拼接 | Assembly | 组装/拼接,即在没有参考序列的情况下进行序列拼接,对未知基因组或转录组序列进行测序,利用生物信息学分析手段,对序列进行拼接、组装,从而获得其基因组或者转录组本。 |
N50(或 N90) | N50(或 N90) | N50(或 N90):无参组装中,按照长度将拼接得到的片段从大到小排序,依次累加长度,到不小于总长 50%/90%的拼接片段的长度就是 N50(或N90)。 |
数据质量 | Q20/Q30 | Q20,Q30它们代表的是某一碱基质量值占全部碱基数的百分比,Q20代表的是碱基质量大于20的碱基占碱基总数的比例。测序时,每个碱基对应一个碱基质量值Phred,Phred=-10log10(e),e为该碱基的错误率。当某个碱基错误率为1%时,该碱基的Phred为20。 |
比对 | Alignment | 通过算法获取两个或多个序列之间的相似性判断其同源性。 |
Unigene | Unigene | 在无参转录组中,经过拼接得到的转录本并不一定完全是正确的,同时还会得到许多相似度很高、但长度不等的转录本,Unigene即为这些相似转录本的集合,根据设置的相似度阈值,将拼接组装得到的转录本进行聚类,得到的每一个聚类即为一个Unigene,属于同一Unigene的转录本被认为是同一个基因,从中挑选出长度最长的转录组作为该Unigene的代表进行后续的功能注释和表达水平计算。 |
基因组浏览器 | genome browser | 用于查看 mapping 结果的工具。例如:IGV,UCSC Genome browser。 |
基因注释 | Gene annotation | 基因注释,分为基因的结构注释和基因的功能注释。
|
编码序列预测 | CDS predict | CDS(coding sequence)序列是编码序列,是用来编码蛋白质的那段序列,是 mRNA 的一部分。CDS 预测是指通过一定的方式如序列比对、ORF 预测(estscan)来获取基因编码的核酸序列和氨基酸序列。 |
差异分析 | Differential analysis | 通过计算基因在不同样本中的表达量,比较基因表达差异。常见差异分析软件DESeq2(有生物学重复),edgeR(无生物学重复)。 |
差异倍数 | Fold Change | 即差异倍数。 |
差异基因 | Differential expression analysis | 根据设定的阈值和统计学检验结果,在不同组样品中表达水平具有显著差别的基因。转录组分析中,默认差异基因筛选参数为FDR<0.05,Fold Change≥2或者Fold Change≤0.5. |
富集分析 | GeneSet Enrichment Analysis,GSEA | 当分析差异基因时,根据特定的分类方法 (GO、KEGG等) 对基因进行分类,因为不同分类所包含的基因数目不同,如果只通过某一类基因中差异基因的数目评估这一类基因是否具有差异表达,得到的结果是不准确的,富集分析就是利用超几何分布或Fisher精确检验的方法,消除测序总体背景值和基因分类背景值的影响,能够准确阐明样品间不同类别功能基因是否具有差异。 |
进化树 | Evolutionary Trees | 在生物学中,用来表示物种之间的进化关系,又称“系统树”、“系谱树”。生物分类学家和进化论者根据各类生物间的亲缘关系的远近,把各类生物安置在有分枝的树状的图表上,简明地表示生物的进化历程和亲缘关系。 |
系统发生树 | Phylogenetic tree | 又称为演化树(evolutionary tree),是表明被认为具有共同祖先的各物种间演化关系的树。是一种亲缘分支分类方法(cladogram)。在树中,每个节点代表其各分支的最近共同祖先,而节点间的线段长度对应演化距离(如估计的演化时间)。 |
染色质可及性或者开放性 | Chromatin Accessibility | 真核生物中核小体是染色质的基本结构单位。DNA不是游离存在的,DNA与组蛋白结合后形成核小体,核小体进一步折叠压缩后最终形成染色质。DNA的复制、转录过程都需要将DNA的高级结构解开,类似于解压缩,但是只有一部分会被解开,这部分解开的区域被称为开放染色质(Accessible Chromatin),开放染色质允许调控因子(转录因子等)结合的特征称为染色质的可及性。 |
高通量测序(二代测序)
高通量测序技术(High-throughput sequencing,HTS)是对传统Sanger测序(称为一代测序技术)革命性的改变, 一次对几十万到几百万条核酸分子进行序列测定, 因此在有些文献中称其为下一代测序技术(next generation sequencing,NGS )足见其划时代的改变, 同时高通量测序使得对一个物种的转录组和基因组进行细致全貌的分析成为可能, 所以又被称为深度测序(Deep sequencing)。
Sanger法测序(一代测序)
Sanger法测序利用一种DNA聚合酶来延伸结合在待定序列模板上的引物。直到掺入一种链终止核苷酸为止。每一次序列测定由一套四个单独的反应构成,每个反应含有所有四种脱氧核苷酸三磷酸(dNTP),并混入限量的一种不同的双脱氧核苷三磷酸(ddNTP)。由于ddNTP缺乏延伸所需要的3-OH基团,使延长的寡聚核苷酸选择性地在G、A、T或C处终止。终止点由反应中相应的双脱氧而定。每一种dNTPs和ddNTPs的相对浓度可以调整,使反应得到一组长几百至几千碱基的链终止产物。它们具有共同的起始点,但终止在不同的的核苷酸上,可通过高分辨率变性凝胶电泳分离大小不同的片段,凝胶处理后可用X-光胶片放射自显影或非同位素标记进行检测。
全基因组测序(Whole Genome Sequencing)
全基因组重测序是对基因组序列已知的个体进行基因组测序,并在个体或群体水平上进行差异性分析的方法。随着基因组测序成本的不断降低,人类疾病的致病突变研究由外显子区域扩大到全基因组范围。通过构建不同长度的插入片段文库和短序列、双末端测序相结合的策略进行高通量测序,实现在全基因组水平上检测疾病关联的常见、低频、甚至是罕见的突变位点,以及结构变异等,具有重大的科研和产业价值。
de novo测序
de novo测序也称为从头测序:其不需要任何现有的序列资料就可以对某个物种进行测序,利用生物信息学分析手段对序列进行拼接,组装,从而获得该物种的基因组图谱。获得一个物种的全基因组序列是加快对此物种了解的重要捷径。随着新一代测序技术的飞速发展,基因组测序所需的成本和时间较传统技术都大大降低,大规模基因组测序渐入佳境,基因组学研究也迎来新的发展契机和革命性突破。利用新一代高通量、高效率测序技术以及强大的生物信息分析能力,可以高效、低成本地测定并分析所有生物的基因组序列。
全外显子测序(whole exome sequencing)
全外显子组测序是指利用序列捕获技术将全基因组外显子区域DNA捕捉并富集后进行高通量测序的基因组分析方法。外显子测序相对于基因组重测序成本较低,对研究已知基因的SNP、Indel等具有较大的优势,但无法研究基因组结构变异如染色体断裂重组等。
RNA测序(转录组测序或RNA-seq)
转录组学(transcriptomics)是在基因组学后新兴的一门学科,即研究特定细胞在某一功能状态下所能转录出来的所有RNA(包括mRNA和非编码RNA)的类型与拷贝数。Illumina提供的mRNA测序技术可在整个mRNA领域进行各种相关研究和新的发现。mRNA测序不对引物或探针进行设计,可自由提供关于转录的客观和权威信息。研究人员仅需要一次试验即可快速生成完整的poly-A尾的RNA完整序列信息,并分析基因表达、cSNP、全新的转录、全新异构体、剪接位点、等位基因特异性表达和罕见转录等最全面的转录组信息。简单的样品制备和数据分析软件支持在所有物种中的mRNA测序研究。
small RNA测序
Small RNA(microRNAs、siRNAs和 pi RNAs)是生命活动重要的调控因子,在基因表达调控、生物个体发育、代谢及疾病的发生等生理过程中起着重要的作用。Illumina能够对细胞或者组织中的全部Small RNA进行深度测序及定量分析等研究。实验时首先将18-30 nt范围的Small RNA从总RNA中分离出来,两端分别加上特定接头后体外反转录做成cDNA再做进一步处理后,利用测序仪对DNA片段进行单向末端直接测序。通过Illumina对Small RNA大规模测序分析,可以从中获得物种全基因组水平的miRNA图谱,实现包括新miRNA分子的挖掘,其作用靶基因的预测和鉴定、样品间差异表达分析、miRNAs聚类和表达谱分析等科学应用。
微小micro RNA测序
成熟的microRNA(miRNA)是17~24nt的单链非编码RNA分子,通过与mRNA相互作用影响目标mRNA的稳定性及翻译,最终诱导基因沉默,调控着基因表达、细胞生长、发育等生物学过程。基于第二代测序技术的microRNA测序,可以一次性获得数百万条microRNA序列,能够快速鉴定出不同组织、不同发育阶段、不同疾病状态下已知和未知的microRNA及其表达差异,为研究microRNA对细胞进程的作用及其生物学影响提供了有力工具。
Chip-Seq测序
染色质免疫共沉淀技术(Chromatin Immunoprecipitation,ChIP)也称结合位点分析法,是研究体内蛋白质与DNA相互作用的有力工具,通常用于转录因子结合位点或组蛋白特异性修饰位点的研究。将ChIP与第二代测序技术相结合的ChIP-Seq技术,能够高效地在全基因组范围内检测与组蛋白、转录因子等互作的DNA区段。
ChIP-Seq的原理是:首先通过染色质免疫共沉淀技术(ChIP)特异性地富集目的蛋白结合的DNA片段,并对其进行纯化与文库构建;然后对富集得到的DNA片段进行高通量测序。研究人员通过将获得的数百万条序列标签精确定位到基因组上,从而获得全基因组范围内与组蛋白、转录因子等互作的DNA区段信息。
RIP-seq测序
RNA Immunoprecipitation是研究细胞内RNA与蛋白结合情况的技术,是了解转录后调控网络动态过程的有力工具,能帮助我们发现miRNA的调节靶点。这种技术运用针对目标蛋白的抗体把相应的RNA-蛋白复合物沉淀下来,然后经过分离纯化就可以对结合在复合物上的RNA进行测序分析。
RIP可以看成是普遍使用的染色质免疫沉淀ChIP技术的类似应用,但由于研究对象是RNA-蛋白复合物而不是DNA-蛋白复合物,RIP实验的优化条件与ChIP实验不太相同(如复合物不需要固定,RIP反应体系中的试剂和抗体绝对不能含有RNA酶,抗体需经RIP实验验证等等)。RIP技术下游结合microarray技术被称为RIP-Chip,帮助我们更高通量地了解癌症以及其它疾病整体水平的RNA变化。
靶向捕获测序
靶向测序是将感兴趣的基因组区域通过捕获试剂盒进行富集后进行测序的研究策略,根据不同的应用,利用较少的数据量就能得到超高的灵敏度和准确度,实现变异位点的快速筛选。相较全基因组测序和全外显子测序,靶向测序能够聚焦所关注的区域,去除冗余数据的干扰,同时最大限度地利用测序reads,测序成本低且测序深度深,尤其适用于在临床应用中样本量少时的选择。例如人类全基因组大小约为3Gb,外显子区域仅占2%(约60M),全基因组测序(WGS)深度一般为30X—50X,单样本数据产出为90Gb-150Gb,全外显子测序深度一般为100X-200X,数据产出为6-12Gb,而针对一个目标区域大小为2M的panel来说,测序深度2000X,数据量也仅为4Gb。
单细胞测序
单细胞测序技术是指能够在单个细胞的水平上,对基因组或转录组进行高通量测序分析的一项新技术。与传统高通量测序相比,单细胞测序不仅能够分析相同表型细胞的异质性,还能获取难以培养微生物的遗传信息以及珍贵的临床样本的信息,具有广阔的应用前景。