1、扩增子和宏基因组的结果为什么会不一致?
答:①两者的实验方法存在较大差异:扩增子是先扩增目标基因再测序,比如细菌扩增16S核糖体基因;宏基因组是针对所有基因进行测序;
②两者采用的物种注释方法及数据库存在一定差别:扩增子如16S,一般是用Silva数据库进行物种注释;而宏基因组则是将预测得到的基因与NR数据库比对进行注释,宏基因组注释得到的物种信息更为全面,不仅包括细菌,可能还包括真菌、古菌以及病毒等;
③扩增子和宏基因组分析得到的注释结果也会存在一定的相似性,比如在门水平上优势菌类别可能会比较相似,但低丰度的物种可能会差异较大;
④综上所述,两者的实验和分析方法本身存在一定的差异,是导致扩增子和宏基因组分析得到的注释结果存在差别的主要原因,但同时两者也有一定的相似之处,两者的结果可以相互验证,相互补充。
2、宏基因组测序数据量一般建议多大?
答:宏基因组一般建议测序数据量是10G左右,若样本有明确的宿主且实验前处理无法去除,则需要加大数据量。因为宿主数据占比可能会比较高,这会导致可用于后续数据分析的有效数据较少,比如体液样本(肺泡灌洗液、痰液等),动物组织,植物组织等,特别是小昆虫肠道(如蚊子或者蜱虫,可能整只直接混样宿主占比会较高),建议20G以上。如果后续还预期通过binning分析组装单菌基因组草图,所需的数据量会更大,比如30-50G。
3、宏基因组生物学重复如何建议?
答:生物学重复对于实验设计以及后续信息分析都非常重要,设置生物学重复主要有以下几个作用:
①能够消除组内误差:生物学重复可以测量变异程度;
②增强结果的可靠性:测序的样本越多,越能够降低背景差异,从而增加结果可信度;
③检测离群样本:异常样本的存在,会严重影响测序结果的准确性,通过后续信息分析可以发现异常样本,将其排除;
④每组至少要3个生物学重复才可以进行差异物种或差异功能分析。
一般情况下,自然环境中(比如土壤,根系,植物等)及模式动物(比如大鼠,小鼠等)建议每组至少3个生物学重复,推荐5个以上生物学重复;若是人类肠道,粪便等样品,由于个体之间差别较大(比如环境,饮食,遗传条件,健康状态等影响),建议加大取样量,每组建议 10个生物学重复(取样少,可能会导致组内差异大于组间差异而找不到差异物种或功能)。
一般建议多做生物学重复,若是遇到个体之间差别较大的情况可以选择剔除个别样本,避免只做3个重复剔除1个后只剩2个无法进行差异分析,后期再补送样本可能会出现由于批次效应问题导致重复性不好的情况发生。
4、有宿主的样本做宏基因组如何去除宿主?
答:①样本准备时尽可能避免取到宿主组织或细胞,比如取粪便时尽可能取中段里部,肠道内容物尽可能避免取到肠道组织;
②使用商业的去宿主DNA试剂盒(如QIAamp DNA Microbiome Kit),但由于效果无法保证,公司可能没有配置对应试剂盒。因此对于宿主无法避免的样本,比如组织或血液样本,老师可以自行购买试剂盒提取DNA之后送DNA样本进行测序;
③分析前提供宿主的基因组链接,可以把测序数据比对参考基因组去除宿主数据,剩余的数据进行后续分析;如果该物种没有参考基因组,可以使用近缘物种的基因组,如果近缘物种也没有基因组,就只能将物种注释里面属于动植物分类的去除掉。如果去宿主后的可用数据量较少,可能需要加大测序数据量,或者基于reads比对进行物种注释。
④无法避免宿主污染,建议增大测序数据量,分析剔除宿主信息后,尽可能多的剩余数据用于宏基因组的分析。
5、宏基因组组装中,为什么不建议把所有样本数据合并在一起进行组装?
答:①不同样本中高丰度物种的差异很大,如果把所有样本都混合在一起进行组装,将会大大增加数据的复杂度,组装效果可能会更差。因此一般是单个样本单独组装contig,再把比对不上的reads混合组装,分别预测基因后再进行聚类去冗余。除非是有效数据较少,可以把不同样本进行混合组装,避免因为单个样本数据量不足导致组装效果较差。
②混合组装相对消耗的运算资源大,且周期长。
6、三代宏基因组和二代宏基因组相比有什么优势?
答:(1)组装效果更佳
①高质量组装:由于三代读长更长(平均10kb),组装得到的Contig N50增长超过60%,轻松解决组装问题;
②更精确预测:基因数量提升16%,多获得30%完整基因;
③binning分析:Bins数量提高17%,甚至可以直接得到完整的细菌基因组;
(2)提高注释的准确度和分辨率,更真实反映菌群实际组成;
(3)深层次的功能挖掘,如抗性基因、移动元件、基因簇和病毒信息等。
但三代测序的错误率高,需要二代矫正;另外也需要结合二代数据计算基因相对丰度。
7、宏基因组可以分析抗性基因吗?
答:可以,一般通过以下两种方法:
将宏基因组组装得到的基因序列比对CARD耐药基因数据库(The Comprehensive Antibiotic Resistance Database,https://card.mcmaster.ca/),进行抗生素抗性基因注释;
利用ARGs-OAP抗生素抗性基因分析工具,基于SARG数据库(https://smile.hku.hk/SARGs),从宏基因组reads数据中鉴定并定量分析抗生素抗性基因。
8、宏基因组的物种注释NR和Metaphlan3的区别?
答:①NR物种注释是使用 BLASTP将非冗余的 Unigenes 对应的氨基酸序列与NCBI-NR 数据库进行物种的同源性 BLAST 比对,得到物种注释结果;
②Metaphlan3是基于 reads 对各样品的物种分布和组成进行分析,作为 NR 数据库的补充;
③总之,NR物种注释是基于unigene序列,而Metaphlan3是基于 reads比对,两者的结果可能会有部分一致,由于reads序列较短比对可能会不太准确,建议以NR物种注释结果为准;对于宿主含量非常高可用数据非常少比如1G以下,组装效果较差,建议使用基于reads比对的Metaphlan3。
9、宏基因组如何进行菌群间差异分析?
答:有几种基于序列特征的比较,包括样品间GC含量的比较,微生物基因组大小的比较,系统发育关系树的比较和功能组分的比较。许多比较分析都用到了关联统计学的方法,通常假设有几种元数据影响观测到的宏基因组群体的组分。主成分分析(PCA)和非度量多维标度(NM-MDS)用来图形化展示数据并揭示有哪些因素最影响数据。
有几种进行宏基因组比较分析的软件。第一个是MEGAN,可以比较两个或几个标准化后样品的GC含量。第二种是MG-RAST,提供了一种比较功能和基于序列的分析来上传样本。第三种是CAMERA,提供了BLAST接口可以比对40多种现有的宏基因组数据。
10、什么是宏基因组binning分析?
答:宏基因组分箱(Binning)是基于宏基因组测序得到的reads或contig 序列进行聚类分箱,主要是基于核酸组成(不同物种间核酸组成存在差异)和丰度信息(对contig来说就是测序深度,来自同一个物种的片段测序深度应该相近)。通过宏基因组分箱(Binning)有助于获得不可培养微生物的基因组序列,进行菌株水平的基因和功能注释、比较基因组分析、进化分析等。
目前binning有三种方案,基于reads、contigs或者基因,目前常用基于contigs的方案,相对序列较长,碱基具有代表性,运算消耗资源少,但是如果关心低丰度的菌,则建议用reads,因为contigs会在拼接的过程中丢失一些reads信息。基因层面损失的信息较多,应用不广泛。
您可能还喜欢: