第三六式
结果中的A,N, R2X, R2Y, Q2, R2, Q2分别代表什么意思,它们的值在什么范围比较好?
A,代表建模时主成分的个数;N代表分析的样本数;R2X 代表多元统计分析建模时,在X轴方向模型的解释率(或可以理解为X轴方向保留原始数据信息百分比的平方);R2Y代表在Y轴方向模型的解释率(或可以理解为X轴方向保留原始数据信息百分比的平方);Q2代表模型的预测率;R2代表模型验证时, 将原始分类的Y矩阵、n次不同排列的Y矩阵与R2Y、Q2Y进行线性回归,得到的回归直线与y轴的截距值分别为R2 和Q2;用来衡量模型是否过拟合。
第三七式
PCA得分图中为什么A2蓝方框和A1红圈会在圈外,是不是圈外的就表示结果不好,有什么方法改进?
这个圈圈表示95%的置信区间,圈外的点表示该样本的代谢谱和其他的所有分析样本的代谢谱的差异性大,一般样本数较大时会有一些离群点出现,是正常的现象,而且这两个离群点就在95%置信区间的周围,并未离得太远,建议保留,不需要做任何处理。
第三八式
GC/MS或者LC-MS中,圈外的点是什么原因造成的?能不能剔除掉?
圈外的点表示该样本的代谢谱与其他分组样本的代谢谱差别较大,出现的原因有很多(包括样本采集、储存、运输、前处理、分析等),可以剔除也可以不剔除,由于离群的并不远,为了保持数据的真实性,建议保留。
第三九式
*没有原始数据,组与组之间数据的平行性如何?
*如果平行性不好,如何确保检测结果的准确性?
*组与组之间内标峰的差异大吗?
*是根据内标峰面积还是峰高进行归一化处理?
*依据是什么?
*进行归一化处理用到的数据是解卷积之后的数据吗?
我们可以提供原始数据的,前三个问题应该都是想问如何保证组间差异是真实存在的而非人为因素引入的。关于组学的数据质量控制,主要看质控样本的聚类,质控样本是贯穿整个分析过程,只要质控样本聚类不错,那么数据的准确性就能保证。引起组内差异大的原因非常多,比如:个体差异、平行样本也有差异、前处理和分析过程中的引入的差异,由于有质控样本做数据质量控制,因此,前处理和分析过程中的引入的差异是可以排除的。关于归一化的问题:我们通常采用的是总峰面积归一化法,这也是一种非常常用的归一化方法。原始数据先进行去噪、解卷积、定性以及峰对齐后,才进行总峰面积归一化。
第四十式
在筛选出的N个差异代谢物中,有的代谢物在KEGG网站里找不到ID。在能找到ID的N-M个代谢物中有X种代谢物是样本中不存在的物质,既然样本中没有这种物质,为什么会被检测出来?(以奶牛样本为例)
我们搜库是基于人和动物的代谢组学数据库(Feinh库)搜的,因此应该说这些代谢物在人和动物里内都会有的内源性小分子,很多代谢物在KEGG 中没有对应的ID号,属于正常,KEGG并没有把所有的小分子代谢物都囊括进去,至于N-M个代谢物中有X种代谢物是奶牛血液中不存在的物质,这个结论是不正确的。有许多小分子代谢物在植物和动物体内都是存在的,植物的初级代谢物一般和动物的内源性小分子是相通的,只有次级代谢产物不同而已。另外Feinh库中的代谢物就是人和动物的小分子GC-MS数据库,它定性的结果应该是人和动物中都存在的小分子。
第四一式
PLS-DA和OPLS-DA模型有什么区别?
OPLS-DA比PLS-DA多了一个正交换算,把与模型分类不相干的信号过滤掉,因此OPLS-DA解释能力更强。比如组间差异比较小,组内差异比较大时,用PLS-DA的VIP筛选出的可能是组内差异变量,容易误导,而OPLS-DA则优于PLS-DA,可更准确地筛选出组间差异。
第四二式
PCA和OPLS-DA模型中,有些样本偏离了95%置信区间,这种数据需要剔除吗?
一般样本数较大时会有一些离群点出现,出现的原因有很多(包括样本采集、储存、运输、前处理、分析等),这是正常的现象,如果离群点在95%置信区间的周围,并未离得太远,建议保留,如果偏离太多,可以考虑删除此离群点。
第四三式
基峰图(BPC)和总离子流图(TIC)有什么区别?
基峰是在质谱图中,指定质荷比范围内强度最大的离子峰。
基峰图(Base Peak Chromatogram,BPC):是将每个时间点质谱图中最强的离子的强度连续描绘得到的图谱。
总离子流图(TIC):在选定的质量范围内,所有离子强度的总和对时间或扫描次数所作的图。
TIC和BPC都是对于样品整体信息的反映,一般情况下BPC图比TIC图要漂亮,所以文章里面很多时候会用到BPC图。但是有的学者认为BPC图不是样品真实的反映,所以不接受BPC,只接受TIC。
第四四式
代谢组学能够检测到的代谢物含量最低是多少?
不同检测平台的灵敏度不一样,LC-MS灵敏度最高,可达到fM级。另外,相同含量的不同物质,由于自身化学性质不同,质谱的离子化效率、信号响应强度会差异很大。物质的检测灵敏度跟自身的化学性质有关,化学性质的影响主要表现在离子化效率和质谱碎裂行为两方面。因此,相同含量的不同物质,可能一个能检测出来,另一个检测不出来。
第四五式
质谱时如何选择正离子模式还是负离子模式?
选择正负离子模式主要是根据化合物的性质,也就是看结构,有的物质容易带正电荷,有的物质容易带负电荷。比如碱性化合物易带正电荷,加合质子或其他正电荷离子;酸性化合物易带负电荷,失去质子或加合其他负电荷离子;而流动相环境影响分析的灵敏度。
比如含羧基、磺酸基的物质,一般肯定可以使用负离子模式,因为在一般情况下可以电离为R-COO-和R-SO3-;在酸性的流动相中,如pH3以下,羧酸根可能就不好电离成负离子了,这时负离子监测的灵敏度下降,而磺酸根酸性较大,仍然可以电离。
目前一般是正离子模式应用更多,一方面由于色谱柱的性质和流动相一般偏向酸性(pH2-8);另一方面,普遍采用的ESI离子源是一种超软电离的离子源,在酸性条件下大部分极性较大的化合物都可以加和氢离子,形成正电离子,如没有氮的黄酮类、脂类、糖类等。而且负离子模式相应一般比正离子模式小一个数量级。
因此,在实际操作时需要根据实际情况条件来选择,也可以两种模式都适用。
第四六式
差异代谢物筛选一般用什么标准?
一般同时采用多元变量统计模型的VIP值和单变量统计T检测的P值来筛选差异代谢物。单变量统计分析方法如t检验、方差分析等更加注重代谢物水平的独立变化,多元变量统计分析更加注重代谢物之间的关系以及它们在生物过程中的促进/拮抗关系。同时考量两类统计分析方法的结果,有助于我们从不同角度观察数据,得出结论,也可以帮助我们避免只使用一类统计分析方法带来的假阳性错误或模型过拟合。
筛选的阈值一般是VIP>1和P<0.05。如果得到的差异代谢物很多,可以再加上差异倍数这个筛选条件,FC>1.2和FC<0.83。
第四七式
如果筛选出的差异代谢物很少,该怎么办?
如果利用常用的阈值(VIP>1和P<0.05)筛选到的差异代谢物很少,首先可以把阈值设得更宽松些,如只用VIP>1,舍去p值。如果筛选出的差异代谢物还是很少,分为两种情况:1、组内差异太大,可能是样本准备的平行性不好,也可能是样本前处理或检测时做的稳定性不好;2、组间差异太小,那就是实验设计的问题。碰到这种情况,要么重做,要么就用过单维t test 和Fold change 去筛选差异代谢物。
第四八式
为什么在实验中物质A的含量明显大于物质B,然而在代谢组数据中物质B的信号强度明显大于物质A的信号强度?
由于不同物质具有不同的分子结构和性质基团,故不同物质在质谱的离子化效率、信号响应强度等参数都不尽相同,最后的结果是不同物质的质谱检测效率差别很大。因此比较代谢组学的定量结果,仅适用于同一物质在不同状态(实验/对照)间的比较,而不是不同物质在同一实验状态下的比较。
技术内容由鹿明生物代谢组学院出品返回搜狐,查看更多