大家可能听说过假基因,但假基因在生物体内真的没有功能吗?它在林木及其它植物基因组中的数量与分布规律如何,是如何起源与进化的?
围绕这些科学问题,北京林业大学林木分子育种创新团队率先开展了植物假基因的起源进化与功能解析,并取得了重要进展。
Evolutionary origins of pseudogenes and their association with regulatory sequences in plants 为题在线发表于 The Plant Cell 上。


假基因是什么
一般认为,假基因 (Pseudogenes) 是由功能基因通过复制或反转座事件形成,并以孟德尔方式在基因组中遗传至今,是功能基因的残余,被认为是基因组中的“化石”。
为了系统研究林木及其它植物假基因的起源进化及其调控功能,该研究团队开发了一套适合探测植物基因组假基因序列的生物信息学流程 (PlantPseudo),鉴定了重要模式树种杨树及其它共7个植物基因组的假基因序列。在杨树基因组中共鉴定出24,000 条假基因,发现平均有6% 的假基因具有表达活性,且展示了非常高的组织特异性。对杨树基因组长链非编码 RNA 与假基因的关系分析表明18.5%非 TE lncRNA 和 14.8% 的非 TE miRNA 起源于假基因的上游近端区域,揭示了假基因可能是新转录本产生的重要来源。为了验证这一机制在植物领域中的普遍性规律,研究进一步对6个其它被子植物物种假基因的演化及功能进行了系统分析。共确定了大约 250,000 个假基因,其中大部分比蛋白编码基因更加具有物种特异性。研究发现,在7个物种中相当大的一部分非编码 RNA 是来源于假基因近端上游区域,揭示了相当一部分的非编码RNA起源于假基因的差异化转录。

许多长链非编码RNA起源于假基因上游近端区域
通过解析不同物种染色体上假基因的分布规律,发现在基因组着丝粒附近有假基因富集现象,这主要是由于在着丝粒附近的基因重组率偏低所致。进一步分析表明,基因组重组率与假基因的分布密度存在极显著负相关性 (P < 0.03)。

基因组重组降低假基因频率
尽管许多假基因不能编码蛋白质,但有些仍可转录产生 RNA。分析发现,假基因的表达水平很低,但组织特异性表达能力较强。进一步研究发现,顺式调控元件在假基因上游区域有富集作用,包括转录因子结合位点和组蛋白修饰位点。这一结果表明,与随机的基因间隔区相比,转录因子结合位点优先富集在假基因上游近端区域,阐明了假基因通过提供转录因子结合位点发挥启动子和增强子的作用,以此来影响植物基因组的演化。因此,作者提出假基因转录调控区域的快速演变是驱动新调控模块起源的一个主要机制。

北京林业大学林木分子育种团队成员谢剑波副教授为论文第一作者,张德强教授为通讯作者,团队成员李英、刘晓敏、赵怡阳、李百炼与瑞典植物科学研究中心Pär Ingvarsson教授参与了该研究的具体实验与论文修订工作。该研究依托国家重点研发计划课题(No. 2016YFD0600102)与国家自然科学基金项目(31600537 与 31670333)。
论文链接:
http://www.plantcell.org/content/early/2019/02/13/tpc.18.00601
-bjfu1952-
来源 | 生物学院 高精尖中心
执行编辑 | 锤策返回搜狐,查看更多