ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

完整基因组组装:从T2T概念到HiFi/ULRA实战指南

完整基因组组装:从T2T概念到HiFi/ULRA实战指南 最近被问得最多的一个词就是“完整基因组”。以前大家打招呼问“你的基因组组装到染色体水平了吗”现在一开口就是“做没做成T2T”“gap还剩下几个”。凌恩提出的“打造动植物完整基因组新概念”本质上就是在推动一个范式升级我们不再满足于“参考基因组大致覆盖”而是要把每一条染色体的最后一段复杂区域都拼出来。这篇文章我想从科研实操的角度把这个概念拆开揉碎讲清楚——它到底升级了什么技术路线该怎么走项目里哪些坑是文档里不会告诉你的。适合看这篇内容的人大概是这几类准备启动动植物基因组项目但还没确定策略的PI和博士生已经拿到一批HiFi和Hi-C数据、正在纠结怎么处理的分析人员以及做育种、群体遗传、进化研究想理解“完整基因组”能给自己的研究带来什么新答案的同行。我会尽量把原理和实操串起来讲保证新手能看懂老手也能找到值得抠的细节。1. 从参考草图到端粒到端粒完整基因组到底升级了什么1.1 过去十年我们手里的基因组其实是“拼图缺了几块”先回顾一个场景。几年前我们完成了一个动植物物种的基因组项目当时的结果放在今天的标准下看其实属于“能用但不完整”染色体挂载率超过98%N50做到几十Mb甚至上百MbBUSCO的完整度也在95%以上文章里写“高质量参考基因组”毫不心虚。但如果你用IGV去看具体区域马上会发现两件事第一序列上排布着大量由“N”组成的gap短则几百bp长则几Mb乃至几十Mb第二rDNA簇、着丝粒卫星DNA、亚端粒区域这类高重复序列几乎全部落在gap里相当于这些位置整段整段地失踪了。为什么会这样因为在二代测序时代read长度只有150bp左右跨越不了复杂重复区。组装时遇到这些区域算法没有足够的信息判断前后序列怎么连接就只好用N占位。后来有了三代长读长测序情况好转很多但PacBio传统长读长和ONT早期数据的单碱基错误率偏高组装软件对高度一致的串联重复区依然力不从心。这就导致很多基因组虽然“挂上了染色体”但内部其实还留着一堆黑洞。1.2 T2T基因组的评判标准不是“挂载率”而是“零N”真正让行业震动的是人类T2T联盟发布的完整人类基因组每条染色体从端粒到端粒只有一条连续序列没有gap着丝粒的α卫星、近着丝粒的beta卫星、rDNA阵列、片段重复全部被解析出来。这个结果让大家意识到基因组组装的终点不是N50足够大而是每个碱基都有确定的位置和顺序。于是“完整基因组”这个概念在动植物领域迅速热起来。按目前被广泛接受的“端粒到端粒”标准一套合格的T2T候选基因组至少要满足三个条件每条染色体对应一条完整连续的序列序列内部不含有未知碱基N每条序列的两个末端都能鉴定出端粒重复序列证明从端粒到端粒这条路径被封住了着丝粒区域、rDNA等主要复杂结构被解析而不是依然被gap占据。这里要特别提醒一句不要只盯着“没有N”看。有些组装结果确实没有N但着丝粒区域是“拼错”的比如把一段低复杂度序列通过污染或者嵌合错误硬拼上了这种情况比显性的gap更麻烦因为它不会在常规的N50、BUSCO指标上暴露问题只有在做共线性分析或结构变异检测时才露馅。1.3 为什么动植物基因组的“完整路”比人类更难走人类基因组那么难拼动植物其实更难难点主要在三个维度上放大。第一个是基因组大小。人类只有约3.1Gb很多农作物比如小麦大约16Gb松树类则高达20Gb以上。基因组越大重复序列占比越高组装消耗的计算资源和测序数据量也线性上涨。第二个是杂合度。很多野生植物、贝壳类、海洋物种杂合度在1%到2%以上还有很多物种是二倍体甚至多倍体已经成型的Phased assembly还要考虑单倍型分型的问题。第三个是倍性背景下的重复结构复杂性。同源多倍体里不同亚基因组之间的序列相似度极高Hi-C信号会把它们“粘”在一起分染色体时非常容易把亚基因组搞混。所以说动植物T2T不是简单地把人类那套pipeline搬过来用每个物种都需要定制化策略。这也是为什么“完整基因组作为新概念”在动植物圈落地时核心不是某一种测序技术而是“平台组合算法适配人工校验”的整套体系。2. 技术路线选型HiFi、ULRA与Hi-C的组合逻辑2.1 三代测序为什么是完整基因组的“底牌”要把复杂重复区从g ap里捞出来最核心的前提是读长足够长最好一条read就能覆盖一个重复单元阵列的长度。目前在完整基因组项目里能扛大梁的测序平台有两类。一类是PacBio HiFiCCS模式read长度一般15-25kb单碱基准确率在99.9%以上。它的优势在于精度高组装时会得到正确的碱基序列后续做基因注释、SNP检测、甲基化分析都更稳。很多成功的T2T项目比如拟南芥Col-0的完整基因组、水稻的多个T2T版本都以HiFi为主力。另一类是ONT Ultra-longULRAread长度可以到100kb甚至200kb以上虽然单碱基准确率赶不上HiFi但超长读长在跨越rDNA阵列、着丝粒串联重复这类超长高重复区时优势突出。人类T2T项目的核心支撑之一就是超长ONT reads。我个人的经验是完整基因组项目不要指望单靠一种平台。HiFi负责“拼得准”ULRA负责“连得通”Hi-C负责“挂得对”三者缺一不可。市面上一些项目只上HiFi不做ULRA结果就是rDNA和着丝粒区域留下的gap依然很多反过来只用ULRA不用HiFi拼接出的序列碱基错误率偏高后续注释和变异检测的麻烦都很大。2.2 Hi-C在建图和纠错中的不可替代角色Hi-C数据在很多人的理解里只是“把contig挂到染色体上”的工具但对完整基因组项目来说它的作用远不止于此。在组装完成后Hi-C有两个关键用途。第一个是验证contig的排列方向是否正确尤其是大基因组里跨着丝粒两臂的contig方向反了会导致整条染色体结构错误。第二个是辅助处理多倍体或高杂合物种的染色体重叠利用染色质交互频率可以较准确区分亚基因组或同源染色体对。此外用Hi-C heatmap做最终交付前的QC几乎是一票否决制如果热图上出现大块“断崖”或者明显对称的斜线错位说明还有结构问题必须回到组装层面处理。有一个细节容易被忽略Hi-C文库的酶切策略会影响复杂区域的信号。常见的是内切酶消化方案如MboI/HindIII在GC偏好较明显或染色质致密的异染色质区域酶切位点密度不高时信号会偏弱。所以如果目标物种异染色质占比高可能需要考虑DNase I或更加均匀的酶切方案或者用另一种酶做cross-check。2.3 选型策略表不同物种类型用什么组合针对不同物种特征这里给一个选型参考方便项目启动时直接对号入座物种特征建议测序组合说明基因组2Gb纯合度较好30-50x HiFi 100-200x Hi-C低成本起步gap剩余一般可控基因组2-8Gb杂合度1%-2%40-60x HiFi 40x ULRA 100x Hi-C重点靠ULRA跨高重复区基因组8Gb如松科、小麦60x以上HiFi 60x以上ULRA 150x Hi-C分区组装单倍型分型并行高杂合/多倍体物种HiFi 亲本或近缘参考辅助先做单倍型分型再组T2T一致性序列注意一个原则覆盖度不能只看“测了多少倍”还要看reads覆盖是否均匀。GC异常区域和重复区在测序中天然倾向被压低建议在提取高分子量DNA时尽量保证片段化目标一致避免过度机械打断导致长读长缺失。我见过不少项目测序上机前DNA完整性不错但抽提后保存不当降解严重结果长reads比例骤降ULRA形同虚设这是非常可惜的浪费。3. 从测序到无gap染色体完整基因组组装全流程3.1 数据质控与k-mer预估正式开工前的20分钟很多人拿到数据后第一件事是直接跑组装这是新手最容易犯的错误。组装软件虽然一代比一代强大但如果你根本不了解这个基因组的真实特征后续所有判断都会失准。我习惯的做法是先用KMC或GCE做一次k-mer分析估算三件事——基因组大小、杂合度、重复序列比例。基因组大小直接决定你测序覆盖度够不够杂合度决定组装时要不要开phasing模式、要不要跑双单倍型装配重复序列比例决定对ULRA读长的依赖程度。如果k-mer曲线在主峰旁边有一个明显的肩峰或者副峰出现高度接近的杂合峰那么你应该把hifiasm的--ul参数打开配合ULRA reads把两个单倍型都组装出来。如果重复峰占比超过60%比如小麦这种那么再多的HiFi可能也压不住重复区必须提前规划ULRA补测。这一步花不了多少时间但能让你在后续每一步都心里有数。我甚至建议把k-mer结果和染色体核型信息对照一下一些物种的真实基因组大小和参考数据库里的说法差距极大直接用数据库里的数字会严重误导覆盖度判断。3.2 组装软件怎么选hifiasm与verkko的取舍逻辑目前做完整基因组绕不开两个主流方案hifiasm和verkko。hifiasm从HiFi时代起就是事实上的主力。它的速度、内存可控性和双单倍型组装质量都很成熟而且对Hi-C数据有良好的挂载支持hifiasm-hic。对于大多数动植物基因组hifiasm跑出来的primary assembly质量已经相当能打。不过要注意的是hifiasm对超长ONT的整合方式比较“直接”在许多超复杂区域它默认处理的倾向是把短而准确的HiFi read作为主干ULRA只是辅助gap跨越如果你真想以ULRA为主去突破某个超大rDNA簇可能需要手动构造杂交组装输入。verkko是T2T联盟开发的多平台组装器最大的特色是把HiFi、ULRA和Hi-C整合到同一个分阶段组装图里对超长复杂区域的处理更友好。缺点是用起来比hifiasm重不少尤其是在计算资源和参数调参上对新手不算友好。我的建议是常规物种先用hifiasm跑主流程遇到ULRA数据比较充足且重复区极复杂的目标基因组时再叠加verkko对比验证。两个结果都保留用ULRA数据二次人工检查哪个版本的结构更可靠。还有一点很重要单倍型分型后的“一致性组装”未必适合所有科学问题。如果你关注的是物种本身的代表性基因组可以只保留primary assembly但如果你关注的是杂合结构变异或者等位基因差异那就要把两个单倍型分别组装并注释这对后续泛基因组分析特别有价值。完整基因组的“完整”应该是尊重自然状态的完整而不是强行压制成单倍型。3.3 gap填补与端粒鉴定把“最后一段路”走完组装流程结束后不会自动得到一条完美的T2T序列。因为某些区域即便是HiFiULRA也无法一次到位需要针对gap区域单独做gap filling。目前比较常用的工具有几类基于长读长的TGS-GapCloser、基于二代RagTag以及整合Hi-C信号的LACHESIS严格说挂载工具。实操中发现TGS-GapCloser对多平台长读长的利用效率比较高跑一轮之后很多小gap能关闭。但要注意“补上”不等于“正确”特别是着丝粒区域因为卫星重复的单元极其相似软件有可能把多个单元错位拼接产生人为的嵌合结构。所以gap filling之后必须再跑一轮Hi-C挂载验证和BUSCO并且人工检查gap两侧的比对情况。端粒鉴定的工作也别忽略。一个T2T序列是否真正到达染色体末端看的是有没有端粒重复序列植物一般是TTTAGGG的重复动物是TTAGGG重复。可以用TelomereBuilder、pyGenomeTron或简单的RepeatMasker检出端粒motif并确认它们出现在每条序列的两个末端。我踩过一次坑某条染色体一端没有端粒原因是染色体臂末端有一段极端GC富集区域测序reads覆盖极低组装时被软件“截断”了。后来补了一轮超长reads才把末端追回来。这提醒我T2T验收阶段不能只看中央的复杂区末端同样要检查。3.4 组装结果验证不只看N50和BUSCO拿到组装结果后验证环节要做到“多维度交叉验证”。常规指标N50、BUSCO、QUAST报告这些只能说明“切出来的序列有东西”不能说明“这些序列连法正确”。完整基因组项目的验证起码要做四件事。第一件事是比对回HiFi reads检查碱基正确性推荐Merqury或yak用k-mer sets评估组装的一致性和完整性能得到QV值和完整度分数。对T2T项目来说QV40是一个比较公认的门槛值。第二件事是Hi-C heatmap目检确保每条染色体热图上方块清晰、边缘整齐没有明显错挂或方向翻转。第三件事是端粒和着丝粒motif检测着丝粒区域如果确实是卫星重复阵列至少能检出代表相应物种的着丝粒repeat否则这个区域很可能是嵌合错误。第四件事是共线性分析如果有近缘参考基因组可以用minimap2mummer做全基因组比对检查组装版本之间是否存在大片段重排或倒位。很多项目“看起来满分”却在发表后被质疑往往就死在第四步没做扎实。尤其是多倍体物种不跟参考基因组做共线性很难发现亚基因组数量或位置分配的严重问题。4. 完整基因组项目的“隐藏工作量”注释与复杂区域解析4.1 从头注释的完整策略别再只跑一个maker完整基因组拼好了下一步就是功能区域解析。很多人把注释简化为“跑一个软件”这远远不够。一套完整的从头注释需要四个层面协同重复序列鉴定与屏蔽、基于同源蛋白的基因预测、基于转录组的证据辅助预测、以及最终的整合与质量过滤。重复序列屏蔽建议用RepeatModeler从头构建物种特有的重复库再用RepeatMasker屏蔽。这一步对动植物基因组尤其重要因为转座子占比高如果屏蔽不干净后续基因预测会混入大量假基因。转录组证据不能省略。除非你的物种有高质量的同源蛋白库否则至少要做2-3个组织的RNA-seq取覆盖全部发育阶段和组织类型的样本为每个基因提供剪接异构体证据。我看到不少项目因为节省测序成本跳过转录组结果注释出的基因5端或3端严重残缺后续做功能分析时根本拿不出完整的CDS。整合阶段建议走BRAKERLiftoff两条腿再把证据合并成最后的注释集。Liftoff适合有近缘高质量注释的情况可以快速把参考注释映射过来效率比de novo高很多但前提是物种间共线性足够好。4.2 着丝粒和rDNA区域完整基因组真正的“增值点”如果说编码基因的注释还属于常规操作那完整基因组带来的真正增量就在重复区解析。这些区域在传统基因组里是n个N如今终于有了真实的序列。着丝粒区域通常由大量串联卫星重复组成能够提供两个层面的信息。一是卫星重复的单元序列和排列方式不同物种甚至同一物种不同染色体间的着丝粒卫星都可能有差异这直接关系到减数分裂、着丝粒功能的研究。二是着丝粒区域转座子插入和表观修饰特征在完整序列上可以清晰看到CENH3结合位点或DNA甲基化状态为物种着丝粒生物学提供原位证据。rDNA区域的处理更考验技术。45S rDNA和5S rDNA阵列通常位于NOR位点在不同个体间拷贝数量差异极大。有了T2T序列可以准确测定rDNA的拷贝数与方向甚至检验是否存在未报道的变异单位。这些以前只能靠FISH和Southern blot粗测的信息现在能从碱基精度上回答。需要注意的是串联重复区在组装时非常容易压缩或过度扩展单拷贝数出现数量级上的偏差。交叉验证的办法是把组装序列覆盖深度拉出来看如果rDNA区段的read覆盖度远高于基因组平均说明组装时重复了如果覆盖度骤降说明丢失了拷贝。用这个办法可以有效识别“数量正确性”问题。4.3 从单一个体到泛基因组完整基因组的下一站单个个体的完整基因组代表的是这个个体的真实情况。对物种而言个体间存在大量的结构变异SV和存在/缺失变异PAV这些往往是适应性和表型差异的关键。这几年泛基因组已经从“拼几个个体的短read再比对”进化到“平行组装多个个体完整基因组”的阶段。如果你手里已经有了亲本或关键种质的T2T序列再结合群体重测序做SV鉴定就能构建出包含核心基因组和可变基因组的图形泛基因组。这一层分析对育种应用至关重要因为很多重要农艺性状基因就落在参考基因组缺失的PAV区域里。也就是说“完整基因组新概念”的下游并不是交付一条序列就结束而是把每条染色体完整摊开之后重新定义我们看到的遗传多样性。以后做关联分析、选择清除、驯化历史研究都必须回到这种更完整的参考框架上去。5. 实际项目中的取舍成本、周期与科研价值平衡5.1 预算不够时怎么“保重点”完整基因组项目确实比传统组装贵出不少。如果经费紧张建议把预算优先花在“补齐复杂区”上而不是盲目追求超高覆盖度。一个经验值对普通纯合度尚可的物种30x HiFi80x Hi-C可以拿到一个“框架完整但可能留少量gap”的版本把ULRA补到30x后rDNA和着丝粒的闭合率会明显提升。如果你的重点科学问题恰好落在某个特定的重复区那么ULRA值得加如果重点科学问题是编码区变异和进化40x HiFi50x ULRA已经能拿到很不错的结果把省下来的钱去做群体重测序性价比更高。项目和项目之间没有通解优先把“回答科学问题最需要的数据”配齐其他以最低标准满足即可。很多完整基因组项目在中途加测追加成本比一次性配齐高出不少而且时间表不可控建议第一次下单前就想清楚。5.2 时间规划与最容易延误的两个环节完整基因组项目的时间表通常被两个环节卡死。第一个是ULRA测序的产出量和批次稳定性高分子量DNA提取失败导致文库质量差反复重做的情况很常见。解决办法是在送测前就严格用脉冲场电泳或Fragment Analyzer评估DNA片段分布把DNA完整性不合格的样本挡在上机前。第二个是组装和验证阶段的人工耗时。你以为组装一跑就有结果实际上复杂物种需要反复调参数、反复跑gap filling、反复看Hi-C图。一周的组装分析排程最后拖成一个月的情况经常发生。我建议每完成一个阶段就立刻做一次QC不要把问题留到最终验收日。5.3 完整基因组能打开哪些以前打不开的“问号”有了完整基因组很多以前的“不可能”会变成日常提问。比如转座子在着丝粒区域的插入历史和年龄分布到底是怎样的不同品系的rDNA拷贝数变化是否跟抗逆性相关端粒长度在不同组织、不同发育阶段是如何动态变化的这些问题通常需要同一物种多个T2T个体或单倍型做支撑但起点就是这一代完整基因组。哪怕只是完成一个物种的T2T参考意义也很大。之后的个体重测序、泛基因组建库、表观研究都会天然站在“没有gap”的完整参考之上结果层次完全不一样。这也是我对完整基因组态度积极的原因——它不是某个宣传术语而是整个研究链条的基础设施升级。6. 最后聊几句这类项目我最深的几点感受完整基因组项目做了几年最深的感受是“完整”二字远不是测序和软件参数能保证的它是一个系统工程的产物。从DNA提取到文库构建从k-mer预估到最终人工校验每一个环节都有一个“埋雷”的可能。有些团队的测序方案看起来很豪华但因为样品DNA降解严重实验重复了三次才成功成本反而更高。还有一点想强调不要把T2T当作终点。序列闭合之后注释、比较、泛基因组、表观分析都还排着队。完整基因组更像是一枚高质量的基石而不是能直接回答所有科学问题的答案。如果你做的物种有特殊生物学背景比如自交不亲和、特殊生殖方式、染色体多倍化历史我强烈建议你在项目设计阶段就把这些生物学问题绑定到组装策略里而不是等序列出来了再想着怎么分析。最后分享一个小技巧无论用哪家测序平台正式大规模上机前一定花一份小样把整个流程走通一遍。先组装一个小的subassembly看看覆盖度、读长分布、Hi-C信号是否达标再决定是否进入全量测序。这套“试跑”方法让我躲过至少两次大规模返工算是我最想送给同行的一句话。
返回列表