为何对虾基因组在二十年间始终未能实现完整组装
困难不在于测序成本,而在于基因组结构。Yuan等调查了四种对虾属物种,发现它们均呈现双峰k-mer深度分布,并将其归因于大量同源重复序列而非全基因组复制,因为Ks分析、等位基因频率分析以及单一Hox簇均不支持发生过复制事件[8]。他们估计凡纳滨对虾的杂合度为2.43%,中国明对虾为1.95%,斑节对虾为4.95%,日本囊对虾为4.49%[8]。高重复含量加上高杂合度,恰恰会产生困扰早期组装的塌缩或碎片化重叠群。
黑虎虾的案例从另一个角度展现了同样的制约。Uengwetwanit等人指出,由于基因组高度重复以及提取高质量、高分子量DNA的技术难度,现有的斑节对虾组装缺乏连续性和完整性[6]。他们仅使用PacBio的草图contig N50仅为79 kb,之后通过Chicago和Hi-C挂载才将scaffold N50提升至44.86 Mb[6]。换言之,仅靠长读长并不能解决对虾科基因组的问题;挂载和细致的DNA处理完成了大部分工作。
其他甲壳类动物的比较研究进一步表明,当重复序列含量较低或组装策略经过针对性调整时,实现高连续性是可以做到的。Baldwin-Brown等人利用PacBio和Illumina数据,组装出了120 Mb的蚌虾基因组,contig N50达到18 Mb,并将其描述为当时连续性最高的甲壳类动物组装[3]。该基因组大约比凡纳滨对虾的小十六倍,因此这一比较的意义在于方法而非规模:当重复序列的分布格局尚可驾驭时,能够跨越重复序列的长读长可以将其解析。
新组装实际改变了什么,又未改变什么
这篇锚定论文的核心举措是策略性的,而非算法性的。Ma等人产生了170.44 Gb的PacBio HiFi数据(reads N50为15,986 bp)、143.25 Gb的ONT超长数据(reads N50为100 kb)以及336.69 Gb的Hi-C干净数据,随后在scaffolding之前测试了三种contig策略[1]。仅用HiFi的组装得到1.22 Gb,contig N50为41,821 bp;HiFi加ONT的混合组装得到0.93 Gb,N50为67,583 bp;而仅用ONT组装再用HiFi抛光得到1.99 Gb,N50为454,920 bp[1]。他们沿用了基于ONT的路线,随后应用三轮gap filling和Hi-C scaffolding,最终达到1.95 Gb、contig N50为1.97 Mb、scaffold N50为46.08 Mb,以及在44条假染色体上实现97.25%的锚定率[1]。
这是一次对先前前沿的真正跨越。2019年的凡纳滨对虾组装contig N50为57.65 kb,scaffold N50为605.56 kb [1];2025年的组装达到了contig N50为201.33 kb、scaffold N50为42.33 Mb,BUSCO完整度为84.6% [1]。新的contig N50约为2025年数值的十倍,scaffold N50略高,但BUSCO数值更低,作者并未对此作出解释 [1]。
注释添加了26,830个蛋白编码基因,其中23,952个(89.27%)具有功能注释,平均基因长度为15,514 bp,每个基因平均约含6.15个外显子[1]。重复序列总计1.195 Gb,占组装的71.95%,其中仅散在重复序列即占61.28%,DNA转座子为最大类别,占43.54%[1]。对于以育种为导向的读者而言,实际收益在于如今97.25%的基因组已定位到染色体上,这使得连锁分析、选择扫描和共线性分析远比基于contig级别的草图更为可行。
平台选择并非中立:HiFi与ONT比较所揭示的内容
锚定论文中的内部比较信息量格外丰富,因为同一样本被送入了三条流程。仅用ONT的路线产生了最大(1.99 Gb)且连续性远超其他(N50为454,920 bp)的重叠群集合,而仅用HiFi的路线则产生了最小(1.22 Gb)且连续性最差(N50为41,821 bp)的结果[1]。作者指出,该ONT组装体比近期发表的一个1.7 Gb的凡纳滨对虾基因组显著更大、连续性也更高[1]。这与更广泛的评估结果一致:Rayamajhi等人对裸南极鱼进行了短读长、混合及仅长读长阶段的组装,得出结论认为仅长读长的重叠群组装是最佳选择,而第一阶段和第二阶段的组装质量较低[7]。
但平台比较取决于具体情境。Udaondo等人针对斑节对虾转录组分析比较了PacBio和ONT,发现读长偏倚和通量差异对结果影响很大,并得出结论:平台选择应服从于研究问题[9]。锚定论文自身的数据也支持一种更为细致的解读:HiFi读段回贴率为97.14%,其中67.89%的基因组覆盖度达到5×或更高;而ONT读段回贴率为100.00%,其中98.58%的覆盖度达到5×或更高[1]。ONT在这里的优势部分来自覆盖深度,而不仅仅是读长。
填补空白的序列同样影响解读。Ma等人先使用基于HiFi的LR_GapCloser,随后使用quarTeT的gapfiller并分别以来自HiFi组装和混合组装的contig作为输入,接着使用基于ONT的LR_GapCloser,最后进行Racon抛光[1]。由于最终contig N50达到1.97 Mb,被描述为相较三轮填补空白后所获得的454.92 kb有大幅提升,因此最大的单次增益似乎来自scaffolding和缺口闭合,而非最初的contig组装[1]。
完整性的天花板:70% BUSCO对下游结论意味着什么
最重要的边界在论文中已有明确说明。针对eukaryota_odb10(255个基因)的BUSCO评估返回了181个完整BUSCO(70.98%),其中包括123个单拷贝(48.24%)和58个重复(22.75%),另有4个片段化(1.57%)和70个缺失(27.45%)[1]。蛋白质组模式类似:178个完整(69.80%)、126个单拷贝(49.41%)、52个重复(20.39%)、13个片段化(5.10%)和64个缺失(25.10%)[1]。约四分之一的保守单拷贝直系同源基因在组装中缺失。
这一数值低于2025年凡纳滨对虾组装所报告的84.6% BUSCO完整度[1],这是论文未能解决的真正矛盾。根据所提供材料,可能的解释包括谱系数据集、组装大小和重复序列屏蔽方面的差异,但现有来源无法让我们在其中作出判定。可以确定的是,在重复序列丰富的基因组中,70%的BUSCO评分并不能证明组装质量差;它证明的是相当一部分保守基因落在组装未能捕获的区域中。
工具选择也会影响完整性的衡量方式。Huang和Li表明,compleasm使用miniprot而非BUSCO的两轮MetaEuk方法,对T2T-CHM13报告了99.6%的完整性,而BUSCO为95.7%,并且compleasm特有的562个完整基因中有557个得到了NCBI注释的支持[5]。他们还提醒,compleasm对远缘同源物的灵敏度有限,建议对分化较大的组装同时使用BUSCO[5]。对于重复序列占71.95%的甲壳动物基因组[1],这一注意事项直接相关:所报告的70.98%可能低估了真实完整性,但锚定论文中未报告compleasm的运行结果。
对水产养殖遗传学的实际影响在于,新组装是染色体水平分析的有力支架,但尚不是一份完成的参考基因组。凡纳滨对虾的全基因组重测序工作已在来自六个品系的180尾虾中鉴定出3700万个SNP,平均密度为22.5个SNP/Kb,选择信号富集于大分子代谢、蛋白质水解、结构分子活性和刺激响应[2]。这些分析受益于更好的锚定,但任何依赖于缺失的27.45%中基因模型的选择扫描或GWAS,都将继承该组装的盲区。
这对育种意味着什么,以及哪些问题仍有待解答
最明确的下游价值体现在结构层面。凭借97.25%的序列锚定到44条假染色体上以及46.08 Mb的scaffold N50 [1],该组装能够支持Uengwetwanit等人用于检测斑节对虾与凡纳滨对虾假染色体之间一对一和一对二关系的共线性及染色体水平比较分析,同时明确指出某些表面上的“一对二”模式可能反映任一组装中的scaffolding错误 [6]。凡纳滨对虾中更好的锚定减少了这一歧义的一个来源。
注释还使早期草图无法干净支持的基因家族和性状研究成为可能。Liu等人利用染色体水平的四脊光壳螯虾组装,识别出免疫相关基因家族的扩张以及KDM3A、KDM5A和HMOX2上的正选择,随后通过RNAi验证了KDM5A在耐低氧中的作用[4]。该研究也揭示了一个警示:他们3.95 Gb的组装比估计的6.02 Gb基因组大小小了2.07 Gb,但其BUSCO完整性和Merqury QV均高于已发表的更大组装[4]。组装大小和完整性可能朝相反方向发展,而这正是新凡纳滨对虾组装与其2025年前身之间所见的模式[1]。
若干问题仍悬而未决。其一,70.98%的BUSCO结果究竟反映的是真实的序列缺失、谱系数据集不匹配,还是测量工具的灵敏度不足,在所提供的证据中尚无定论[1][5]。其二,新组装基因组的完整性与2025年组装基因组84.6%之间的差异未得到解释[1]。其三,该组装基因组来源于一家商业孵化场的单只62克雄性个体[1],因此它仅捕获了一个单倍型的结构变异,而该物种拥有多个适应不同环境的育种品系[1][2]。其四,71.95%的重复序列含量[1]意味着重复序列介导的结构变异——对虾类性状变异的可能贡献因素[8]——在很大程度上仍无法触及。该基因组是一张更好的地图,而非一张已完成的地图。
关于这些来源
本研究页面基于9项同行评审研究——发表于2017年至2026年间,其中2项发表于2024年及以后,4项发表于Q1期刊,合计被引用543次——这些研究是从通过质量筛选的13项研究中遴选出的最相关成果,而这13项研究又从超过5亿篇文献的数据库中检索到的177篇论文中筛选而来。
本文引用的文献
凡纳滨对虾染色体水平基因组组装改进版
Ma等人提出了一个1.95 Gb染色体级别的凡纳滨对虾组装,整合了PacBio HiFi、ONT超长读长和Hi-C数据,contig N50为1.97 Mb,97.25%锚定到44条假染色体,包含26,830个蛋白编码基因,71.95%的重复序列,BUSCO完整度为70.98%(基因组)和69.80%(蛋白质组)。
太平洋白虾凡纳滨对虾全基因组重测序分析揭示的选择特征
Wang等对来自两个选育品种和四家公司的180尾凡纳滨对虾进行了重测序,在22.5 SNPs/Kb的密度下鉴定出3700万个SNP,并发现选择信号富集于大分子代谢、蛋白质水解、结构分子活性和刺激响应等方面。
甲壳动物基因组的新标准:高度连续、带注释的蚌虾Eulimnadia texana基因组组装揭示HOX基因顺序并鉴定性染色体
Baldwin-Brown等人利用PacBio和Illumina数据组装了120 Mb的蚌虾Eulimnadia texana基因组,contig N50达到18 Mb,将其描述为当时连续性最高的甲壳动物组装,并利用该基因组定位了性染色体。
红螯螯虾(Cherax quadricarinatus)的基因组组装为其免疫适应和耐低氧能力提供了见解
Liu等人构建了一个染色体水平的Cherax quadricarinatus组装(3.95 Gb,contig N50 739.45 kb,scaffold N50 33.93 Mb,100个假分子),其BUSCO完整性和Merqury QV均高于已发表的更大组装,并通过RNAi验证了KDM5A在耐低氧中的作用。
compleasm:BUSCO 的一个更快、更准确的重新实现
Huang和Li表明,compleasm比BUSCO快14倍,对T2T-CHM13报告了99.6%的完整性,而BUSCO为95.7%,同时提醒compleasm对远缘同源物的敏感性有限,应与BUSCO结合用于分化较大的组装。
黑虎虾(<i>Penaeus monodon</i>)基因组的染色体水平组装有助于鉴定生长相关基因
Uengwetwanit等人利用PacBio结合Chicago和Hi-C数据,产生了首个染色体水平的P. monodon组装(44条假染色体,scaffold N50为44.86 Mb),并利用与L. vannamei的共线性来鉴定生长相关基因,同时标记了任一组装中可能的scaffolding错误。
评估基于Illumina、Nanopore和PacBio的基因组组装策略:以裸头冰鱼<i>Trematomus borchgrevinki</i>为例
Rayamajhi等人比较了Trematomus borchgrevinki的短读长、混合和仅长读长组装,得出结论:仅长读长contig组装是目前的最佳选择,而phase I和phase II组装质量较低,且隐藏的mate-pair支架错误会降低混合组装的质量。
对虾物种的基因组测序与组装策略及基因组特征的比较分析
Yuan等人对四种对虾属虾类进行了调查,并将其组装质量差归因于高杂合度或丰富的同源重复序列,而非全基因组复制,估计凡纳滨对虾的杂合度为2.43%,中国明对虾为1.95%,斑节对虾为4.95%,日本囊对虾为4.49%。
PacBio与Oxford Nanopore测序技术在斑节对虾转录组图谱鉴定中的比较分析
Udaondo等人比较了PacBio和ONT在三种斑节对虾组织转录组分析中的表现,发现读长偏差和通量差异会强烈影响结果,并得出结论:平台选择应以研究问题为导向。
