[Briefings in Bioinformatics] 借力 AlphaFold 3:深度学习如何“一键生成”高性能功能调节 RNA
Design of function-regulating RNA via deep learning and AlphaFold 3
本文开发了一个名为 sgRNAGen 的深度学习框架,结合 Transformer 解码器架构与限制性采样(MCMC),专门用于设计具有功能调节能力的 sgRNA。研究首次整合 AlphaFold 3 的置信度指标进行后验筛选,在枯草芽孢杆菌中实现了高达 75% 的基因敲除效率和 100% 的大片段删除效率。
TL;DR
传统的 RNA 设计常受限于静态结构的局限性,特别是在涉及 Cas9 等受蛋白互作驱动的动态系统时。北京理工大学的研究团队提出 sgRNAGen 框架,通过 Transformer 模型生成具有进化合法性的 sgRNA,并创新性地引入 AlphaFold 3 (AF3) 进行结构验证。该系统在枯草芽孢杆菌中实现了 169.5 kb 大片段的满分(100%)敲除,彻底解决了多靶点编辑中序列重复带来的组装难题。
背景定位
该工作是 RNA 逆设计(Inverse Design)领域的最新进展,其核心贡献在于将 序列进化信息(LLM) 与 结构物理约束(Energy-based & AF3) 进行了深度闭环融合。它不再仅仅是生成一段序列,而是生成一个能与蛋白稳定结合的功能性“机器部件”。
痛点深挖:为什么 RNA 设计这么难?
- 动态交互(Dynamic Flexibility):RNA 并非僵硬的折纸。例如在 CRISPR/Cas9 系统中,sgRNA 必须诱导蛋白从失活态转变为开放态。仅靠预测二级结构无法保证其实际功能。
- 序列重复灾难:在代谢工程中,我们需要同时操作多个基因。如果使用相同的 sgRNA 背骨,高重复的 DNA 序列在微生物体内极易诱发同源重组,导致质粒丢失或变异。
- 筛选成本:传统方法依赖干湿实验的不断迭代,周期长且成功率低。
核心算法方案:sgRNAGen + AlphaFold 3
研究团队构建了一个自回归的 Transformer 解码器。其工作流程分为三个层次:
1. 预训练与受限采样
模型在 46,003 条 crRNA 序列上进行无监督学习,捕获天然 RNA 的“语言规律”。为了保证生成的序列不跑偏,团队引入了 MCMC 限制性采样:
- 结构保真度:通过 ViennaRNA 约束残基距离。
- 计算合理性:利用模型产生的 Perplexity(困惑度)确保序列符合进化分布。
2. AlphaFold 3 作为“数字审稿人”
这是本文最具前瞻性的部分。作者发现 AF3 的 ipTM (interface predicted TM-score) 指标与 sgRNA 的实际切割活性高度相关。
- 直觉验证:ipTM > 0.85 且 RMSD < 1Å 的序列,实验表现几乎全线优于未经筛选的对照组。
图 1: sgRNAGen 训练流程及其与 AF3 筛选的闭环整合。
实验战绩对比:从单基因到超大片段
- 基因敲除:设计序列在 bdhA 基因上表现出 75% 的极高效率。
- 大片段删除 (Full Score):在处理 169.5 kb 的超大片段时,传统单 sgRNA 束手无策,而 sgRNAGen 生成的双非重复 sgRNA 达到了 100% 的删除成功率,且质粒稳定性极佳。
- 多靶点控制:利用不同活性的设计方案,研究者展示了对 sfGFP 荧光强度的精细梯度调节(34.6% - 73.4%)。
图 2: 不同变体 sgRNA 的活性评估与分子动力学模拟。
深度洞察:分子动力学揭示活性本质
为了回答“为什么有些设计会失效”,团队进行了 1.8 微秒的分子动力学(MD)模拟。结果显示,失效序列(如 A13)虽然静态结构正确,但在动态过程中其 REC 结构域 极其不稳定,导致 RNA 过快脱离蛋白。这提示我们:未来的 AI 设计必须跨越静态坐标,向动态相互作用演进。
总结与价值
sgRNAGen 的成功标志着 RNA 设计进入了“一 shot 成功”的时代。
- 行业启示:AlphaFold 3 不仅仅是一个预测工具,它的置信度得分(Confidence Metrics)可以作为生成式 AI 的奖励函数或硬过滤标准。
- 局限性:目前的模型仍高度依赖模板 sgRNA 的背骨结构,未来若能实现完全从零开始(De novo)设计任意功能的 RNA-蛋白复合界面,将是生命科学的下一次飞跃。
