当前位置: 首页 > news >正文

【文献分享】RNARL:强化学习驱动的RNA密码子多目标统一生成框架

一、文章介绍

信使RNA(mRNA)疫苗和疗法的成功(如新冠疫苗)彻底改变了疫苗研发范式,其快速设计、灵活生产和高效免疫激活的优势使其成为未来疫苗和治疗药物开发的核心平台之一。然而,由于遗传密码的简并性,同一蛋白质序列可由大量不同的RNA序列编码,这些同义RNA变体在翻译效率、结构稳定性和表达水平上可能存在显著差异。这些差异主要源于物种特异性密码子使用偏好RNA二级结构特征。因此,RNA密码子设计——即在保持蛋白质序列不变的前提下优化编码RNA序列——已成为实现疫苗效力和治疗效果最大化的关键策略。

然而,现有RNA密码子设计方法面临三大根本性挑战。第一,长序列(>3,000 nt)的高效处理和优化仍是关键瓶颈,传统启发式搜索算法(如LinearDesign)虽然能在一定程度上平衡翻译效率和结构稳定性,但随着序列长度增加,搜索空间呈指数增长,计算成本急剧上升。第二,现有方法缺乏跨物种和跨RNA类型的泛化能力,大多针对特定宿主(如人类)或特定RNA类型(如线性mRNA)设计,难以适应多样化的应用场景。第三,深度学习方法(如基于LSTM的模型或预训练语言模型)虽然能够实现高通量生成,但受限于训练数据的天然分布,生成的RNA序列往往无法超越天然序列的性能,即缺乏“优化”能力;而纯粹的优化算法虽然能产生性能优异的序列,但计算代价高昂,无法实现大规模设计。这种“生成-或-优化”的割裂范式从根本上限制了RNA序列设计的效率和性能天花板。

为从根源上解决上述挑战,Shenggeng Lin、Hong Tan及其合作者在Genome Biology上发表了题为“RNARL: reinforcement learning-driven unified generative framework for multi-objective RNA codon design”的研究论文,提出了一个名为RNARL的强化学习驱动框架,首次将序列生成与多目标优化深度统一。

RNARL的核心思想是利用强化学习直接优化生成策略,使生成模型在训练过程中根据预设的多目标设计标准(如高翻译效率、高结构稳定性)迭代精炼其生成策略,从而直接产生满足设计目标的高性能RNA序列。该框架包含演员模型(Actor)奖励模型(Reward)两大核心组件。演员模型基于混合专家(MoE)Transformer架构,以蛋白质序列为输入,通过ESM-2蛋白质语言模型编码后经MoE Transformer生成候选RNA序列;奖励模型则对生成的RNA序列进行多目标评分(包括最小自由能MFE、密码子适应指数CAI、GC含量和未配对核苷酸比例)。两者通过**组相对策略优化(GRPO)**算法进行联合训练——演员模型根据奖励信号不断调整策略以生成更高奖励的序列,奖励模型则提供精确的质量评估,形成一个“生成-评估-优化”的闭环。

研究者构建了涵盖六个代表性物种(人类、拟南芥、产黄青霉、莱茵衣藻、大肠杆菌、嗜热古菌)和五种RNA类型(mRNA、环状RNA、正链RNA、双链RNA、逆转录病毒RNA)的多样化数据集,全面验证了RNARL的泛化能力。实验结果表明,RNARL在GC含量、CAI和未配对核苷酸比例等指标上均显著优于GEMORNA、LinearDesign、CodonTransformer等现有最优方法,尤其是在多目标平衡方面展现出独特优势——CAI优化方法虽然能达到理论最大值1.0,但会牺牲结构稳定性(MFE升高),而RNARL在保持高CAI的同时维持了更优的结构稳定性。RNARL成功处理了长达~3,900 nt的序列,并在两种公开RNA疫苗专利序列(HPV和EBV mRNA疫苗)的优化中展现出优于专利序列的性能,验证了其实际应用价值。RNARL在线平台(Google Colab)已对外开放,无需编程即可使用。

二、算法原理介绍

RNARL的算法设计围绕“演员-奖励强化学习闭环 + MoE Transformer架构 + 组相对策略优化”三个核心层次展开。

(一)演员模型(生成器)。演员模型以蛋白质序列为输入,输出编码该蛋白的RNA序列。架构上,蛋白质序列首先通过ESM-2蛋白质语言模型(650M参数)编码为嵌入向量,然后输入MoE Transformer。Transformer编码器采用8层隐藏维度768的结构,MoE层包含6个专家(每个token激活2个专家),通过门控网络动态选择最适合当前序列特征的专家组合,增强模型对不同蛋白质序列(如富含丝氨酸的序列)的适应性。输出层生成每个密码子位置的核苷酸概率分布,通过采样生成RNA序列。为解决训练数据中序列长度的长尾分布问题,RNARL采用长度感知分布采样(LADS)——按100个氨基酸为间隔分箱,根据各箱序列数量反向校准采样权重,使模型在训练中平等接触短、中、长序列,有效提升长序列处理能力。

(二)奖励模型(评估器)。奖励模型以RNA序列为输入,通过可学习嵌入层和MoE Transformer编码后经全连接层输出质量分数。奖励分数定义为标准化MFE(负值,越小越稳定)和CAI(越高越高效)的加权组合:Reward=WMFE×ScaledMFE+WCAI×ScaledCAI\text{Reward} = W_{\text{MFE}} \times \text{ScaledMFE} + W_{\text{CAI}} \times \text{ScaledCAI}Reward=WMFE×ScaledMFE+WCAI×ScaledCAI,其中WMFE=2.0W_{\text{MFE}}=2.0WMFE=2.0WCAI=1.0W_{\text{CAI}}=1.0WCAI=1.0,ScaledCAI在CAI达到目标阈值(0.8)时截断为1.0以避免过度优化单一指标。这种设计使奖励模型能定量评估翻译效率和结构稳定性之间的平衡。

(三)组相对策略优化(GRPO)。GRPO是RNARL的训练引擎。对每个输入蛋白质序列,演员模型采样GGG个候选RNA序列(组大小为4),奖励模型计算每个序列的奖励值。在同一组内,计算奖励均值和标准差,将奖励标准化为优势函数A^(si,ai,j)=R(si,ai,j)−μiσi\hat{A}(s_i, a_{i,j}) = \frac{R(s_i, a_{i,j}) - \mu_i}{\sigma_i}A^(si,ai,j)=σiR(si,ai,j)μi。优化目标是最大化:LGRPO(θ)=E[min⁡(ri,jA^i,j,clip(ri,j,1−ϵ,1+ϵ)A^i,j)−β⋅KL(πθ∣∣πref)]\mathcal{L}_{\text{GRPO}}(\theta) = \mathbb{E} \left[ \min \left( r_{i,j} \hat{A}_{i,j}, \text{clip}(r_{i,j}, 1-\epsilon, 1+\epsilon) \hat{A}_{i,j} \right) - \beta \cdot \text{KL}(\pi_\theta || \pi_{\text{ref}}) \right]LGRPO(θ)=E[min(ri,jA^i,j,clip(ri,j,1ϵ,1+ϵ)A^i,j)βKL(πθ∣∣πref)],其中ri,jr_{i,j}ri,j为当前策略与旧策略的概率比,KL散度约束策略更新步长防止偏离参考策略过远。这种组内相对比较方式避免了绝对奖励值在不同蛋白质间的不可比性,使训练更稳定高效。

三、总结

RNARL是一个基于强化学习的RNA密码子多目标统一生成框架,通过演员-奖励模型闭环和GRPO算法,将序列生成与多目标优化深度融合,直接产生高性能RNA序列。其核心创新在于:以强化学习打破传统的“生成-或-优化”割裂范式,使生成模型在奖励信号驱动下迭代精炼策略,实现翻译效率和结构稳定性的联合优化。RNARL在跨越六个物种和五种RNA类型的广泛验证中表现出卓越的泛化能力和长序列处理能力(~3,900 nt),并成功优化了公开RNA疫苗专利序列。该框架为RNA疫苗和核酸药物的理性设计提供了一个高效、通用且用户友好的计算平台,有望加速高质量RNA序列的发现与开发。

http://www.jsqmd.com/news/1393956/

相关文章:

  • VLM工具化推理:强化学习如何教会视觉大模型“动手”解决问题
  • 聚力中原,冰酿飘香|紫桐酒业应邀亮相第 38 届中国郑州糖酒食品交易会
  • 车灯升级技术笔记:LED透镜与激光透镜选型逻辑及施工工艺要点 - 米諾
  • 留学/移民机构做GEO优化,为什么更该盯紧合规与信任? - 品牌前沿专家
  • Apache Spark 从入门到实践:核心架构、环境搭建与数据分析案例详解
  • 解构Shippy:从动作、状态、后果模型到四大设计边界
  • 语言培训行业GEO优化公司怎么选?一份面向机构的5维能力评估清单 - 品牌前沿专家
  • 2026 海南澄迈公司注销政策解读:流程、材料与合规要点 - 米諾
  • 视觉大模型Vision Encoder全流程:图像预处理、Token化、位置编码、特殊Token、Backbone、多尺度、Neck、特征融合、特征聚合、Token压缩、归一化、输出投影与视觉语言对齐
  • FM-200E 手持 2M 误码仪:风电基地野外通信运维的便携检测工具
  • 2026年8月缆绳工厂推荐,钢卷吊具/电缆网套/柔性吊带/缆绳/卷钢吊具/成套索具/钢锭吊具,缆绳供应商口碑推荐 - 企业权威推荐大使
  • 2026佛山系统门窗品牌推荐**|仿古中式门窗配置逐项对比,中式庭院整装指南 - 生活动态圈
  • 阿里云CMS OpenClaw升级:实现大模型Agent多轮会话可观测性
  • 2026 中泰海运整柜避坑指南:合规清关 + 舱位保障,5 家服务商深度对比 - 优质品牌中立测评推荐
  • 一个8年工作经验的程序员的畅谈Vibe coding
  • 佛山买家具避坑指南:乐从展厅 vs 龙江工厂,3招避开中间商(附源头工厂推荐) - 米諾
  • 信号与系统高分突破:从知识点到知识网络的认知重构
  • 2006年8月沉香手串品牌口碑观察:核心看原料,品控,质检,客户评价四个维度 - 生活动态圈
  • 24、工控与商显设备的稳定性要求:7×24小时运行
  • 基于微信小程序垃圾分类服务平台
  • 2026年常州武进区GEO服务商代理加盟怎么选?五大判断标准一文讲透 - 科技快讯
  • 如何安心挑选护理护垫?护垫成分安全性判断全攻略 - 米諾
  • Redis测试方法全攻略:冒烟、压测与稳定性验证
  • 2026 中泰海运备货避坑:海外仓补货实测,5 家服务商对比 - 优质品牌中立测评推荐
  • 告别卸载残留:EdgeRemover 让彻底卸载 Edge 只需 4 步
  • 常州市金坛区国内GEO服务商代理加盟怎么选?本地企业AI获客合作指南 - 企业新闻快传
  • 2026年浙江加盟赛道博弈:零售店凭何成新手抗风险更优解? - 生活动态圈
  • 品质好的护垫怎么选? - 米諾
  • 常州新北区GEO服务商代理加盟靠谱推荐:2026年本地创业者选型与避坑指南 - 企业新闻快传
  • docker-基础实战第二课