当前位置: 首页 > news >正文

过程奖励模型(PRM)vs 结果奖励模型(ORM)深度解析:从 Monte Carlo 标注到推理验证的 LLM 推理能力训练新范式

  • 过程奖励模型(PRM)vs 结果奖励模型(ORM)深度解析:从 Monte Carlo 标注到推理验证的 LLM 推理能力训练新范式

    • 核心痛点:大模型推理能力训练中,仅靠结果奖励信号稀疏且易导致奖励劫持,过程级奖励建模成为突破推理瓶颈的关键
    • 适配人群:AI 研究工程师、大模型训练工程师、推理系统架构师、强化学习研究者
    • 收获能力:深入理解 PRM/ORM 的数学原理与训练方法论,掌握 Monte Carlo 标注、MCTS 搜索、Best-of-N 采样等核心机制,具备在生产环境中选择和部署奖励模型的实战能力
    • 技术背景与演进逻辑

      • 推理能力训练的三大范式演进
        • 第一阶段:监督微调(SFT)-> 通过标注推理链数据直接训练 -> 依赖人工标注成本高且泛化性有限
        • 第二阶段:结果奖励模型(ORM)-> 仅对最终答案给出奖励信号 -> 信号稀疏、难以定位推理错误
        • 第三阶段:过程奖励模型(PRM)-> 对每个推理步骤给出奖励信号 -> 信号密集、可精确定位错误步骤
      • 核心驱动力
        • 复杂数学推理任务中,ORM 无法区分"过程正确但计算错误"与"过程错误但碰巧得到正确答案"
        • 推理时计算扩展(Test-Time Compute Scaling)需要可靠的步骤级验证器来指导搜索
        • OpenAI 的 “Let’s Verify Step by Step” (2023) 首次系统证明 PRM 在数学推理上显著优于 ORM
      • 演进时间线
        时间线 ├── 2022 -> Uesato et al.: 提出过程监督 vs 结果监督的概念框架 ├── 2023 -> OpenAI PRM800K: 首个大规模人工标注 PRM 数据集 ├── 2024 -> Math-Shepherd: Monte Carlo 自动标注 PRM 训练 ├── 2024 -> DeepSeek-R1: 结合 ORM 与强化学习的推理模型 ├── 2025 -> OmegaPRM / GenPRM: 自动化 PRM 训练方法成熟 └── 2026 -> CRM / SP-PRM: 过程-结果联合建模新范式
    • 核心原理深度解析

      • 结果奖励模型(ORM)核心原理
        • 数学定义

          • 给定问题q qq和推理步骤序列s = ( s 1 , s 2 , l d o t s , s n ) s = (s_1, s_2, ldots, s_n)s=(s1,s2,ldots,sn),ORM 仅对最终答案a = s n a = s_na=sn给出奖励
          • 公式:R m a t h r m O R M ( q , s ) = m a t h b b 1 [ m a t h r m v e r i f y ( a , a ∗ ) ] R_{mathrm{ORM}}(q, s) = mathbb{1}[mathrm{verify}(a, a^*)]RmathrmORM(q,s)=mathbb1[mathrmverify(a,a)]
          • 其中a ∗ a^*a为标准答案,m a t h b b 1 mathbb{1}mathbb1为指示函数
        • 训练方法

          • 正负样本构建
            ORM 训练数据构建 ├── 正样本:推理链最终答案正确 -> 标签 = 1 ├── 负样本:推理链最终答案错误 -> 标签 = 0 └── 训练目标:二分类交叉熵损失
          • 训练流程
            ORM 训练流程 ├── 收集推理轨迹 -> 判断最终答案对错 ├── 对错标注 -> 训练二分类器 └── 二分类器 -> 奖励模型 R(q,s)
        • 核心局限

          • 信号稀疏:只在推理链末端给出反馈,无法指导中间步骤的优化
          • 奖励劫持:模型可能学会"碰巧得到正确答案"的捷径路径
          • 信用分配困难:无法确定哪个步骤导致了最终的正确或错误
      • 过程奖励模型(PRM)核心原理
        • 数学定义

          • PRM 对推理链中的每个步骤s i s_isi给出奖励信号
          • 公式:R m a t h r m P R M ( q , s , i ) = P ( s i m a
http://www.jsqmd.com/news/1304403/

相关文章:

  • 步进电机步距角与细分驱动详解:从原理到实战,告别抖动与丢步
  • OpCore-Simplify终极指南:3分钟搞定Hackintosh配置,告别繁琐手动调试
  • 2026年玻璃瓶厂家推荐排行榜,精华玻璃瓶/化妆品玻璃瓶/精油玻璃瓶/水乳玻璃瓶/膏霜玻璃瓶,药妆与香薰玻璃瓶源头工厂匠心之选 - 优企名品
  • 解决PlatformIO中STM32F103C8T6的UNEXPECTED idcode: 0x2ba01477错误
  • 信息论驱动的最优视角搜索:三维重构中“主动感知”与“几何补全”的闭环研发课题方案
  • 红外避障模块原理与实战:从电路设计到Arduino智能小车应用
  • 二手手机消费趋势与实战指南
  • 如何快速掌握res-downloader:全网资源下载神器的完整教程
  • VSG控制中PR控制器抑制电网不平衡的应用
  • 从AI助手到智能体:鸿蒙小艺如何实现人机交互范式跃迁
  • TM1650驱动四位数码管:I2C接口应用与单片机代码实现
  • Claude 4.8 vs GPT-5.6写小说对比:谁的文笔更有“人味”?
  • MiniMax H3 发布了,大家评价它比 Seedance 2.0 更好 - AI
  • 最少转弯路径算法:从BFS到0-1 BFS与Dijkstra的优化实践
  • 基于LangChain搭建可以联网查询、读写文件的AI助手
  • 虚拟串口工具VSPD:原理、配置与在嵌入式开发中的实战应用
  • Unity3D Shader 法线与基础光照
  • 如何高效使用MP4Box.js实现浏览器端MP4文件处理:开发者实战指南
  • TREA框架在安卓开发中的高效实践与应用
  • OpenClaw 2.7.9 第一次启动加载缓慢?底层原因与优化方式分享
  • 基于小马宝莉主题的对话生成工具:角色性格一致性实践指南
  • Hive表结构变更实战:ALTER TABLE核心操作与Schema演化最佳实践
  • 中小律所数字化转型:零代码管理软件的核心优势
  • 开源公益如何通过技术协作创造社会价值
  • Windows平台B站第三方客户端终极指南:免费开源BiliBili-UWP完全使用教程
  • 如何用Moonlight-Switch在Switch上实现PC游戏串流:免费高效的跨平台解决方案
  • 智能车调试:控制策略优化与物理防护的工程实践对比
  • AI生活化产品从概念到上线的完整技术决策全景
  • AI对话应用增长策略:从工具到生态的演进与商业化设计
  • GoWeb 处理请求详解:请求行、请求头、请求参数与给客户端响应