当前位置: 首页 > news >正文

Reasoning RL:从奖励信号到可训练推理能力

0. 为什么 Reasoning RL 改变了游戏规则

过去一年,大模型的推理能力发生了质的变化。这个变化不是来自更大的参数量或更多的训练数据,而是来自训练范式的根本转变:用可验证的奖励信号训练推理链本身。在此之前,我们主要依赖提示工程来引导模型"表现得像在思考",但模型的推理能力并没有通过训练得到真正的强化。而现在,通过将推理过程的成功与否作为训练目标,模型能够在大量尝试中学会更有效的推理策略,这标志着从"模拟推理"到"学习推理"的重大跨越。

传统的提示工程让模型"表现得像在思考"——我们写 Chain-of-Thought 提示,期望模型输出中间步骤;我们用 Self-Consistency 让模型多采样几条路径再投票;我们设计 Tree-of-Thought 让外部搜索器选择候选步骤。这些方法在实践中确实展现了效果,能够在一定程度上引导模型产生更合理的推理过程。但本质上,搜索结构主要在模型外部,模型本身仍然是一个条件文本生成器,其内在的推理能力并未通过训练得到根本性的提升。

Reasoning RL 的核心突破是:把"推理链是否到达正确结果"变成训练目标。数学题可以检查答案等价,代码题可以跑测试,逻辑题可以用规则验证。模型在大量候选路径中得到奖励和惩罚,逐渐学会哪些推理行为更可能成功。直观理解:过去我们在提示框里要求模型"思考",现在用奖励机制训练模型"真的把计算资源分配到更有用的路径上"

本文将围绕 Reasoning RL 的核心机制与工程实践,深入探讨四个关键问题。这些问题不仅涉及理论突破,更关系到实际系统的可复现性、稳定性和部署效率。在当前大模型推理能力竞争日益激烈的背景下,理解这些问题对于构建可靠的推理系统至关重要。通过分析这些问题,我们希望帮助读者建立从算法原理到工程实践的完整认知链条。


1. 从提示工程到奖励驱动:推理能力的训练化

1.1 传统推理方法的边界

Chain-of-Thought (CoT) 让模型写出中间步骤,Self-Consistency 让模型多采样几条路径再投票,Tree-of-Thought (ToT) 和 MCTS 类方法把候选步骤交给外部搜索器选择。这些方法在各自的应用场景中都展现了价值,能够引导模型产生更结构化的输出。然而,这些方法的共同点是:搜索结构在模型外部,模型仍然只是条件文本生成器。模型本身并没有通过训练学会如何更好地进行推理,而只是在外部框架的引导下生成文本。

为了更清楚地理解这些传统方法的局限性,我们需要深入分析每种方法的运作机制及其根本缺陷。通过对比这些方法在推理能力培养上的不同表现,可以发现它们都未能真正解决"如何让模型学会推理"这一核心问题。下面我们逐一剖析每种方法的具体问题所在:

  • CoT Prompting(链式思考提示):在提示词中要求模型"一步一步思考"或"让我们逐步分析",模型确实会输出更长、更结构化的文本,看起来像是在进行推理。然而,这种方法的根本问题在于,模型并没有接收到关于"这一步推理是否正确"的明确训练信号。模型只是学会了生成符合推理格式的文本,而不是真正理解推理的逻辑。这就像是让学生背诵解题步骤,而不是教会他们理解解题思路——当遇到新题型时,背诵的步骤往往无法迁移应用
  • Self-Consistency(自洽性方法):这种方法通过采样生成多条不同的推理链,然后对这些推理链的最终答案进行投票,选择出现频率最高的答案作为最终结果。这种"多数投票"机制在一定程度上能够过滤掉错误的推理路径,提高答案的可靠性。然而,其核心问题依然存在:每条推理链的生成过程仍然没有接收到梯度反馈信号。模型不知道哪条推理链更优、为什么更优,也无法从投票结果中学习到改进推理策略的经验。这就像是通过"少数服从多数"来做决策,但从未告诉决策者如何提高决策质量
  • ToT / MCTS(思维树/蒙特卡洛树搜索):这类方法引入了外部搜索器(如专门训练的value function或用LLM-as-judge评分器)来评估推理过程中的中间状态,通过评估不同推理分支的价值来指导搜索方向。这种方法在推理规划上确实更加系统化,能够在多条候选路径中选择更有希望的方向继续探索。然而,其根本局限在于:这些外部评估信号虽然能够指导当前推理过程的搜索策略,但并不会直接改进模型本身的推理能力。模型依然是被动地生成候选步骤,而不是主动学习如何生成更优质的推理路径。这就像是给学生配备了一位导师来评判每一步是否正确,但学生本身并没有从这些评判中内化推理能力

这些基于提示工程的推理方法在实践中确实能够提升模型表现,在许多任务上取得了显著效果。然而,深入分析就会发现,它们都面临着两个根本性的局限。之所以说这些局限是"根本性"的,是因为它们源于方法本身的设计理念——即通过外部引导而非内在学习来实现推理能力。这些局限制约了推理能力的进一步提升和泛化:

  1. 推理能力不可迁移:同一个模型在换了提示词或换了任务后,推理质量可能显著下降。这是因为模型并没有真正学会推理,而只是学会了在特定提示格式下生成看起来像推理的文本。一旦提示词风格改变,或者任务类型与训练示例不同,模型的推理表现就会大幅退化。
  2. 计算浪费在无效路径:模型不知道哪些推理步骤更可能成功,平等地分配计算资源到所有可能路径。这意味着模型在生成推理链时,无法有效地剪枝那些明显不会成功的路径,也无法优先探索更有希望的方向,导致大量计算资源被浪费在低质量的候选答案上。

1.2 Reasoning RL 的范式转变

Reasoning RL 的核心思想非常直接,却带来了根本性的突破:把推理链是否成功变成可优化目标。这意味着我们不再仅仅依赖提示词来"诱导"模型生成推理步骤,而是通过强化学习的奖励机制,让模型在大量尝试中学会哪些推理路径更有效。这种方法的优势在于,模型能够自主探索和发现有效的推理策略,而不是被动地模仿人工设计的推理模板。

那么,Reasoning RL究竟如何实现这一根本性突破?其训练流程与传统方法相比发生了哪些本质变化?理解这些变化对于把握整个技术路线至关重要。从技术实现角度看,Reasoning RL的训练流程可以分解为以下四个核心环节,这四个环节构成了一个完整的闭环学习系统:

  1. 采样多条推理链(Rollout Generation):对同一个问题,让模型生成多条可能的推理路径(rollouts),这个过程类似于"头脑风暴"——模型不是只生成一条推理链,而是探索多种可能的解题思路。通过多样化的采样,模型能够覆盖不同的推理策略,包括直接推理、逐步分解、反向验证等多种路径。这种多样性是后续优化的基础,因为只有当模型探索了足够丰富的推理空间,才能从中识别出哪些路径更有效
  2. 用可验证奖励打分(Reward Calculation):对每条生成的推理链,使用客观、可验证的标准进行评分。这里的"可验证"是关键——不同于模糊的人工评判,这些奖励信号是明确且自动化的:数学题通过符号等价性检查答案是否正确,代码题通过运行单元测试验证功能是否实现,逻辑推理题通过形式化规则验证推理是否有效。这种可验证性确保了奖励信号的一致性和可扩展性,使得大规模训练成为可能。每条推理链最终会得到一个明确的奖励分数,反映其质量高低
  3. 策略梯度更新(Policy Gradient Update):基于奖励分数,使用策略梯度算法更新模型参数。核心机制是:奖励高的推理链,其生成概率会被增强;奖励低的推理链,其生成概率会被抑制。这个过程是通过反向传播实现的——模型会学习到哪些token序列组合、哪些推理模式、哪些中间步骤更容易导向正确答案。与监督学习不同的是,这里没有"标准答案"的推理链,模型完全根据最终结果的好坏来调整生成策略。这种学习方式使得模型能够自主发现有效的推理模式,而不是简单地模仿人类提供的示例
  4. 迭代收敛(Iterative Convergence):重复上述三个步骤,模型在推理空间中的策略逐渐优化,最终收敛到一个高效的推理模式。在这个迭代过程中,模型不仅学会了"如何得到正确答案",更重要的是学会了"如何在推理空间中分配计算资源"——对于简单问题快速响应,对于复杂问题分配更多推理步骤,对于不确定的地方增加验证和回溯。这种动态资源分配能力是通过大量迭代训练涌现出来的,体现了模型对推理任务本质的理解。随着训练的进行,模型的推理链质量会持续提升,最终达到稳定的高性能状态

关键区别在于:奖励信号直接作用于推理链生成过程,而不是只作用于最终答案。模型不仅学会"这道题的答案是 42",更学会"用什么样的推理步骤更可能到达正确答案"。这种学习方式使得推理能力成为模型的内在能力,而不仅仅是对特定提示格式的记忆。通过大量的试错和奖励反馈,模型逐渐内化了有效推理的模式,能够在新任务上展现出更强的泛化能力。这就像是从"背诵解题步骤"升级到"理解解题思路"。

DeepSeek-R1 的摘要明确强调:推理能力可以通过纯强化学习激励出来,而不必依赖人工标注的 reasoning trajectories。论文还指出训练过程中出现了自我反思、验证和动态策略调整等模式——这些行为不是人工模板写进去的,而是模型在奖励压力下发现"多算一步、检查一步、换个角度"更容易拿到正反馈

1.3 思考预算的动态分配

Reasoning RL 的真正价值不是让所有回答都变得更长,而是让模型学会把计算资源(token)花在真正能降低错误率的位置。这意味着模型需要具备"元认知"能力:知道什么时候需要深度思考,什么时候可以快速回答。对于简单的事实查询,模型应该直接给出答案而不浪费时间在不必要的推理上;而对于复杂的数学证明或多约束规划问题,模型则应该愿意分配更多的计算预算来探索和验证推理路径。这种动态的资源分配能力,是推理系统实用化的关键。

Qwen3 技术报告和官方博客把 thinking mode 与 non-thinking mode 放到统一框架中,强调推理模式的选择应该是动态的、任务相关的:

  • 简单任务应该快速回答:对于事实查询、短文本改写、简单解释等任务,长链推理不仅不会提升准确率,反而会增加延迟和成本。模型应该能够识别这些任务的特征,直接给出答案而不进入推理模式。
  • 复杂任务值得分配推理预算:对于数学证明、跨文件代码调试、多约束规划问题、需要探索多种可能性的代码生成等任务,分配更多的推理 token 预算往往能够显著提升最终质量。这类任务的特点是存在多个可能的路径,需要验证和回溯。

这个判断对工程系统的架构设计至关重要:长推理是昂贵的计算资源,不是用来装饰回答的默认选项。在实际部署时,系统需要综合考虑多个维度来动态选择推理模式:任务类型(是否需要多步推导)、历史错误率(该类任务的难度)、用户延迟要求(实时对话 vs 批处理分析)、问题所属领域(数学、代码、常识)以及安全等级(高风险决策需要更谨慎的推理)。这种动态路由机制是推理系统从实验室原型走向生产部署的关键工程决策。

defchoose_reasoning_budget(task:str,context:dict)->int:""" 根据任务特征动态分配推理 token 预算。 这是工程化示意,不代表任何具体模型的内部实现。 """# 硬信号:明确需要推理的关键词hard_signals=["证明","推导","竞赛","复杂代码","多约束","反例","调试"]ifany(signalintaskforsignalinhard_signals):return4096# 高预算# 任务长度iflen(task)>500:return2048# 中预算# 历史失败率ifcontext.get("historical_error_rate",0)>0.3:return2048# 中预算# 默认:快速回答return512# 低预算


2. DeepSeek-R1:长链推理如何涌现

2.1 R1-Zero 的问题设定

DeepSeek-R1-Zero 的实验设计体现了一个极简主义的研究思路,它试图回答一个纯粹的科学问题:如果不给模型提供人工精心编写的长链 CoT 示范,只提供可验证任务的最终奖励信号(答案对不对),模型能不能自己学会生成更长、更有效的推理过程?这个问题的答案将直接揭示推理能力是否可以通过纯强化学习激励出来,而不必依赖昂贵的人工标注推理轨迹。

论文和官方仓库的说明显示,R1-Zero 从 base model(未经过指令微调的基础模型)出发,直接进行大规模强化学习训练,完全跳过了传统的监督微调(SFT)阶段。它采用的优化算法是GRPO(Group Relative Policy Optimization,组相对策略优化),这是一种针对大语言模型推理任务特点设计的高效算法:

  • 对同一个 prompt 采样一组输出(Group Sampling):通常生成 16-32 条推理链,这些推理链构成一个"同组样本集"。这种批量采样策略不仅提高了样本效率,更重要的是为后续的相对比较创造了条件。同组样本面对的是完全相同的问题,它们之间的质量差异直接反映了不同推理策略的优劣。通过在组内进行比较,模型可以学习到"在相同起点下,哪种推理路径更有效",而不是简单地学习"这道题的标准答案是什么"
  • 用组内奖励做相对优势估计(Relative Advantage Estimation):计算每条推理链的奖励分数后,不是直接用绝对奖励值来指导优化,而是先在组内进行归一化处理,计算每条推理链相对于组内平均水平的优势。这种相对优势估计的核心思想是:“重要的不是这条推理链得了多少分,而是它比同组其他推理链好多少”。通过这种组内归一化,模型学到的不是"如何解决简单题"或"如何解决难题",而是"面对同一道题,什么样的推理策略更有效"。这种相对比较机制大大提高了训练的稳定性和样本效率
  • 省掉 PPO 常见的 value model(Value-Free Optimization):这是GRPO相对于传统PPO算法最重要的工程创新。传统的PPO需要训练一个单独的价值网络(value model)来估计每个状态的长期价值,这个价值网络与策略网络一样大,几乎使训练成本翻倍。GRPO通过组内相对比较机制,直接从奖励信号中估计优势函数,完全不需要额外的价值网络。这不仅节省了大量计算资源和显存,也避免了价值网络训练不稳定带来的问题。对于大规模语言模型的推理训练来说,这种简化使得工程实现变得更加可行

直观理解 GRPO 的核心思想:在评估同一道题的多个候选答案时,不仅要看每条答案的绝对得分,更要关注它相对于同组其他候选答案的表现如何。这种相对比较的策略带来了多个工程优势,使得大规模推理训练更加可行:

  1. 不需要单独训练 value model(显著节省计算资源):传统的 PPO 算法需要额外训练一个价值网络来估计状态价值,这会使训练成本翻倍。GRPO 通过组内相对比较直接估计优势,省去了这个昂贵的组件。
  2. 相对优势估计更加稳定(同组样本共享难度基线):同一个 prompt 生成的所有候选答案面对的是同一道题,它们的难度是一致的。通过组内归一化,模型学到的是"什么样的推理策略更好",而不是"这道题简单还是难"。
  3. 可以有效处理稀疏奖励场景(只要组内存在差异即可):即使大部分候选答案都失败了,只要有少数几个成功,或者失败的程度有所不同,归一化后仍然能产生有意义的梯度信号。

2.2 GRPO 的组内相对优势

importnumpyasnpdefgrpo_group_advantages(rewards:list[float],eps:float=1e-6)->np.ndarray:""" GRPO 的组内优势归一化。 Args: rewards: 同一个 prompt 的多条 rollout 的奖励,例如 [1, -1, -1, 1, -1, 1, -1, 1] eps: 数值稳定性参数 Returns: 归一化的优势值,用于策略梯度更新 """r=np.asarray(rewards,dtype=np.float32)# 组内归一化:减均值,除标准差return(r-r.mean())/(r.std()+eps)# 示例:同一道题的 8 条推理链rewards=[1,-1,-1,1,-1,-1,-1,1]# 4 条成功,4 条失败advantages=grpo_group_advantages(rewards)print(advantages)# 输出约为:[1.06, -0.71, -0.71, 1.06, -0.71, -0.71, -0.71, 1.06]# 成功的链得到正优势,失败的链得到负优势

这个归一化机制的关键洞察在于:通过组内相对比较来估计优势,而不是依赖绝对评分。这种设计的优雅之处在于其鲁棒性:即使所有候选答案的奖励都是 -1(全部失败),只要它们之间存在细微的质量差异(比如某条推理链虽然最终答案错误,但中间步骤更接近正确方向),归一化后仍然能产生有意义的优势估计。这意味着即使在训练早期模型表现很差的阶段,GRPO 也能从失败的尝试中提取学习信号,引导模型朝着更好的方向改进。

2.3 长链推理为什么会涌现

R1-Zero 最具研究价值的发现,是训练过程中自发涌现了更长的推理链,以及自我验证、回溯、替代解法等复杂推理行为。这些现象的重要性在于:它们不是通过人工设计的提示模板或监督数据教给模型的,而是模型在纯粹的奖励优化压力下,自主发现并采用的有效策略。

这些复杂推理行为的出现并非偶然,而是模型在奖励压力下发现的理性选择。换句话说,模型通过大量的试错学习,逐渐发现某些推理策略(如自我验证、回溯修正)能够更稳定地获得正奖励,因此这些策略在训练过程中被不断强化。从优化目标的角度分析,我们可以理解为什么这些行为会自然涌现:

  1. 多算一步的收益:在关键步骤后增加验证步骤,模型可以及早发现错误并修正,从而提高最终奖励
  2. 检查的边际价值:当模型不确定时,写出"让我检查一下"并重新推导,比直接猜测更可能得到正奖励
  3. 换个角度的探索:如果当前路径卡住,尝试替代方法(换公式、换坐标系)可能打开新路径
  4. 奖励塑造的自然结果:更长的推理链意味着更多修正机会,只要最终答案对,中间的探索成本被摊销

2.4 从能力涌现到可用模型

纯强化学习训练也暴露了明显的工程问题。DeepSeek 官方仓库坦诚地指出,R1-Zero 存在语句重复、可读性差和中英文混杂等影响用户体验的问题。这些问题虽然不影响最终答案的正确性,却严重制约了模型作为实用助手的可用性。从实际应用的角度看,一个推理正确但表达混乱的模型,往往难以获得用户信任,也不便于后续的审计和调试。这些可用性问题的存在,凸显了从实验室原型到生产系统之间的巨大鸿沟。

问题的根源并不难理解:如果奖励函数主要关注最终答案的正确性和基本格式规范,模型就会优先优化"答对题"这个目标,而不会主动优化"让人类读得清楚、舒服"这个维度。在奖励信号的引导下,模型学会了有效推理,但没有学会优雅表达。这个现象恰好解释了为什么正式版 DeepSeek-R1 不是坚持"纯 RL 到底"的理想主义路线,而是务实地引入了多阶段工程化流程。

正式版 DeepSeek-R1 采用了一个精心设计的多阶段训练流水线,将纯强化学习的能力涌现与工程化的可用性保障相结合。这个流水线不是简单的线性堆叠,而是在不同阶段有针对性地解决特定问题:从格式规范、能力强化、模式固化到通用性保持,每个阶段都有明确的目标和数据策略:

阶段作用数据来源训练方法
Cold-start SFT提供可读格式基础少量人工标注高质量推理示例监督微调
推理专项 RL强化数学/代码/逻辑能力领域任务数据集GRPO + 领域奖励
拒绝采样 SFT固化高质量推理模式RL 轨迹中筛选高分样本监督微调
通用能力混合保持对话和事实问答能力混入通用任务数据监督微调
后续 RL兼顾推理和对齐推理 + 对齐混合数据GRPO + 混合奖励

从工程实践的角度来看,更准确的表述应该是:R1-Zero 通过纯强化学习实验证明了推理能力可以自然涌现,而正式版 R1 则是将这种原始的能力打磨、规范和整合,最终转化为一个可用性更高、交互体验更好的实用助手模型。这个从原型到产品的转化过程,体现了理想与现实之间的平衡,也揭示了将研究成果工程化所必须跨越的鸿沟:不仅要追求能力的上限,更要确保能力的稳定性、可控性和用户体验。

3. DAPO:推理训练的系统工程化

3.1 复现问题比算法口号更重要

在 DeepSeek-R1 展示了推理能力涌现的可能性之后,AI 社区面临的核心挑战已经从"强化学习对推理任务有没有用"转变为更加实际的工程问题:“我们能不能稳定地训练出这样的模型、能不能在不同环境下复现结果、训练过程中的指标是否真实反映了推理能力的提升”。这些问题直接关系到 Reasoning RL 能否从少数顶尖实验室的研究成果,转变为更广泛的社区可以实践和应用的技术。

DAPO 项目的论文标题开门见山地表明了其定位:DAPO: An Open-Source LLM Reinforcement Learning System at Scale(DAPO:大规模开源大语言模型强化学习系统)。算法名称展开为Decoupled Clip and Dynamic Sampling Policy Optimization(解耦裁剪与动态采样策略优化)。论文摘要清晰地指出了当前推理模型训练面临的核心挑战:

  • 推理模型的关键训练细节往往没有完全公开
  • 社区很难复现大规模 RL 结果
  • DAPO 开放训练代码、基于 verl 的系统、处理后的数据集
  • 在 Qwen2.5-32B base 上报告达到 AIME 2024 50 分——这一成绩具有重要的标志性意义。AIME(美国数学邀请赛)是面向高中生的顶级数学竞赛,满分75分,而50分已经超过了大多数人类参赛者的水平。更重要的是,这个结果是在相对较小的32B参数模型上实现的,证明了DAPO训练系统的高效性。此外,这一成绩的可复现性得到了验证——DAPO团队公开了完整的训练代码、数据处理流程和系统架构,使得社区成员能够在类似的资源条件下重现这一结果,这对于推动开源AI生态的发展具有重大价值

DAPO 最值得学习的不是某个单点技巧,而是把 reasoning RL 训练拆成可监控系统。这种系统化的思路意味着:训练过程不再是一个黑盒,而是被分解为多个可观测、可调控的模块;每个模块都有明确的输入输出和质量指标;当训练出现问题时,可以快速定位是哪个环节出了问题。这种工程化的视角,将"能否训练出推理能力"这个科学问题,转化为"如何稳定、可复现地训练推理能力"这个工程问题,为实际部署奠定了基础。

3.2 DAPO 的四个核心机制

机制问题解决方案效果
Clip-HigherPPO 的对称 clip 限制高优势动作更新解耦上下 clip,高优势动作可以有更大更新空间加速收敛,提高峰值性能
Dynamic Sampling全对或全错的组无法提供有效梯度过滤全对/全错组,确保组内有成功和失败减少无效样本,提高训练效率
Token-Level Policy Gradient长序列的 token 梯度信号被稀释让每个 token 更直接参与损失统计长链推理训练更稳定
Overlong Reward Shaping推理链撞到最大长度导致奖励噪声对超长样本的奖励做特殊处理减少长度偏置

直观理解:模型会不会推理是一回事,训练过程能不能稳定地产生有效梯度又是另一回事。即使我们已经证明了强化学习可以激发模型的推理能力,但在实际训练中,梯度的方差、采样效率、奖励信号的稀疏性等问题仍然会严重影响训练的稳定性和收敛速度。DAPO的四个核心机制正是针对这些训练工程问题提出的解决方案,它们共同确保训练过程能够稳定地将奖励信号转化为模型能力的提升。

3.3 动态采样的代码示例

动态采样的核心思路:全对样本和全错样本都不一定提供有效相对信息。全对说明题可能太简单,模型已经掌握,继续训练这类样本无法带来新的学习信号;全错说明当前策略还找不到路径,强行训练可能引入噪声梯度。真正有训练价值的是同题下既有成功也有失败的 rollout,因为这种对比能够清晰地告诉模型"哪些推理路径更可能成功",从而产生有效的策略改进信号。

defkeep_prompt_for_training(rewards:list[int])->bool:""" 动态采样的核心判定:同组里至少要有成功和失败。 Args: rewards: 同一个 prompt 的所有 rollout 的奖励值 Returns: True 表示保留这个 prompt 的样本用于训练 """has_success=any(r>0forrinrewards)has_failure=any(r<=0forrinrewards)returnhas_successandhas_failuredefdynamic_sample(prompt,model,reward_fn,group_size=16,max_rounds=4):""" 动态采样:持续采样直到组内既有成功也有失败,或达到最大轮次。 Args: prompt: 输入问题 model: 策略模型 reward_fn: 奖励函数 group_size: 每轮采样数量 max_rounds: 最大采样轮次 Returns: (rollouts, rewards) 或 (None, None) 如果无法满足条件 """rollouts=[]rewards=[]forround_idxinrange(max_rounds):# 采样一批新的 rolloutnew_outputs=model.sample(prompt,n=group_size)rollouts.extend(new_outputs)rewards.extend([reward_fn(prompt,y)foryinnew_outputs])# 检查是否满足条件ifkeep_prompt_for_training(rewards):returnrollouts,rewards# 达到最大轮次仍未满足条件,丢弃这个 promptreturnNone,None

3.4 GSPO 的序列级优化

GSPO 的问题意识又往前推了一步。很多 RL 训练里,奖励是给整条 response 打分,但 importance ratio 却在 token 级计算。这种粒度不匹配带来的问题在长链推理场景下尤为突出:我们用一个总体奖励信号来评价整条推理链的质量,却在每个token的层面独立计算策略变化程度,这导致优化目标与评估粒度之间存在根本性的脱节。GSPO正是针对这一问题提出的解决方案,将优化粒度提升到与奖励粒度相匹配的序列级别。

对短回答来说,这个错配还能被噪声掩盖;对长链推理、MoE 架构和大规模训练来说,token 级 ratio 会带来:

  1. 更高方差:每个 token 的新旧策略概率比独立计算,长序列累积误差
  2. 基础设施负担:需要存储和计算每个 token 的 logprob
  3. 优化粒度不匹配:奖励看整条链,但更新看每个 token

Qwen 团队提出的GSPO(Group Sequence Policy Optimization)把 importance ratio 提升到 response 级,从根本上解决了粒度不匹配的问题。这种设计的核心思想是:既然我们用一个总体奖励来评估整条推理链,那么在计算策略变化时,也应该在整条推理链的层面进行衡量,而不是让每个token独立承担高噪声的校正信号。具体来说,GSPO实现了以下机制:

  • 用整条响应的新旧策略似然差做长度归一化
  • 做序列级 clipping、rewarding 和 optimization:在计算策略梯度时,所有关键操作都在序列级别进行。Clipping(裁剪)限制整条推理链的策略变化幅度,防止单次更新改变过大;Rewarding(奖励分配)基于整条推理链的最终结果;Optimization(优化)针对整条序列的生成概率进行梯度更新。这种序列级的统一处理方式,使得优化目标与评估标准保持一致,避免了token级操作带来的粒度不匹配问题。相比传统方法对每个token独立进行裁剪和更新,序列级操作能够更好地捕捉推理链的整体质量,减少优化过程中的方差
  • 与奖励粒度对齐:奖励评估整条链,优化也在整条链层面
importmathdefgspo_sequence_ratio(new_logprobs:list[float],old_logprobs:list[float])->float:""" GSPO 序列级 importance ratio。 Args: new_logprobs: 同一条 response 每个 token 在新策略下的 log probability old_logprobs: 同一条 response 每个 token 在旧策略下的 log probability Returns: 序列级的 importance ratio(长度归一化后) """assertlen(new_logprobs)==len(old_logprobs),"长度必须一致"# 平均 log ratio(长度归一化)mean_log_ratio=sum(n-oforn,oinzip(new_logprobs,old_logprobs))/len(new_logprobs)# 转换回概率空间returnmath.exp(mean_log_ratio)defgspo_clipped_objective(seq_ratio:float,advantage:float,eps:float=0.2)->float:""" GSPO 的 clipped objective(序列级)。 Args: seq_ratio: 序列级 importance ratio advantage: 序列级优势值 eps: clip 范围 Returns: clipped objective value """# 标准 PPO clipclipped_ratio=min(max(seq_ratio,1-eps),1+eps)# 取两者最小值(悲观估计)returnmin(seq_ratio*advantage,clipped_ratio*advantage)

3.5 工程启发:优化粒度贴近奖励粒度

从工程角度看,GSPO 的启发是:优化粒度要贴近奖励粒度。这个原则对于设计可靠的强化学习训练系统具有重要的指导意义。当奖励信号和优化机制工作在不同的抽象层次上时,训练过程容易出现信号失配、梯度方差过大等问题。因此,在设计训练流程时,应该确保评估模块(如verifier、reward model)与优化模块(如policy gradient计算)在同一粒度上协同工作,从而提高训练的稳定性和效率。

如果 verifier 判断的是整条推理链是否成功,那么更新时也应该更关心整条链是否仍在可信的策略变化范围内,而不是让每个 token 独自承担高噪声校正。这种粒度对齐的设计哲学,不仅适用于GSPO,也为其他强化学习训练系统提供了有价值的参考:当我们用序列级的成功标准来评估模型时,优化器也应该在序列级别控制策略更新的幅度,避免token级的细粒度操作带来的累积误差和方差放大。

Qwen 官方博客在介绍GSPO时特别强调了几个在工程实践中至关重要的优势,这些优势不仅关乎训练效果,更直接影响到大规模部署的可行性。作为全球领先的开源大模型团队,Qwen的实践经验具有很高的参考价值。他们的观察表明:

  • GSPO 对 MoE(Mixture of Experts,专家混合)模型训练更稳定——这一点对于大规模模型部署尤为关键。MoE架构通过动态路由机制激活不同的专家模块,在推理效率和模型容量之间实现了良好平衡,但这种动态性也给强化学习训练带来了额外的稳定性挑战。GSPO的序列级importance ratio设计能够更好地适应MoE的路由波动,避免token级操作在专家切换时产生的梯度不稳定问题,使得训练过程更加平滑可控
  • 可能减少 Routing Replay 和训练引擎重算 logprob 的基础设施压力

…详情请参照古月居

http://www.jsqmd.com/news/1273073/

相关文章:

  • AI Agent 面试题 576:如何实现多Agent系统的协作结果聚合?
  • 杰理之蓝牙通话声音卡顿严重【篇】
  • simulink状态机使用说明
  • 基于TI C2000的无传感器BLDC梯形波控制:从原理到工程实践
  • 大模型如何革新数据标注:自动化方案与实践
  • DDD CQRS架构和传统架构的优缺点比较
  • 企业业务快照_business-pulse
  • 晚风棱镜数字权益深耕虚拟商品赛道
  • 图像标注四类方法详解|分类+检测+分割+关键点标注实操+耗时对比
  • 基于HashiCorp Vault构建企业级密钥管理与灾难恢复实战指南
  • Measuring what Matters: Construct Validity in Large Language Model Benchmarks
  • 人工智能训练师证书含金量分析:补贴3120元+积分落户+求职薪资真实价值
  • 试试这个AI邪修方法,让你刷推特时间节省%
  • Python构建汽车销量分析系统:从数据采集到商业洞察
  • 低压配电网WLS状态估计技术实践与优化
  • 5分钟掌握ZenTimings:AMD Ryzen内存监控的终极指南
  • AI Agent 面试题 577:多Agent系统中的通信安全和消息认证
  • 影刀RPA学习计划:一个月系统掌握RPA的完整方案
  • C55x DSP代码优化实战:从硬件循环到双MAC指令的极致性能调优
  • AM57xx硬件设计实战:从系统规划到PCB布局的避坑指南
  • 数据质量评估六大标准|准确性+完整性+一致性+Cohen Kappa系数
  • redhat系linux网卡绑定bond设置
  • 从物理模拟到世界模型,具身智能机器人如何练就真实世界的常识
  • TMS570LS0914安全MCU实战:从锁步双核到功能安全应用开发
  • 西安闲置包包别乱卖!2026靠谱奢侈品包包回收渠道、行情全解析 - 奢侈品回收探店ing
  • 常州武进湖塘合扬包包回收,轻微磨损旧包可免费评估价格 - 生活商业速报
  • 大模型推理性能优化:三维框架与实战策略
  • API 402错误诊断与解决:从余额告警到架构优化
  • 大模型Skill开发:标准化能力封装与工程实践
  • 一文讲清广州越秀第二类医疗器械经营备案公司口碑好:广州机构推荐测评及横向对比 - GrowthUME