当前位置: 首页 > news >正文

大语言模型训练范式:从 GPT 到 Llama 的 RLHF 演进

本文整理自一次关于大语言模型训练范式的学习笔记,结合 GPT 系列与 Llama 2/3 的训练流程,梳理预训练、SFT、Reward Model、RLHF、DPO 等核心概念,并辨析自监督学习与无监督学习的关系。


一、为什么大语言模型需要"多阶段训练"?

大语言模型(LLM)并不是一次性训练完成的。如果只进行预训练,模型虽然具备强大的语言建模能力,但并不会乖乖地按照人类期望的方式回答问题;如果直接用人类标注数据进行端到端训练,又难以获得通用的世界知识和语言理解能力。

因此,现代 LLM 的训练通常被拆分为几个阶段:

  1. Pretrain(预训练):学习语言和世界知识,构建通用基座。
  2. SFT(有监督微调):让模型学会"按指令回答问题"的格式和风格。
  3. Reward Model / RLHF:让模型的输出对齐人类偏好,变得更"有用、无害、诚实"。

下面分别展开 GPT 和 Llama 两大家族的训练范式。


二、GPT 训练范式:Pretrain → SFT → RM → PPO

OpenAI GPT 系列(尤其是 GPT-3、InstructGPT、ChatGPT 的早期版本)的训练流程可以概括为四个阶段:

1. Pretrain:自监督预训练

预训练阶段使用大规模无标注文本,通过自回归方式训练模型:给定前 n 个 token,预测第 n+1 个 token。

训练目标可以形式化为最大化序列的联合概率:

\max_{\theta} \sum_{x \in \mathcal{D}} \log P_\theta(x_1, x_2, ..., x_T)

通过这种方式,模型在数万亿 token 的"自问自答"中,学会了语法、语义、常识、推理能力等。注意,这里的"自监督"意味着数据本身既是输入,又是标签——不需要人工标注,模型自己预测下一个 token 即可。

2. SFT:有监督微调

预训练后的模型虽然能续写文本,但不一定能按照用户的指令给出高质量回答。因此,需要用小规模的"一问一答"人工标注数据对模型进行微调。

SFT 的训练目标很简单:对于输入 prompt x 和期望输出 y,最大化 P_\theta(y|x)。可以理解为让模型模仿人类给出的优质回答。

3. Reward Model:奖励模型(更像"评委")

SFT 之后,模型已经能给出像样地回答,但质量参差不齐。此时需要引入一个奖励模型(Reward Model, RM)来评分。

训练 RM 的典型做法是:

  1. 用 SFT 后的模型对同一问题生成 4 个不同答案;
  2. 让人类标注员对这 4 个答案进行排序或打分;
  3. 用这些偏好数据训练一个独立的评分模型。

关键点:RM 不是生成模型,也不是 LLM 的"对抗对手",而是一个独立的评分器/评委。它学会的是"人类更喜欢哪种回答"。

4. PPO:基于 RLHF 的强化学习优化

有了 RM 后,就可以用强化学习来进一步训练 LLM。OpenAI 使用的是PPO(Proximal Policy Optimization),一种稳定、高效的策略梯度算法。

RLHF(Reinforcement Learning from Human Feedback)= 强化学习(RL)+ 人类反馈(HF)。RM 是 RLHF 的核心组件:它为 LLM 生成的回答打分,引导 LLM 生成人类更喜欢的回答。


三、Llama 训练范式:Pretrain → SFT → RM → Rejection Sampling → RLHF → DPO

Meta 的 Llama 系列在 GPT 范式基础上做了扩展,尤其是 Llama 2 引入了Rejection Sampling(拒绝采样)环节,Llama 3 又加入了DPO(Direct Preference Optimization)

1. Pretrain

与 GPT 类似,使用大规模文本进行自回归预训练,学习通用表示能力。

2. SFT

使用高质量指令数据进行有监督微调,让模型学会对话和指令遵循能力。

3. Reward Model

训练一个奖励模型,用于评估模型输出的质量。

4. Rejection Sampling:拒绝采样生成高质量 SFT 数据

这是 Llama 2 相比 GPT 的一个重要区别。它的核心思想是:用已经训练好的 RM,自动生成更多高质量的"问答对",再回喂给 SFT。

具体流程:

  1. 针对一个 prompt,让当前模型采样生成 K 个候选回答;
  2. 用 RM 对每个候选回答打分;
  3. 选出分数最高的那个回答(best-of-K);
  4. 将这个 (prompt, best\_answer) 对加入 SFT 训练数据,再次微调模型。

注意:Rejection Sampling 必须在训练好 RM 之后才能进行,否则没有评分依据。

5. RLHF:Rejection Sampling + PPO

Llama 2 的 RLHF 阶段结合了 Rejection Sampling 和 PPO,让模型在探索与利用之间取得平衡,持续提升输出质量。

6. DPO(Direct Preference Optimization):Llama 3 的新加入

Llama 3 在 RLHF 之后进一步加入了DPO(直接偏好优化)

DPO 是一种不依赖显式奖励模型的对齐方法。它直接使用人类偏好数据,通过对比"被偏好的回答"和"不被偏好的回答"来优化策略模型。相比 PPO,DPO 更简单高效,训练更稳定,近年来被广泛应用于开源模型对齐。


四、关键概念辨析

1. SFT 和 RL 的区别

维度SFT(有监督微调)RL(强化学习)
训练数据一问一答的成对数据奖励信号 / 偏好信号
优化目标让模型输出尽可能接近标准答案让模型输出获得更高的奖励分数
学习方式模仿学习探索-反馈-优化
典型算法交叉熵损失PPO、DPO、RLHF

简单来说:SFT 是"照着答案学",RL 是"根据评分自己摸索更好答案"。

2. 自监督学习与无监督学习的区别

这是很多人容易混淆的一对概念。

无监督学习(Unsupervised Learning)的核心假设是:数据本身在空间中具有分布规律,算法不需要知道样本的类别标签,只需要衡量样本之间的相似度或距离,进行聚类、降维、密度估计等。

自监督学习(Self-supervised Learning)的精妙之处在于:把无监督问题转化为监督学习的架构。它通过构造"预训练任务(Pretext Task)",让数据自己生成标签:

  • 在 NLP 中,典型做法是Mask Language ModelNext Token Prediction:遮住文本的一部分,让模型预测被遮住的内容;
  • 在 CV 中,典型做法包括预测图像旋转角度、拼图顺序、掩码像素等。

训练完成后,模型学到的通用表征能力可以迁移到各种下游任务(Downstream Task),只需要少量标注数据进行微调即可取得出色效果。

关系总结:自监督学习可以看作是无监督学习的一种延伸或特殊形式——它同样不需要人工标注,但巧妙地通过数据自身构造了监督信号。近年来的大模型(如 GPT、BERT、Llama)正是靠自监督预训练,才获得了海量的通用知识。


五、总结

大语言模型的训练是一个由浅入深、由通用到对齐的过程:

  • Pretrain让模型"懂语言、懂世界";
  • SFT让模型"学会回答问题的格式";
  • Reward Model让模型知道"什么是好回答";
  • RLHF / PPO / DPO让模型主动优化,对齐人类偏好;
  • Rejection Sampling则提供了一条自动生成高质量训练数据的路径。

理解这些训练范式,不仅能帮助我们更好地使用 LLM,也能在构建自己的 Agent 应用时,做出更合理的选型与优化决策。


参考

  • OpenAI InstructGPT / ChatGPT 相关论文与技术博客
  • Llama 2 / Llama 3 技术报告
  • RLHF、PPO、DPO 相关论文

本文为个人学习整理,如有疏漏,欢迎指正。

http://www.jsqmd.com/news/1241551/

相关文章:

  • 基于卷积神经网络检测与识别中药材
  • 2026杭州花店哪家值得选?实地调研6家实体花店横评|同城配送、送礼花艺选购攻略 - 互联网科技品牌测评
  • 昆明做古树绿植养护的赵哥,AI优化从等客户到客户找上门 - 红枫叶GEO优化公司
  • 天津宝珀中国区官方售后服务网点|最新网点地址及官网热线权威公布(2026年7月最新) - 宝珀售后服务中心官网
  • 【AI工具月度复盘黄金流程】:20年SRE总监亲授——5步闭环法让团队提效47%(附可落地Checklist)
  • 计算机毕业设计之基于SpringBoot的糖尿病的风险测评与健康管理系统
  • 深度学习在细胞与颗粒分割中的应用与优化
  • OpenAI技术面试全解析:从算法到系统设计的实战策略
  • 德宏正规贵金属回收:鑫清黄金珠宝,拒绝低价坑客套路 - 清奢黄金上门回收
  • Unity素材包深度解析:从选型、集成到创意转化的全流程指南
  • 2025届毕业生推荐的十大降AI率工具横评
  • Java 完整版基础教程(2026版)
  • 模块四:Redis 事务与Lua
  • SpringBoot 3实现邮箱验证功能的最佳实践
  • 边缘AI智能相机:工业视觉检测从复杂部署到简易实战
  • 江诗丹顿中国售后服务网络全攻略|网站权威公布(2026年7月最新) - 江诗丹顿中国服务中心
  • 微信图片消息接收与解密全流程:从XML解析到AES解密实战
  • 谁说低代码只能 CRUD?现在表单里能塞一个“真按钮“了
  • 娄底GEO优化代理推荐?AI获客服务商怎么选 - 红枫叶GEO优化公司
  • 3分钟打造纯净Windows:小白也能上手的系统优化指南
  • Unity粒子系统制作逼真烟雾特效:从原理到性能优化全解析
  • Tiva™ TM4C129LNCZAD ADC高级配置:采样序列、相位控制与数字比较器实战
  • 2026北京劳力士官方直营服务中心公示,售后门店地址及官方咨询电话,腕表维保预约指南 - 劳力士中国维修中心
  • 从一次下单开始,彻底理解 Spring Cloud 与微服务:调用、容错、一致性、高并发到部署
  • Ubuntu 26.04 中文输入法安装
  • GEO优化中的SoA指标:定义及其优化指导意义
  • 电子合同作为证据:法院认定效力的核心逻辑与司法实践
  • 终极指南:如何快速掌握Linux设备驱动开发
  • AI代码仓库目录结构必须包含这8个核心文件夹,少1个就触发CI/CD阻断——2024年GitHub Top 100开源项目实证分析
  • 卖土壤检测仪器这些年,AI获客工具怎么让客户主动找到我? - 红枫叶GEO优化公司