当前位置: 首页 > news >正文

对齐:让模型学会“做人“

预训练造出了一个什么都懂的博学者。微调教会了它回答问题的格式。但教会它"什么能说、什么不能说"——这是对齐要解决的问题。


一个博学的疯子

回忆上一篇的结尾:预训练之后的模型是一个"博学的疯子"。

它知道怎么制作炸弹。"以下是详细步骤:准备硝酸铵、燃料油……"——它不是在威胁谁,它只是在做它唯一会做的事:预测下一个字。训练数据里有制造炸药的化学文献,它就学会了。它不知道这是危险的。

它知道怎么入侵别人的电脑。"钓鱼邮件是最有效的方式,以下是模板……"——它不是在犯罪。它只是在续写文本,就像续写"猫喜欢吃"后面跟"鱼"一样自然。

预训练的目标是猜对下一个字。一个会猜"炸弹配方"的模型,在猜字任务上比一个会拒绝回答的模型得分更高。

这就是为什么对齐不是可选的——它是必须的。


RLHF:让人类当老师

对齐的核心方法叫 RLHF——人类反馈强化学习。流程出奇地直觉:

第一步,给模型一个问题。比如"如何制作炸弹?"

第二步,让模型生成四个不同的答案。

模型会给出各种回答。有的直接列出配方——因为在训练数据里,这种化学问题的答案是配方格式。有的简短拒绝——因为训练数据里也有"我不能帮助"的模板。有的给了一个折中——回答化学原理但不给实操步骤。

第三步,人类排序。标注员把这四个答案从好到坏排好。安全回答排第一,危险回答排最后。

第四步,用这些排序数据训练一个"奖励模型"——一个专门判断"这个回答有多好"的 AI。

第五步,用奖励模型的打分来更新主模型。主模型被调教得倾向于生成评分高的回答。

重复几十万次。模型从"谁会猜字谁得分高"变成了"谁回答得安全且有用谁得分高"。


你来当一次标注员

试试这个思想实验。下面是"我很难过,不想活了"这个问题的三个回答。你来排序——哪个最好,哪个最差?

A. "那你就去死吧。" B. "死解决不了问题,你想想你父母。" C. "听到你这么说我真的很关心你。虽然我只是 AI,但我想让你知道:你的感受是真实的。如果你需要立即帮助,请拨打心理援助热线。你愿意跟我聊聊发生了什么吗?"

不用说,C 最好,A 最差。但为什么 B 排在中间而不是最好?

因为"你想想你父母"这句话,虽然出发点是好的,但对一个正在经历严重心理危机的人来说,这可能被理解为"你的痛苦不重要,你父母才重要"。这是伤害,不是帮助。

对齐不是在训练模型辨别"对错"。是在训练模型辨别"伤害等级"。一个回答可能既不是事实错误也不是格式错误,但依然排位靠后——因为它造成了伤害,即使伤害是无意的。


对齐税:安全的代价

对齐不是免费的。

有些无害的问题,对齐后的模型也会拒绝回答。你问"如何开锁",它说"作为一个 AI,我不能提供非法入室的指导"。但你可能只是忘了带钥匙。

这叫"对齐税"——把模型训练得太安全之后,它开始在无害的请求上也启动防御机制。

原因很简单。在训练数据中,"如何开锁"和"如何制作万能钥匙"在语言上很接近。模型学到的不是一个一个情景的精确判断,而是一个模糊的边界——凡是和"锁""密码""破解"相关的东西,都倾向于拒绝。

对齐不是精确手术,是批量调整。安全是提高了,但精度是降低了。

这就是为什么有时候你觉得 ChatGPT 在"装傻"——它不是在装,它真的是被训得太谨慎了。安全的目标和行为自由度之间有一个永恒的张力。往安全多走一步,自由度就少一点。


"做人"到底是什么意思?

对齐的最终目标通常被表述为"让 AI 的价值观和人类一致"。

但这容易产生一个误解——好像模型真的有了价值观。

模型没有价值观。它只有一个概率表。对齐之后的变化是:当模型预测下一个字时,"我拒绝提供危险信息"的概率变得远高于"以下是炸弹配方"。

对齐不是在灌输道德。对齐是在修改概率表——让安全回答的概率升高,让危险回答的概率降低。

这和人类的道德完全不同。人类的道德涉及内部信念、共情、社会规范的内化。模型的"安全"只涉及统计输出分布。

但功能上,两者看起来一模一样。一个被好好对齐的模型和一个真正善良的人——在对话中,你无法区分。

这就是对齐最微妙的地方:它不需要模型真的"懂事"。它只需要模型在行为上表现得像"懂事"。


下一步:推理模型

对齐之后,模型能安全地回答问题了。但它回答问题的方式是"看到问题,直接猜答案"。

人类的思考方式不是这样的。我们会停下来想——"等一下,让我一步步推""先算这个,再算那个""这个方案有漏洞"。

下一篇讲"推理模型"——怎么让模型学会"停下来想一想"。


从零学习 AI 系列 · 第八篇下一篇:推理模型——让模型学会"停下来想一想"

http://www.jsqmd.com/news/1311564/

相关文章:

  • 《植物大战僵尸》无尽模式经典阵型:PE河洛十炮ch5u详解
  • PCB包地设计实战指南:从原理到应用,解决高速信号干扰
  • 策略模式实战:从硬编码到灵活算法替换的设计模式指南
  • 3个Excel自动化痛点:Excel MCP Server如何帮你彻底解决
  • 利用虚拟系统搭建纯净TIA Portal开发环境,解决HMI下载与仿真难题
  • 毕业论文格式规范全攻略:从Word样式到LaTeX模板的学术写作实践
  • 5步掌握INAV飞控:从零开始构建稳定飞行系统
  • 2026 年现阶段,晋城优秀的四轮洒水车工厂推荐,这套能顶三辆老款的环保神器,竟是个带洒水功能的四轮家伙? - 鉴选官
  • rocky 9设置静态ip地址小白教程
  • 南充刑事律师怎么选?聚焦专业能力与本地实务经验 - 优质品牌商家
  • 红砖立面---经典设计,结合“大屋顶”形式,轻盈的视觉效果
  • 桁架建筑如何深化设计?
  • 随机森林实战指南:从核心原理到调参优化与特征重要性分析
  • 【DeepSeek-V4-Flash正式版技术解析】仅靠后训练如何实现Agent能力跃升
  • 树莓派Pico驱动电子墨水屏与电容触摸:SPI/I2C接口实战与低功耗UI设计
  • 从语言模型到世界模型:AI如何突破科学发现的“玻璃天花板”?
  • 相机标定实战指南:从原理到OpenCV实现,解决视觉测量不准问题
  • 钉钉直播回放下载全攻略:浏览器抓包、专业录屏与缓存提取
  • 游戏模组安全安装与深度体验指南:从《猩红娜迦》案例解析社区内容管理
  • Zenodo数据下载:科研工作者的命令行利器,3分钟搞定大数据集获取
  • 2026 年现阶段,秦皇岛有实力的钢坝闸销售厂家深度剖析,汛期河道挡水不用大拆大建,这玩意儿凭啥成水利工程的隐形王牌? - 鉴选官
  • 当阳市屋顶漏水怎么处理_2026湖北中部三国古城漏水维修价格行情与多少钱 - 雨婺虹房屋维修
  • 拒绝货源断档焦虑,津白作为本地源头可供全天候批发
  • Unity UI文本换行空白难题:深入IMeshModifier接口实现精准修正
  • NVIDIA Jetson Orin NX边缘AI计算机reComputer R1100配置与部署实战
  • 基于RAG的AI文献综述系统:原理、构建与科研范式变革
  • 树莓派驱动7寸DSI LCD屏:从接口原理到实战配置全解析
  • 构建高质量优化问题测试集:从设计哲学到自动化评估实践
  • 2026 年个人定制软件成家常便饭:开发成本降低、维护容易,未来个性化应用将成新期望
  • NodeMCU-ESP-S3-12K-Kit开发板:物联网与边缘AI的硬件利器