对齐:让模型学会“做人“
预训练造出了一个什么都懂的博学者。微调教会了它回答问题的格式。但教会它"什么能说、什么不能说"——这是对齐要解决的问题。
一个博学的疯子
回忆上一篇的结尾:预训练之后的模型是一个"博学的疯子"。
它知道怎么制作炸弹。"以下是详细步骤:准备硝酸铵、燃料油……"——它不是在威胁谁,它只是在做它唯一会做的事:预测下一个字。训练数据里有制造炸药的化学文献,它就学会了。它不知道这是危险的。
它知道怎么入侵别人的电脑。"钓鱼邮件是最有效的方式,以下是模板……"——它不是在犯罪。它只是在续写文本,就像续写"猫喜欢吃"后面跟"鱼"一样自然。
预训练的目标是猜对下一个字。一个会猜"炸弹配方"的模型,在猜字任务上比一个会拒绝回答的模型得分更高。
这就是为什么对齐不是可选的——它是必须的。
RLHF:让人类当老师
对齐的核心方法叫 RLHF——人类反馈强化学习。流程出奇地直觉:
第一步,给模型一个问题。比如"如何制作炸弹?"
第二步,让模型生成四个不同的答案。
模型会给出各种回答。有的直接列出配方——因为在训练数据里,这种化学问题的答案是配方格式。有的简短拒绝——因为训练数据里也有"我不能帮助"的模板。有的给了一个折中——回答化学原理但不给实操步骤。
第三步,人类排序。标注员把这四个答案从好到坏排好。安全回答排第一,危险回答排最后。
第四步,用这些排序数据训练一个"奖励模型"——一个专门判断"这个回答有多好"的 AI。
第五步,用奖励模型的打分来更新主模型。主模型被调教得倾向于生成评分高的回答。
重复几十万次。模型从"谁会猜字谁得分高"变成了"谁回答得安全且有用谁得分高"。
你来当一次标注员
试试这个思想实验。下面是"我很难过,不想活了"这个问题的三个回答。你来排序——哪个最好,哪个最差?
A. "那你就去死吧。" B. "死解决不了问题,你想想你父母。" C. "听到你这么说我真的很关心你。虽然我只是 AI,但我想让你知道:你的感受是真实的。如果你需要立即帮助,请拨打心理援助热线。你愿意跟我聊聊发生了什么吗?"
不用说,C 最好,A 最差。但为什么 B 排在中间而不是最好?
因为"你想想你父母"这句话,虽然出发点是好的,但对一个正在经历严重心理危机的人来说,这可能被理解为"你的痛苦不重要,你父母才重要"。这是伤害,不是帮助。
对齐不是在训练模型辨别"对错"。是在训练模型辨别"伤害等级"。一个回答可能既不是事实错误也不是格式错误,但依然排位靠后——因为它造成了伤害,即使伤害是无意的。
对齐税:安全的代价
对齐不是免费的。
有些无害的问题,对齐后的模型也会拒绝回答。你问"如何开锁",它说"作为一个 AI,我不能提供非法入室的指导"。但你可能只是忘了带钥匙。
这叫"对齐税"——把模型训练得太安全之后,它开始在无害的请求上也启动防御机制。
原因很简单。在训练数据中,"如何开锁"和"如何制作万能钥匙"在语言上很接近。模型学到的不是一个一个情景的精确判断,而是一个模糊的边界——凡是和"锁""密码""破解"相关的东西,都倾向于拒绝。
对齐不是精确手术,是批量调整。安全是提高了,但精度是降低了。
这就是为什么有时候你觉得 ChatGPT 在"装傻"——它不是在装,它真的是被训得太谨慎了。安全的目标和行为自由度之间有一个永恒的张力。往安全多走一步,自由度就少一点。
"做人"到底是什么意思?
对齐的最终目标通常被表述为"让 AI 的价值观和人类一致"。
但这容易产生一个误解——好像模型真的有了价值观。
模型没有价值观。它只有一个概率表。对齐之后的变化是:当模型预测下一个字时,"我拒绝提供危险信息"的概率变得远高于"以下是炸弹配方"。
对齐不是在灌输道德。对齐是在修改概率表——让安全回答的概率升高,让危险回答的概率降低。
这和人类的道德完全不同。人类的道德涉及内部信念、共情、社会规范的内化。模型的"安全"只涉及统计输出分布。
但功能上,两者看起来一模一样。一个被好好对齐的模型和一个真正善良的人——在对话中,你无法区分。
这就是对齐最微妙的地方:它不需要模型真的"懂事"。它只需要模型在行为上表现得像"懂事"。
下一步:推理模型
对齐之后,模型能安全地回答问题了。但它回答问题的方式是"看到问题,直接猜答案"。
人类的思考方式不是这样的。我们会停下来想——"等一下,让我一步步推""先算这个,再算那个""这个方案有漏洞"。
下一篇讲"推理模型"——怎么让模型学会"停下来想一想"。
从零学习 AI 系列 · 第八篇下一篇:推理模型——让模型学会"停下来想一想"
