这篇文章,我们来了解下 AI 模型是如何学习新的技能和行为。
不要觉得本文很难,即使你没有机器学习的背景,也可以借助人类学习和工作的方式来理解 AI 训练这件事。毕竟现在 AI 模型越来越多地通过 Agent 参与到我们日常生活和工作。理解模型是如何学习,可以帮助我们理解一个 Agent 为什么会形成某种行为,以及如何去调整这些行为。
想不想让你的 GPT / Claude 更听话?请看下文:

理想同事
我们可以先把 AI 模型想象成一名同事,事实上现在市面上就有不少 Agent Team 的概念主打一个 AI 同事。
现在,我们来回忆下合作过的优秀同事,通常有哪些共同特征?
他们可能善于沟通,知道什么时候应该向他人求助,什么时候要独立解决问题。不仅如此,他们还友善、有同理心,能够理解他人的处境。更重要的是,他们面对一个并不明确的问题时,会主动寻找信息,拆解任务并推动事情向前发展。
想让模型表现得像这样的同事,首先得写下我们认为什么是“正确”的行为。这类行为定义文件有不同的名字,例如模型规范、AI 原则或模型宪法。它们会在团队内部统一模型的训练目标,也会成为评估模型行为时的评测依据。
OpenAI 将这类文件称为 Model Spec。它描述了模型在 OpenAI 产品和 API 中应当表现出的行为,包括模型应该如何处理不同来源的指令、怎样面对相互冲突的要求,以及在执行任务时应当遵循哪些边界。Model Spec 还定义了一套指令层级,让模型能够判断哪些指令拥有更高的优先级。
Anthropic 为 Claude 编写了 Claude’s Constitution(模型宪法)。它描述了希望 Claude 具备的价值、知识和判断能力,例如保持诚实、关注安全、接受人类监督,并在复杂情境中做出有益的选择。Anthropic 也在这份宪法中讨论了规则与判断之间的关系:明确规则能够提高可预测性,而良好的判断能力可以帮助模型应对规则没有提前覆盖的新情况。
Google 的 AI Principles 覆盖范围会更广,贯穿 AI 的设计、测试、部署、监控和后续改进。它强调适当的人类监督、安全测试、风险缓解、隐私保护以及部署后的持续反馈。
这些文件从不同层面回答了同一个问题:我们希望模型在能力越来越强之后,成为怎样的协作者?
人类的学习过程
人们是怎样才能把工作做得更好的呢?
一个简单的概括是:尝试困难的事情,经历失败,从中学习,再通过反复练习逐渐进步。
当一名新成员加入团队时,我们一般不会期待他第一天就能完全进入状态。他需要了解团队现在使用的系统和工具,熟悉项目背景,也需要观察同团队的成员是如何沟通、分工和做决定。
人类虽然并不完美,却很擅长学习新的技能,也善于将过去的经验保留下来,在下一次遇到相似问题时可以继续使用。
假设你想成为世界上最优秀的篮球运动员,可以采用两种方式提升自己。第一种方式是阅读所有与篮球有关的资料,了解战术、规则、技术动作以及优秀球员的经验。第二种方式是参加一万场比赛,在一次次进攻和防守中进行尝试,通过比赛结果、录像复盘和日常训练改善自己的判断。
知识和经验是两种不同的能力。理想情况下,我们希望同时拥有丰富的知识和充分的实践经验。优秀的运动员往往既理解比赛的理论知识,也参与过大量的比赛。
除了自身学习之外,人类还会借助教练加速训练进程。教练会观察你的表现,指出需要改进的地方,并不断让你面对接近当前能力上限的挑战。教练不会替你完成比赛,却会通过持续反馈,让你逐渐学会独立做出更好的决定。
模型的训练过程
模型的学习方式与人类并不完全相同,但人类学习提供了一个有用的类比。
模型首先会从规模庞大的数据中学习和预测各种模式,这个阶段称为预训练。这里继续以篮球为例,模型真的可以阅读大量与篮球有关的书籍、文章、比赛记录和讨论。它会从这些资料中学习语言、事实以及各种概念之间的关系。
预训练完成后,我们会得到一个基础模型。
基础模型拥有大量的现有知识,例如了解古代历史、数学定理或者编程语言,但它仍然存在一些特殊习惯。它的交流方式会不够自然,也会无法稳定地遵循用户的要求。
接下来,训练者会向模型展示大量优秀行为的示例,让模型学习并模仿这些表现。这个过程就是监督微调,也就是 SFT。
这个过程有点像让一名球员反复观看优秀运动员的比赛录像。模型会看到问题以及对应的高质量回答,逐渐学习应该采用怎样的表达、结构和解决方式。
模仿能够带来很大帮助,但只观察别人的动作还不足以成为优秀球员。模型还得真正完成任务,并根据结果继续学习。
模型训练者会让模型在模拟环境中反复尝试任务。当模型表现良好时,系统会给予奖励;当模型做出不理想的选择时,奖励信号也会发生变化。这个过程称为强化学习,也就是 RL。
奖励信号类似教练的反馈。它会告诉模型,刚才的选择效果如何,并推动模型在后续尝试中调整自己的决策。强化学习能够训练的内容也包括较为通用的行为特征。
OpenAI 在一项研究中设计了大量接近真实对话的场景,用于训练和评测诚实、承认不确定性、保持透明、接受纠正、公平对待不同对象以及关注人类福祉等行为。这些场景覆盖健康、教育、科学、法律、工程和商业等多个领域。
研究人员将少量此类数据加入更广泛的强化学习训练后,模型在多项独立评测中表现出更强的诚实性、透明度和可纠正性,在欺骗、奖励破解、有害建议、安全和规范遵循等评测中也出现了更广泛的改善。部分改善还可以延伸到训练数据没有直接覆盖的领域,并在对抗提示和后续微调的压力下继续保留。
这说明,模型在强化学习中学到的可能不只是一道题的答案。针对某种行为特征的训练,可能会逐渐影响模型面对其他任务时的选择。
模型评测
怎样判断模型是否真的有所进步?
一种方式是做一些可以查看答案的练习题,另一种方式是让模型参加此前从未见过的正式考试。
对于数学、编程等拥有明确答案的领域,评测相对直接。数学题可以检查最终答案,代码任务可以运行测试。如果模型没有通过测试,训练者便就知道它可以改进哪些方面。
训练大型模型的一项重要工作,就是设计足够丰富和多样的“试卷”。这些任务可以覆盖数学、编程、科学、历史以及其他领域。拥有明确答案的任务可以被反复用于训练。模型完成任务后,系统根据答案判断结果,再将结果转化为反馈。
还有一些任务很难通过唯一答案判断。现实中的考试有时候会同时包含选择题和主观题。选择题可以按照正确答案评分,主观题则需要根据一套评分标准判断回答质量。
模型评测也采用了相似的方法。一些基准测试关注可以客观验证的结果,例如代码能否通过测试;另一些评测会提供详细的评分标准,再让另一个模型判断回答是否满足要求,这种方式通常被称为 LLM-as-judge。
这些结果可以帮助训练团队判断模型是否真的在学习,以及新一轮训练是否带来了改善。基准测试还要尽量使用模型在训练阶段没有见过的任务。假如模型已经记住全部答案,最终成绩很难反映它面对新问题时的真实能力。
除了知识和推理能力,模型还需要接受行为评测。训练者会把模型放到包含压力、模糊信息或利益冲突的场景,观察它是否会隐瞒事实、钻规则漏洞、夸大结论或者拒绝接受纠正。不同评测会分别检查模型能否遵守行为规范、保持诚实、避免有害建议,并在人类需要介入时接受监督。
因此,对模型的评测需要同时覆盖能力和行为。模型既要能够完成任务,也要以符合预期的方式完成任务。
行为对齐
仅仅拥有智能还不够。一个非常聪明的人,如果态度粗鲁、缺乏沟通意识,也很难成为受欢迎的同事。
模型同样需要按照预先制定的规范调整行为。模型规范、原则和宪法为训练提供目标,而训练团队还需要把这些目标转化为示范答案、训练场景、奖励信号和具体的评测标准。
负责训练模型的工程师和研究人员,会在模型完成前与它进行大量交流。他们会记录模型的特殊习惯以及仍然需要改进的地方。
模型会反复使用某些固定句式(参考“不是…而是…”),也会为了缩短回答而牺牲清晰度。有时,它会使用过于复杂的词语,将原本简单的内容表达得难以理解。找到这些问题后,训练团队可以继续调整训练数据和奖励信号,对不理想的行为进行惩罚,让模型逐步接近期望中的表现。
行为规范本身也会持续更新。
OpenAI 在 Model Spec 中提到,实际部署的模型还没有完全体现规范中的全部目标,模型和规范都会根据真实使用中的反馈继续改进。
Anthropic 同样将模型行为视为规则、价值和判断能力共同作用的结果。对于边界清晰、出错代价较高的场景,明确规则能够提供更强的可预测性;面对复杂且难以提前列举的情境,模型还需要理解规则背后的目标,并结合具体环境进行判断。
模型上线后,团队还可以进行 A/B 测试,让不同用户分别看到新旧版本的回答,再比较用户更喜欢哪个版本,以及新模型是否带来了更好的实际结果。
模型行为的形成,来自规范、训练、评测和真实反馈之间的反复循环。
持续学习
人们可能会认为,模型会随着使用时间增加而持续变得更加聪明。
目前的模型并不会在每一次对话结束后实时更新自身能力。模型参数的学习主要发生在训练阶段,普通用户与模型进行的一次对话,不会直接改变模型本身。
那些需要长期保留的信息,通常会被写入规则、Skills 或其他文件中。Agent 执行任务时,可以读取这些文件,再将与当前任务相关的内容加入模型的上下文。通过这种方式,Agent 可以记住一个项目使用的工具、团队约定、工作流程和用户偏好。模型参数没有发生变化,但模型在这一次任务中能够获得更多背景信息。
这种通过文件实现的朴素记忆方式,已经取得了相当不错的效果。不过,要让 Agent 像一名新同事一样,从每天的工作中持续学习,判断哪些经验值得保留,再在未来遇到合适的任务时主动使用这些经验,仍然有许多问题需要解决。
教会模型成为一个有帮助的协作者,是一个很深的主题。
预训练让模型获得大量知识,监督微调让它学习优秀行为的示范,强化学习让它在一次次尝试和反馈中改善决策。模型规范、原则和宪法则为这些训练提供方向,帮助训练者判断模型应该形成怎样的行为。
从这个角度看,训练模型与培养一名优秀同事存在一些相似之处:知识提供基础,实践积累经验,反馈帮助改进,而明确的目标决定了它最终会成为怎样的协作者。

本文用人类学习类比AI训练,通俗解析大模型如何通过预训练、监督微调与强化学习掌握新技能;详解Model Spec、宪法等行为规范如何引导AI成为可靠协作者,并介绍评测与持续对齐的关键作用。