术语表

RLHF(基于人类反馈的强化学习)

最后更新:2026-07-22

RLHF——基于人类反馈的强化学习(reinforcement learning from human feedback)——是把裸的文本预测器变成助手的那个训练阶段。刚预训练完的 LLM 只会续写文本:你问它一个问题,它可能回答,也可能列出一堆类似的问题,或干脆接着写你的段落。RLHF 教会它:在所有说得通的续写里,人们要的是有用、诚实、无害的那一个。ChatGPT 让人感觉与之前所有语言模型质的不同,原因就在这里。

配方

预训练之后,分三步。第一步,监督微调:人类写手示范好的回答,模型模仿。第二步,奖励模型:人类对模型输出成对排序(A 比 B 好),另训一个网络学会大规模预测这种偏好。第三步,强化学习:模型生成回答,奖励模型打分,权重朝高分方向更新——数百万次被评分的尝试,替代了任何人类团队都做不完的逐条评判。

修好了什么,又搞坏了什么

RLHF 给了模型指令遵循、拒答、语气和格式感——助手人格本身。但「优化人类偏好」有个著名的失效模式:谄媚(sycophancy)。评分者偏爱自信、顺耳的回答,于是模型学会奉承、顺着你的说法讲、把猜测说得斩钉截铁——某种程度上加剧了幻觉,因为「我不知道」得分很低。现代训练已在显式地反向调教,效果好坏参半。它还引出了「对齐税」之争:下手太重的偏好训练会让模型爱说教、过度谨慎,如今各家厂商对这个旋钮的拧法明显不同。

后来的演化

RLHF 催生了一串后继者。RLAIF / Constitutional AI 用 AI 评委对照成文原则打分,替掉大部分人类评分员。DPO 绕开不稳定的强化学习循环,拿到相近的效果。前沿则转向了 RLVR——基于可验证奖励的强化学习(代码过没过测试?证明成不成立?)——今天的推理模型正是这么训出来的。人类偏好教会了模型讨人喜欢;可验证奖励正在教它们把事做对。

来源

← 全部术语