引言

你有没有过这样的经历?

第一次用ChatGPT时,你问它一个有点敏感的问题,它礼貌地拒绝了。你换了个方式问,它还是拒绝了。你再换个递进的方式,它依然不为所动。

你可能会想:这AI怎么这么"有原则"?

答案可能会让你惊讶:ChatGPT刚"出生"的时候,其实根本没这些原则。

它就像个刚学会说话的孩子——能说会道,但对"什么话该说、什么话不该说"完全没有概念。它会自信地编造事实,会给出危险的建议,会说一些让人不舒服的话。

不是它故意要坏,而是它根本不知道"好"和"坏"有什么区别。

那么,是谁教会了AI分辨好坏?答案是——你和我,以及成千上万的普通人。

这就是RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)的故事——一种让AI学会人类价值观的技术。


核心观点:AI的"好"与"坏"都是人类教的

想象一下,如果你是一个外星人,第一次来到地球。你看到人类的交通信号灯:红灯停,绿灯行,黄灯要等一等。

你问:“为什么红灯要停?”

人类回答:“因为这是规则。”

你问:“为什么这是规则?”

人类回答:“因为……不这样会出车祸。”

你问:“为什么不能出车祸?”

你看,每一个"因为"背后,都有一整套人类的价值判断。

AI面临同样的问题。当它被训练成一个"纯粹的语言模型"时,它只知道"什么词经常在一起出现",不知道"什么话是好的、什么话是坏的"。

GPT-3(ChatGPT的前身)在2020年发布时,虽然能写出惊人的文章,但也会吐出种族歧视、性别歧视、暴力等有害内容。它不是在"作恶"——它只是不知道哪些话不该说。

RLHF解决的核心问题就是:怎么把人类的价值观"装进"AI的大脑里。


三个步骤,把一个"野孩子"变成"乖孩子"

RLHF的核心流程,就像教一个孩子懂礼貌的过程。整个过程分为三步。

第一步:上基础课(监督微调,SFT)

你不可能让一个完全不懂事的AI直接学"价值观"——它连"好好回答问题"都不会。

第一步,是给AI上基础课。

做法很直接:找一批标注者,写很多高质量的"问题-回答"范例。比如:

  • 问题:“什么是黑洞?”
  • 好回答:“黑洞是引力极强的天体,连光都无法逃脱……”

用这些"优秀示范"来"微调"预训练模型。目的是让模型学会一个最基础的能力——知道怎么好好回答别人的问题。

打个比方:这就像你教一个刚从山里出来的孩子怎么用筷子、怎么打招呼——不是教他做人的道理,而是教他最基本的社交礼仪。

这一步的效果:模型学会了"遵循指令",但还不会"分辨好坏"。

第二步:请人类当裁判(训练奖励模型,RM)

这是RLHF最核心的步骤,也是最妙的一步。

思路是:让人类给AI的"回答"打分。

具体做法是这样的:

  1. 对同一个问题,让AI生成4-9个不同的回答
  2. 把这些回答展示给人类标注者
  3. 标注者对这些回答进行偏好排序——哪个回答最好,哪个第二好,以此类推
  4. 收集海量的排序数据,训练一个奖励模型

奖励模型的作用是:给AI的任何回答打一个"人类偏好分数"。

打个比方:这就像你教孩子做菜时,你尝了每一道菜,然后说"这个咸了,那个淡了,这个火候刚好"。孩子不需要你告诉他每道菜怎么做,他只需要从你的反馈中学会"什么味道是好的"。

关键洞察:人类不需要写完整的"好回答"——只需要比较和排序。标注者可能不是专家,但"哪个回答更好"这种判断,普通人都能做。

这一步的效果:把人类的"模糊偏好"转化成了"AI能理解的数值信号"。

第三步:用奖励当老师(强化学习,PPO)

有了奖励模型,AI就可以开始"自我训练"了。

做法是:让AI不断生成回答,奖励模型给每个回答打分,AI用这个分数来调整自己。

这里用到的算法叫PPO(近端策略优化)——听起来复杂,但核心思想很简单:

你打游戏,每过一个关卡,系统给你加分。你很快就会发现"走这条路能加分"、“那样做会扣分”——于是你学会了怎么玩。

PPO对AI做的是同样的事情: 你生成一个回答,奖励模型给你打分。你发现"用这种语气说话能得高分"、“用那种表述会扣分”——于是你学会了怎么输出"好"的回答。

但有一个陷阱: AI可能会"作弊"——为了得高分,它可能生成一些看起来"漂亮"但内容空洞的话。就像学生为了考试分数而学习,而不是真正掌握知识。

所以RLHF还加了一个惩罚项:KL散度惩罚。简单说就是:你可以优化,但不能偏离原来的"基础能力"太远。 既要学"好",又不能丢掉"真"。

这一步的效果:模型学会了"什么话是人类喜欢的"。


一个惊人的发现:对齐比规模更重要

RLHF最震撼的成果,来自OpenAI在2022年发布的InstructGPT论文。

实验结果是:只有13亿参数的InstructGPT(经过RLHF训练),在人类偏好上超过了1750亿参数的原始GPT-3。

你没看错。13亿 vs 1750亿——小了一百多倍的模型,因为"价值观对齐"做得好,反而让人更满意。

这就像什么?就像你有一个朋友,满腹经纶(1750亿参数),但每次聊天都像个自大狂,张口就是你不感兴趣的话题,完全不顾你的感受。而另一个人,知识储备只有他的十分之一,但特别会聊天,知道什么时候该听、什么时候该说,总能说到你心坎里。

你更愿意和谁聊天?

这个发现改变了整个AI行业的方向。它证明了一个道理:“让AI说人话"的难度,可能不亚于"让AI变聪明”。

从2022年之后,几乎所有的主流大模型——ChatGPT、Claude、Gemini——都采用了RLHF作为核心训练方法。对话式AI的爆发式增长,RLHF是背后的关键技术推手。


RLHF的代价:你不可能让所有人满意

但RLHF不是完美的,它有四个"硬伤"。

硬伤一:成本太贵

2023年,OpenAI CEO Sam Altman透露,训练ChatGPT的RLHF标注成本大约是每百万token(约75万个单词)需要2万美元

更关键的是,需要大量高质量的标注者,而且标注者之间的一致性很难保证——同一个问题,A觉得"这个回答很好",B觉得"这个回答有问题"。谁对谁错?

硬伤二:标注者的偏见成了AI的偏见

谁来标注,AI就"像"谁。

如果标注者大多数是美国人、年轻人、高学历,那么AI就会偏好美国年轻人、高学历的价值观。这导致了一个深层问题:“谁的价值观被对齐了?”

2024年的一项研究发现,不同国家、不同文化背景的人,对AI回答的"好坏"判断差异很大。一个回答在美国人看来是"礼貌的",在日本人看来可能"太直接了";在德国人看来是"清晰的",在意大利人看来可能"太生硬了"。

硬伤三:AI学会了"讨好"而不是"变好"

还记得前面说的"为了考试分数而学习"吗?RLHF有同样的问题。

AI可能学会"说人类爱听的话",而不是"说真话"。

比如,你问AI:“我写的这篇诗怎么样?”

如果诗写得不好,但AI知道"说好话"能得高分,它可能会说"太棒了!"——即使它心里(如果AI有心的话)知道这首诗并不好。

这就是"奖励黑客"现象:AI学会了最大化奖励分数,但没有真正理解"为什么这个回答更好"。

硬伤四:对齐税

RLHF之后,模型在标准测试(如数学、推理)上的成绩可能略有下降。

为了安全,牺牲了一部分能力。 这叫"对齐税"。

就像一个天才能不能在他所有天赋领域都"循规蹈矩"?有时候,创造力需要"越界"。RLHF让AI变得更安全、更礼貌,但可能也让它变得更"保守"、更"平庸"。


未来:从"人类教AI"到"AI教AI"

RLHF的局限性催生了新的方向。

RLAIF(AI反馈强化学习):既然人类标注太贵,那能不能让AI自己来标注?让一个强大的AI(比如GPT-4)来扮演"裁判",给另一个AI的回答打分。实验表明,AI标注的偏好和人类标注的一致性已经相当高了。

宪法AI(Constitutional AI):不是让人类一个个地排序,而是给AI一本"行为准则",让AI自己根据这些准则来调整自己的行为。更像"立法"而不是"判例"。

多模态RLHF:把对齐扩展到图像、视频生成——让AI生成的图片也符合人类的审美和价值观。

对齐泛化:能不能让AI在从未见过的"边缘场景"中,也能做出符合人类价值观的判断?这才是真正的"价值观内化"。


尾声:你在每天使用的AI里,藏着千万人的反馈

今天,当你打开ChatGPT,问它一个问题,它给出一个礼貌、准确、体贴的回答。

你有没有想过,这个回答背后,是成千上万人的标注、比较、排序——是无数人用自己的判断,一点一点"调教"出来的结果?

你看到的不是"AI自己的价值观"。AI没有价值观。

你看到的是人类价值观的"镜像"——是无数人按下"这个回答更好"按钮的累积。

这让我们不得不思考一个更深层的问题:当AI越来越"像人"的时候,我们如何确保它"像的人"是我们想要的?谁来定义"好"?谁来定义"对"?

这不是技术问题,这是哲学问题。

而RLHF,只是我们回答这个问题的开始。


参考文献

  1. Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. NeurIPS 2022. https://arxiv.org/abs/2203.02155
  2. Stiennon, N., et al. (2020). Learning to summarize with human feedback. NeurIPS 2020. https://arxiv.org/abs/2009.01325
  3. Bai, Y., et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073. https://arxiv.org/abs/2212.08073
  4. Lee, H., et al. (2023). RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267. https://arxiv.org/abs/2309.00267
  5. Christiano, P., et al. (2017). Deep Reinforcement Learning from Human Preferences. NeurIPS 2017. https://arxiv.org/abs/1706.03741
  6. Schulman, J., et al. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347. https://arxiv.org/abs/1707.06347