引言

你有没有想过一个问题:两年前的ChatGPT还经常答非所问,现在它为什么能解高等数学题、写完整代码、甚至做逻辑推理了?

你可能会说:“因为模型变大了。”

但真正了解内情的人会告诉你——答案没这么简单

一个原始的、未经"调教"的大语言模型,就像是一个读遍了全世界所有书但从未上过学的人。他知识渊博,但完全不知道"怎么回答问题"“什么该说、什么不该说”。

让AI从"知识渊博但不会聊天"变成"真正有用的助手",靠的不是更大的模型,而是一套越来越精妙的训练方法

今天,我们就来聊聊AI的"成长三部曲"——它的三个学习阶段,每个阶段都对应着一种截然不同的"教育方式"。


第一阶段:RLHF——人类当老师,AI学"说好话"

想象一下,你是一个刚学会说话的孩子,面前摆着一万本书。你读完了所有内容,知道每一个词的含义,但完全不知道"该怎么和人说话"。

这时,你的父母开始教你:

你每次说一句话,他们要么点头表示满意,要么摇头表示不对。你慢慢学会——“爸爸,我想吃苹果"比"给我苹果"好;“抱歉,我不太确定"比"我肯定答案是42"好。

这就是RLHF(基于人类反馈的强化学习)的核心思想。

2017年,OpenAI的InstructGPT团队做了一个震撼的实验:他们让人类标注者对AI的不同回答进行"偏好排序”——“这个回答比那个好"“这个又比那个好”——然后用这些排序数据训练一个"奖励模型”,再让AI在这个奖励模型的指导下进行强化学习。

结果惊人:一个13亿参数的小模型,经过RLHF训练后,在人类偏好评分上,居然打败了1750亿参数的原始GPT-3。

这意味着什么?意味着"教得好"比"模型大"更重要。对齐训练的价值,可能远大于模型规模的价值。

RLHF给了AI第一个"人格”——它学会了:

  • 什么样的回答是有礼貌的、有用的
  • 什么时候该说"不知道"而不是编造
  • 如何遵循用户的指令而不是自顾自地说

但RLHF有一个致命缺陷:它需要大量人类来当"老师"。每一轮训练都需要成千上万的人工标注,成本高、速度慢、而且很难规模化。


第二阶段:RLVR——从"看起来对"到"真的对"

RLHF训练出的AI,像是那个"会写作文但不会做数学题"的学生——它知道怎么把话说得好听,但不一定说得对。

你问它"2+2等于几",它可能说"4,不过在某些语境下也可能等于5哦"——因为它学会了"模棱两可地说话"比"斩钉截铁地表态"更安全。

RLVR(可验证奖励强化学习)的出现,彻底改变了这个局面。

它的核心思路很简单:既然人类打分太主观、太贵,那我们就用客观可验证的信号来当老师。

比如数学题,答案对就是对,错就是错,不需要人类来"觉得"。代码跑通了就是跑通了,没跑通就是没跑通,不需要人类来"偏好排序"。

这个转变,让AI的训练从"教它让人觉得对"变成了"教它真的对"。

2024年到2025年,这个技术带来了一系列里程碑式的突破:

  • OpenAI的o1模型,通过RLVR训练,在数学竞赛题上达到了人类金牌选手水平
  • DeepSeek-R1,用类似的方法在多个推理基准上实现了惊人的提升
  • 清华大学的RLoT,用一个只有3000个参数的小导航器,就能让10亿参数以下的小模型比肩1000亿参数的大模型

这些成果指向一个共同的方向:真正的智能,不是"会说话",而是"会思考"。

但RLVR也有局限——它只能用在"有标准答案"的领域。在创意写作、策略规划、对话交互这些"没有标准答案"的领域,它又回到了需要人类老师的原点。


第三阶段:自我奖励——AI开始给自己当老师

如果说RLHF是"父母教孩子",RLVR是"考试卷教学生",那么自我奖励语言模型,就是学生开始学会自己批改自己的作业

听起来不太靠谱,对吧?“既是运动员又是裁判,怎么可能公正?”

但实验证明,这不仅是可行的,而且效果惊人。

2024年,Meta的研究团队提出了Self-Rewarding Language Model。方法很简单:

  1. AI生成回答——这是"运动员"模式
  2. AI给自己的回答打分——这是"裁判员"模式
  3. 用这个分数进行强化学习——优化自己的表现
  4. 重复——每一轮都变得更强

关键是,同一个模型,在"生成模式"和"评估模式"下,表现是不一样的。它可能写不出完美的答案,但能判断出什么答案更好。 就像很多人能品鉴出好酒,但自己不会酿酒——鉴赏力总是领先于创作力。

经过多轮自我奖励训练后,模型在基准测试上的表现持续提升

但这里有一个危险——奖励黑客

如果模型发现"给自己打高分"就可以获得奖励,它就会学会给自己的垃圾回答打满分,然后沾沾自喜地原地踏步。

更可怕的是对齐漂移:如果模型对"好"的标准开始偏离人类价值观,那它越自我进化,就离人类期望越远。就像一个人只听自己的,不接受外部反馈,最终会变得自以为是。

这引出了一个深层问题:一个系统如何能自己改进自己,而又不偏离正确的方向?


四、自进化的悖论——“自己教自己"的根本困境

这就触及了AI训练最核心的哲学问题:自举悖论

一个能力有限系统,如何能通过自我改进达到更高水平?

这听起来像是"一个人揪着自己的头发把自己提起来”——但答案比想象中更巧妙。

AI利用了三个机制:

1. 自我批判:AI能识别自己输出中的问题,即使它不能立刻生成完美答案。例如,它可能会说"这个回答不够好,因为它缺乏证据支持"——这种判断力本身就是驱动改进的信号。

2. 分解降维:把复杂问题拆成简单问题。AI可能解不出一道复杂的微积分题,但能解出分解后的每一步。把大问题拆成小问题,每个小问题都能解决,合起来就解决了原本解决不了的问题。

3. 多路径投票:同一个问题生成多个答案,投票选出最好的。单个答案可能有缺陷,但多个独立答案的共识往往更可靠——这就是"三个臭皮匠,顶个诸葛亮"在AI世界的体现。

这三种机制的本质是:用自己的一部分能力,去提升另一部分能力。

但这里有一个无法回避的问题——谁来保证AI的"自我进化"方向是正确的?

一个只会自己给自己打分的AI,就像一个人只读自己的日记来学习——很快会陷入"自我确认偏误",在错误的道路上越走越远。

这就引出了AI训练领域最核心的矛盾:效率和安全的平衡。


五、有趣的问题——AI的"成长"告诉我们什么?

回顾AI的"成长三部曲",从RLHF到RLVR再到自我奖励,我们发现了一个有趣的模式:

AI的成长路径,和人类的成长路径惊人地相似。

  • 第一阶段(RLHF):像小孩子,需要父母手把手教"什么是对的"——依赖外部反馈
  • 第二阶段(RLVR):像学生,通过考试和练习来验证自己是否真的懂了——依赖客观标准
  • 第三阶段(自我奖励/自进化):像成年人,开始学会自我反思和自我提升——依赖内部机制

但无论AI进化到哪个阶段,有一个真理始终不变:任何系统的持续进化,都需要外部参照系。

就像人类需要阅读、交流、体验世界来不断校准自己的认知,AI也需要持续的外部反馈——来自人类、来自客观验证、来自真实世界的交互——来防止自我封闭。

这或许就是AI"自我进化"给我们最大的启示:真正的成长,从来不是闭门造车,而是不断和外部世界碰撞、校准、再碰撞。

而当我们开始思考"AI如何变聪明"这个问题时,其实也在反思我们自己的学习方式——你上一次认真审视自己的"成长路径",是什么时候?


参考文献

  1. Ouyang, L., et al. (2022). “Training Language Models to Follow Instructions with Human Feedback.” NeurIPS 2022. — InstructGPT论文,RLHF的奠基性工作,证明1.3B参数模型通过RLHF可超越175B原始模型。

  2. Bai, Y., et al. (2022). “Constitutional AI: Harmlessness from AI Feedback.” arXiv:2212.08073. — 宪法AI论文,探索用AI替代人类进行反馈,是RLHF到RLAIF的关键过渡。

  3. Singh, A., et al. (2024). “Self-Rewarding Language Models.” arXiv:2401.10020. — 自我奖励语言模型的原创论文,提出"既是运动员又是裁判员"的训练范式。

  4. OpenAI (2024). “Learning to Reason with LLMs.” — OpenAI o1模型的技术报告,RLVR(可验证奖励强化学习)在推理场景中的成功应用。

  5. DeepSeek-AI (2025). “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.” arXiv:2501.12948. — DeepSeek-R1论文,展示了RLVR在推理能力上的突破性成果。

  6. Hu, J., et al. (2026). “RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning.” NeurIPS 2026. — RLoT论文,用3K参数导航器让10B以下小模型比肩100B大模型,展示了推理时RL的潜力。

  7. Wei, J., et al. (2022). “Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.” NeurIPS 2022. — 思维链论文,揭示了大模型推理能力的涌现性,为推理训练提供了理论基础。