<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>AI对齐 on 灵语AI</title>
		<link>https://lingyu7.com/tags/ai%E5%AF%B9%E9%BD%90/</link>
		<description>Recent content in AI对齐 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Thu, 20 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ai%E5%AF%B9%E9%BD%90/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的&#39;家教&#39;——人类反馈如何让AI从&#39;会说&#39;变成&#39;会做&#39;</title>
				<link>https://lingyu7.com/posts/how-rlhf-makes-ai-from-talk-to-do/</link>
				<pubDate>Thu, 20 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-rlhf-makes-ai-from-talk-to-do/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有这种感觉？&lt;/p&gt;&#xA;&lt;p&gt;2022年底，你第一次用ChatGPT，它惊为天人——能写诗、能写代码、能聊哲学。但聊多了，你发现它有个毛病：&lt;strong&gt;明明不知道的事，它也能煞有介事地编出一段。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你问&amp;quot;爱因斯坦的第三个孩子叫什么&amp;quot;，它会一本正经地告诉你&amp;quot;叫爱德华·爱因斯坦&amp;quot;，然后编一段生平。实际上爱因斯坦只有两个儿子，第三个孩子根本不存在。但AI说得很流畅，像真的一样。&lt;/p&gt;&#xA;&lt;p&gt;更让人抓狂的是，它回答问题时啰嗦、绕弯子，有时候你明明想要一个简单答案，它给你回了三篇论文。&lt;/p&gt;&#xA;&lt;p&gt;但几个月后，你发现它变了。它开始说&amp;quot;我不知道&amp;quot;了，回答更简洁了，胡说八道的次数明显变少了。它好像变&amp;quot;乖&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;是模型变大了吗？不是。是它经历了一场&amp;rsquo;家教&amp;rsquo;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这场家教，在AI界有一个专业的名字——&lt;strong&gt;RLHF（Reinforcement Learning from Human Feedback，基于人类反馈的强化学习）&lt;/strong&gt;。今天，我们来聊聊这个让AI从&amp;quot;聪明但叛逆&amp;quot;变成&amp;quot;聪明又靠谱&amp;quot;的关键技术。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的青春期预训练模型到底缺什么&#34;&gt;第一章：AI的&amp;quot;青春期&amp;quot;——预训练模型到底缺什么&lt;/h2&gt;&#xA;&lt;p&gt;要理解RLHF的价值，得先知道一个&amp;quot;大模型&amp;quot;是怎么出生的。&lt;/p&gt;&#xA;&lt;p&gt;通常，一个大模型要经历两个阶段：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：预训练。&lt;/strong&gt; 模型在海量互联网数据上&amp;quot;读书&amp;quot;——维基百科、书籍、网页、论文……它看着这些文字，学会了一个基本能力：&lt;strong&gt;预测下一个词。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你给它&amp;quot;今天天气真&amp;quot;，它知道该接&amp;quot;好&amp;quot;而不是&amp;quot;桌子&amp;quot;。它学会了语法、事实、推理模式——但它学到的，只是&amp;quot;文字之间的高概率关联&amp;quot;，而不是&amp;quot;什么对用户有用&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就产生了三个问题：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它不知道什么时候该说&amp;quot;不知道&amp;quot;。&lt;/strong&gt; 在它的训练数据里，几乎没有什么&amp;quot;我不知道&amp;quot;的例子。所以当它被问到不知道的问题时，它不会沉默，而是&amp;quot;硬编&amp;quot;——这就是幻觉的根源。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它不知道什么回答有用。&lt;/strong&gt; 它可能给你一段含混的长篇大论，也可能给你一个断章取义的单句。它没有&amp;quot;用户想要什么&amp;quot;的概念。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它不知道什么是&amp;quot;好&amp;quot;，什么是&amp;quot;坏&amp;quot;。&lt;/strong&gt; 它没有价值观，没有偏好，没有判断力。它只是忠实地模仿了互联网上的数据——包括那些有毒的、偏见的、不准确的内容。&lt;/p&gt;&#xA;&lt;p&gt;预训练模型就像一个&lt;strong&gt;智商极高但缺乏教养的天才少年&lt;/strong&gt;——他知道很多，但他不知道什么该说、什么不该说、怎么说才让人舒服。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;RLHF，就是给这个天才少年请了一位&amp;quot;家教&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章三步家教rlhf如何重塑ai的行为&#34;&gt;第二章：三步&amp;quot;家教&amp;quot;——RLHF如何重塑AI的行为&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的过程，可以理解为三个步骤，像一个&amp;quot;家教&amp;quot;的完整教学流程。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步示范sft看老师是怎么做的&#34;&gt;第一步：示范（SFT）——&amp;ldquo;看老师是怎么做的&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;首先，人类标注者写一些&amp;quot;示范回答&amp;quot;——面对各种用户提问，标注者写出一个&amp;quot;好的回答&amp;quot;应该是什么样子的。&lt;/p&gt;&#xA;&lt;p&gt;比如用户问：&amp;ldquo;怎么快速学好英语？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;一个好的回答应该是什么？不是写一篇关于英语学习历史的论文，而是给出具体、实用、可操作的建议。标注者会写出这样的示范回答，然后用这些数据对模型进行&lt;strong&gt;监督微调（SFT）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这一步的效果是：&lt;strong&gt;模型学会了&amp;quot;模仿&amp;quot;——它知道了&amp;quot;好的回答&amp;quot;大概长什么样。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但模仿是有上限的。如果标注者只写了1万条示范，模型就只能在这1万条的范围内学习。超过了这个范围，它又回到了&amp;quot;胡编&amp;quot;的老路上。&lt;/p&gt;&#xA;&lt;p&gt;所以需要第二步。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步打分rm给老师当裁判助手&#34;&gt;第二步：打分（RM）——&amp;ldquo;给老师当裁判助手&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;这一步非常巧妙。&lt;/p&gt;&#xA;&lt;p&gt;人类标注者不再写回答了，而是&lt;strong&gt;打分&lt;/strong&gt;——对同一个问题，让模型生成多个不同回答，然后标注者对这些回答进行偏好排序。&lt;/p&gt;&#xA;&lt;p&gt;比如用户问：&amp;ldquo;什么是量子力学？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;模型生成了三个回答：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;回答A：用数学公式解释，很专业但普通人看不懂&lt;/li&gt;&#xA;&lt;li&gt;回答B：用比喻解释，说&amp;quot;量子力学就像你同时在家和在公司&amp;quot;——通俗但不够严谨&lt;/li&gt;&#xA;&lt;li&gt;回答C：先讲一个简单的故事引入，再逐步深入，既通俗又准确&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;标注者把这三个回答排序为：C &amp;gt; B &amp;gt; A。&lt;/p&gt;&#xA;&lt;p&gt;标注者不需要写回答，只需要&amp;quot;选哪个更好&amp;quot;——这个工作量小得多，而且可以大规模进行。&lt;strong&gt;标注10万条&amp;quot;哪个更好&amp;quot;比写10万条&amp;quot;示范回答&amp;quot;容易得多。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;用这些偏好数据，训练一个&lt;strong&gt;奖励模型（Reward Model）&lt;/strong&gt;——这个模型学会了&amp;quot;预测人类偏好&amp;quot;的能力。它看一眼AI的回答，就能给一个分数：这个回答人类会喜欢几分。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;奖励模型，本质上是一个&amp;quot;人类口味的数字化模拟器&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步强化学习rl让ai自己练&#34;&gt;第三步：强化学习（RL）——&amp;ldquo;让AI自己练&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;最后一步是最精彩的。&lt;/p&gt;&#xA;&lt;p&gt;有了奖励模型，AI就可以&amp;quot;自己练&amp;quot;了——不需要人类参与，AI自己生成回答，奖励模型给它打分，AI根据分数调整自己的策略。&lt;/p&gt;&#xA;&lt;p&gt;这个过程用到了**PPO（Proximal Policy Optimization）**算法——一种强化学习算法，专门用来优化策略。&lt;/p&gt;&#xA;&lt;p&gt;但这里有一个微妙的平衡：&lt;strong&gt;如果AI只追求分数，它可能会走向极端。&lt;/strong&gt; 比如，它可能学会一种&amp;quot;高分但空洞&amp;quot;的说话方式——听起来很好听，实际上没内容。&lt;/p&gt;&#xA;&lt;p&gt;为了防止这种情况，RLHF在奖励函数中加入了一个&lt;strong&gt;KL散度惩罚项&lt;/strong&gt;——简单说，就是&amp;quot;不要偏离初始模型太远&amp;quot;。它鼓励AI在&amp;quot;保持原有知识&amp;quot;的基础上，去&amp;quot;优化表达方式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;就像教育一个孩子：既要教他礼貌，又不能让他失去天性。&lt;/strong&gt; RLHF的KL惩罚，就是那个&amp;quot;保持天性&amp;quot;的约束。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一个惊人的发现13b打败175b&#34;&gt;第三章：一个惊人的发现——1.3B打败175B&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的效果有多强？&lt;/p&gt;&#xA;&lt;p&gt;OpenAI的InstructGPT论文给出了一个令人震惊的数据：&lt;strong&gt;只有13亿参数的InstructGPT，在人类偏好上，竟然超过了1750亿参数的原始GPT-3。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;10倍以上的参数规模差距，被RLHF抹平了。&lt;/p&gt;&#xA;&lt;p&gt;这意味着什么？&lt;strong&gt;&amp;ldquo;对齐&amp;quot;的价值，可能远大于&amp;quot;规模&amp;quot;的价值。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你不需要一个更大的模型，你只需要一个&amp;quot;更懂你&amp;quot;的模型。&lt;strong&gt;RLHF的杠杆效应极其惊人——用较小的对齐成本，获得了巨大的质量提升。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
