AI 不是生来会聊天,
它是被「养大」的
养大一个 AI,就像培养一个新员工:备食材(洗数据)→ 疯狂做题(预训练)→ 上岗培训(SFT)→ 请裁判打分(奖励模型)→ 被夸被骂(RLHF)→ 考试出厂。 本章的重头戏是一个真的会当着你的面训练的迷你 AI——亲眼看它从满嘴乱码变成会说人话。
2.1 备食材:先把互联网「洗」一遍
养 AI 的第一步不是写代码,是备菜:从网上收集海量文章、书籍、代码——多到几万亿块积木。 但互联网上全是垃圾:乱码页、广告、复制粘贴了 40 遍的转载文。 所以要先洗菜:去重、过滤、清理格式。
2.2 疯狂做题:99% 的算力烧在这里
洗好的文本拿来干什么?做练习题。而且全是同一道题:盖住下一个字,猜(下一词预测)。 猜错了就扣分(损失),然后微调一下肚子里那几千亿个数字,下次猜准一点。 这道题做上几万亿次,语言的规律——顺带大量知识和推理的雏形——就被压进了数字里。
规模感受:这一步(预训练)要用上万张显卡跑几个月,电费百万美元级。 产出叫基座模型:接话无敌强、但完全不懂「好好回答问题」的怪才——2.5 节你会亲眼看到它接话接得多离谱。
2.3 下山技巧:每一步改多少
训练时每做完一题,都要决定:肚子里的数字往哪边调、调多少?这就像蒙着眼下山: 摸一摸脚下的坡度(梯度),朝下坡方向挪一步。 步子多大,就是学习率——训练里最玄学的旋钮: 步子太小,天黑了还在山顶附近打转;步子太大,一步跨过谷底,直接弹飞。
2.4 越大越强,而且强得可预测
这轮 AI 热潮最反直觉的发现:缩放定律—— 把模型变大、数据变多、算力加足,效果的提升平滑得像物理定律,可以提前算出来。 于是全行业陷入军备竞赛:更大 = 更强,直到钱包见底。
更神奇的是涌现:有些本事(多位数乘法、多步推理) 在小模型身上几乎为零,规模一过某个坎,突然就会了——没有任何人设计过这个功能,它是从「猜字」里自己长出来的。
📉 平滑下滑:可以提前算出来
钱每多花一个数量级,分数就稳定涨一截——投资人的最爱。
⚡ 突然开窍:无人设计的能力
例:多位数乘法、按指令一步步推理。练着练着自己长出来的。
2.5 上岗培训:学会「好好回答」
刚出厂的基座模型只会接话:你问它问题,它可能反过来问你; 你让它介绍杭州,它可能自己编一段「网友:那北京呢」继续自导自演——毕竟它只学过「互联网上接下来通常是什么」。
所以要来一次上岗培训(SFT): 请人写出几万到上百万条高质量的「指令 → 满分回答」,拿这些继续训练。它这才学会三件事: 有人问,好好答;答到点,就停笔;像助手,别装网友。
还有个冷知识:多轮聊天在底层从来不是「消息列表」,而是被对话模板 拼成一整段文字喂给模型——这是看懂下一章「会话与记忆」的钥匙。
<|im_start|> 其实是词表里的特殊积木,扮演「角色分隔线」。
培训时模型就学会了:看到 assistant 开头,就轮到我说话;说到 <|im_end|>,就该闭嘴了。
2.6 请裁判:让机器学会「哪个回答更好」
培训后会答题了,但答案有高下之分:该详细还是简洁?口气正式还是亲切?总不能每次回答都请人类打分——太贵太慢。
于是请个裁判(奖励模型):让 AI 对同一个问题写两个回答, 人类标注员勾出更好的那个(偏好数据)。 攒下几十万条「A 比 B 好」,训练出一个打分模型——从此它代替人类当裁判。
2.7 被夸被骂:照着分数练出「性格」
裁判就位,调教就能自动化了:让 AI 写回答 → 裁判打分 → 分高的行为被加强,分低的被削弱。 无限循环,AI 越来越对人类胃口。这套流程叫 RLHF(技术内核是个叫 PPO 的算法,不用记)。
后来有人证明了可以跳过裁判和打分,直接拿「A 比 B 好」的数据微调(DPO), 简单稳定成本低,开源圈现在更爱用它。
RLHF · 老派但上限高
生成 → 打分 → 奖惩,在线循环。
优点:能持续打磨,上限高;
缺点:要四个模型协同,训练容易翻车,工程复杂。
DPO · 新派省事
数学上把「照分数奖惩」改写成了普通训练题,离线直接练。
优点:简单稳定便宜;
缺点:探索劲头弱一点,个别场景不如老派。
2.8 考试:出厂前的验收
训练完不能直接上岗,先发几张标准考卷(Benchmark),大家同卷同题,分数好比较:
| 考卷 | 考什么 | 题型 |
|---|---|---|
| MMLU | 学科知识 | 选择题(52 门学科混考) |
| GSM8K / MATH | 数学 | 应用题,要写过程 |
| HumanEval | 写代码 | 补全函数 + 自动跑测试 |
| Arena(竞技场) | 聊天水平 | 两个模型匿名对打,人类投票 |
| IFEval | 听话程度 | 「用表格回答」「不超过 50 字」 |
2.9 延伸:三个值得知道的新方向
🫗 蒸馏:大模型带徒弟
让大模型(老师)海量生成「问题 + 满分回答」,拿去训练小模型(徒弟)。徒弟获得远超自己体格的本事——很多「小钢炮」模型就这么来的。
🧩 MoE:每次只用一小撮脑细胞
把模型拆成多个「专家小组」,每写一个字只叫醒其中一小撮。总脑容量巨大、实际耗电很小——用 20% 的电跑出 80% 的水平。
🧠 推理模型:先打草稿再作答
新一代模型(o1 / DeepSeek-R1 路线)被训练成「先长篇思考再回答」,数学和代码能力暴涨。代价:思考本身也要花时间(第三章的解码算力)。
到这里,AI 养成了、考完了,静静躺在硬盘上。下一章:你按下回车的那一瞬间,它开始工作。