CHAPTER 02 · 训练

AI 不是生来会聊天,
它是被「养大」的

养大一个 AI,就像培养一个新员工:备食材(洗数据)→ 疯狂做题(预训练)→ 上岗培训(SFT)→ 请裁判打分(奖励模型)→ 被夸被骂(RLHF)→ 考试出厂。 本章的重头戏是一个真的会当着你的面训练的迷你 AI——亲眼看它从满嘴乱码变成会说人话。

5 个交互演示读完约 20 分钟

2.1 备食材:先把互联网「洗」一遍

养 AI 的第一步不是写代码,是备菜:从网上收集海量文章、书籍、代码——多到几万亿块积木。 但互联网上全是垃圾:乱码页、广告、复制粘贴了 40 遍的转载文。 所以要先洗菜:去重、过滤、清理格式。

说人话 菜不新鲜,做出来的 AI 一股馊味。Garbage in, garbage out(垃圾进,垃圾出)是 AI 圈少数没人敢反对的铁律—— 数据质量直接决定 AI 的上限。
🧹演示 · 洗菜流水线(自动播放中)看垃圾文档怎么被挑出去
🌐抓回来
→
🔁挑重复
→
🧽挑垃圾
→
📦装盘
数量级感受 一份典型配方:约 60% 网页 + 15% 代码 + 10% 书籍 + 论文/数学/对话等。去重经常砍掉一半以上。 最后「每个脑细胞配 20 块积木」是健康比例——不够就欠练,太多就浪费。

2.2 疯狂做题:99% 的算力烧在这里

洗好的文本拿来干什么?做练习题。而且全是同一道题:盖住下一个字,猜(下一词预测)。 猜错了就扣分(损失),然后微调一下肚子里那几千亿个数字,下次猜准一点。 这道题做上几万亿次,语言的规律——顺带大量知识和推理的雏形——就被压进了数字里。

规模感受:这一步(预训练)要用上万张显卡跑几个月,电费百万美元级。 产出叫基座模型:接话无敌强、但完全不懂「好好回答问题」的怪才——2.5 节你会亲眼看到它接话接得多离谱。

🧪重头戏 · 真·训练模拟器(就在你的浏览器里跑)迷你版预训练

我们用 17 个句子当教材,真的训练一个迷你 AI(「上一个字→下一个字」的统计模型,大模型思想的极限简化版)。 每一步它都:先猜 → 翻答案看错多少 → 记住。盯着左下「错题率」往下掉,看右下它写的字从乱码变成人话。

错题率曲线(损失:越低 = 猜得越准)
做题 0 步 读过 0 块积木 损失 — 犹豫度 —
按「自动训练」开始。
小测验:它给「天气 很 ___」的打分
让它自由写一句
(还没训练:瞎蒙)
「犹豫度」(困惑度)可以理解为:它每写一个字平均在几个词之间拿不定主意,越小越笃定。真实大模型和这里的区别只有三个:词表大几万倍、模型是深度网络而非计数表、教材大万亿倍——「猜→对答案→更新」的循环一模一样。
说人话 预训练 = 刷完整个互联网的填空题。没人教过它「知识」,它只是把「接话」练到出神入化——知识是副产品。

2.3 下山技巧:每一步改多少

训练时每做完一题,都要决定:肚子里的数字往哪边调、调多少?这就像蒙着眼下山: 摸一摸脚下的坡度(梯度),朝下坡方向挪一步。 步子多大,就是学习率——训练里最玄学的旋钮: 步子太小,天黑了还在山顶附近打转;步子太大,一步跨过谷底,直接弹飞。

⛳演示 · 蒙眼下山的小球调步子大小,看它能不能走到谷底
0.35
已走 0 步|当前高度(损失)—|先点「合适的步子」,再按下方播放。
常见误会 「训练 = 把答案背下来」。真背死了叫过拟合。 但预训练的教材远超它背得完的量,它被迫学规律而不是背原文——所以才见过没读过的句子也能接(泛化)。

2.4 越大越强,而且强得可预测

这轮 AI 热潮最反直觉的发现:缩放定律—— 把模型变大、数据变多、算力加足,效果的提升平滑得像物理定律,可以提前算出来。 于是全行业陷入军备竞赛:更大 = 更强,直到钱包见底。

更神奇的是涌现:有些本事(多位数乘法、多步推理) 在小模型身上几乎为零,规模一过某个坎,突然就会了——没有任何人设计过这个功能,它是从「猜字」里自己长出来的。

📉 平滑下滑:可以提前算出来

分数花钱 → 小模型 中模型 大模型 巨无霸 曲线平滑、可预测

钱每多花一个数量级,分数就稳定涨一截——投资人的最爱。

⚡ 突然开窍:无人设计的能力

得分模型规模 → ≈ 瞎猜 跨过坎,突然会了

例:多位数乘法、按指令一步步推理。练着练着自己长出来的。

2.5 上岗培训:学会「好好回答」

刚出厂的基座模型只会接话:你问它问题,它可能反过来问你; 你让它介绍杭州,它可能自己编一段「网友:那北京呢」继续自导自演——毕竟它只学过「互联网上接下来通常是什么」。

所以要来一次上岗培训(SFT): 请人写出几万到上百万条高质量的「指令 → 满分回答」,拿这些继续训练。它这才学会三件事: 有人问,好好答;答到点,就停笔;像助手,别装网友。

还有个冷知识:多轮聊天在底层从来不是「消息列表」,而是被对话模板 拼成一整段文字喂给模型——这是看懂下一章「会话与记忆」的钥匙。

💬演示 · 同一句问话,两种模型的境遇切换对比

        
说人话 那些看起来像乱码的 <|im_start|> 其实是词表里的特殊积木,扮演「角色分隔线」。 培训时模型就学会了:看到 assistant 开头,就轮到我说话;说到 <|im_end|>,就该闭嘴了。

2.6 请裁判:让机器学会「哪个回答更好」

培训后会答题了,但答案有高下之分:该详细还是简洁?口气正式还是亲切?总不能每次回答都请人类打分——太贵太慢。

于是请个裁判(奖励模型):让 AI 对同一个问题写两个回答, 人类标注员勾出更好的那个(偏好数据)。 攒下几十万条「A 比 B 好」,训练出一个打分模型——从此它代替人类当裁判。

⚖️演示 · 你来当 4 轮标注员你的每次选择都在调教下面的「裁判」
裁判当前的打分(你选谁,谁的分就涨)
回答 A
0.00
回答 B
0.00

2.7 被夸被骂:照着分数练出「性格」

裁判就位,调教就能自动化了:让 AI 写回答 → 裁判打分 → 分高的行为被加强,分低的被削弱。 无限循环,AI 越来越对人类胃口。这套流程叫 RLHF(技术内核是个叫 PPO 的算法,不用记)。

后来有人证明了可以跳过裁判和打分,直接拿「A 比 B 好」的数据微调(DPO), 简单稳定成本低,开源圈现在更爱用它。

RLHF · 老派但上限高

生成 → 打分 → 奖惩,在线循环。
优点:能持续打磨,上限高;
缺点:要四个模型协同,训练容易翻车,工程复杂。

DPO · 新派省事

数学上把「照分数奖惩」改写成了普通训练题,离线直接练。
优点:简单稳定便宜;
缺点:探索劲头弱一点,个别场景不如老派。

这一整段统称「对齐」 上岗培训、请裁判、被夸被骂,都在做同一件事:把 AI 调到人类想要的样子。行业公认三条标准(3H): 有用(帮你解决问题)、诚实(不瞎编)、无害(不帮倒忙)。 AI 会拒绝危险请求、会说「我不知道」——这些「性格」全是这一步调出来的,不是天生的。

2.8 考试:出厂前的验收

训练完不能直接上岗,先发几张标准考卷(Benchmark),大家同卷同题,分数好比较:

考卷考什么题型
MMLU学科知识选择题(52 门学科混考)
GSM8K / MATH数学应用题,要写过程
HumanEval写代码补全函数 + 自动跑测试
Arena(竞技场)聊天水平两个模型匿名对打,人类投票
IFEval听话程度「用表格回答」「不超过 50 字」
两个坑 ① 考题混进了教材(数据污染):分数虚高,其实是背过考卷;② 考得高 ≠ 你的活它都能干: 榜上霸主可能在你的具体场景翻车。最终还是要拿你自己业务的题来测。

2.9 延伸:三个值得知道的新方向

🫗 蒸馏:大模型带徒弟

让大模型(老师)海量生成「问题 + 满分回答」,拿去训练小模型(徒弟)。徒弟获得远超自己体格的本事——很多「小钢炮」模型就这么来的。

🧩 MoE:每次只用一小撮脑细胞

把模型拆成多个「专家小组」,每写一个字只叫醒其中一小撮。总脑容量巨大、实际耗电很小——用 20% 的电跑出 80% 的水平。

🧠 推理模型:先打草稿再作答

新一代模型(o1 / DeepSeek-R1 路线)被训练成「先长篇思考再回答」,数学和代码能力暴涨。代价:思考本身也要花时间(第三章的解码算力)。

到这里,AI 养成了、考完了,静静躺在硬盘上。下一章:你按下回车的那一瞬间,它开始工作。