CHAPTER 01 · 基础

先搞懂一件事:
AI 眼里的文字长什么样

在聊「AI 怎么训练、怎么回答你」之前,先打四个地基: Token(文字被切成小积木)、 Embedding(意思变成地图上的位置)、 注意力(词和词对眼神)、 猜下一个字(AI 唯一会做的事)。 每个都配了演示,看不懂文字就玩演示。

4 个交互演示读完约 12 分钟零基础友好

1.1 AI 到底是个啥?一台超级接话机器

你平时用的 AI 聊天机器人,学名叫大语言模型(LLM)。说白了,它就是一台超级接话机器: 你说上半句,它接下半句;你写一个问题,它「接」出一个回答。

它肚子里没有词典、没有百科全书、也不能上网查(除非额外配工具)——只有几千亿个数字。 这些数字是怎么来的?让它把整个互联网的文字读了个遍,做海量「猜下一个字」的练习,慢慢练出来的一种「语感」。 就像一个人读书破万卷后,你起个头他就能像模像样地续下去。

说人话 AI ≈ 读完全网文本的「接话大师」。它回答你时不是在「查资料」,而是在给你「续写」。 这也解释了它为什么会一本正经地编瞎话(幻觉)——续写嘛,只求像,不求真。
70 亿
常见小模型的「脑细胞」数(7B)
14 GB
这个模型存成文件的体积
10 万亿+
大模型「读书」读过的字块数
1/1000 秒
它写一个字所需的量级时间

顺便建立大小概念:早期模型十几亿「脑细胞」,现在旗舰模型据估计上万亿。越大越聪明(第二章细讲为什么), 但也越贵越慢——这是第三章「能不能塞进你显卡」的伏笔。

1.2 Token:文字被切成小积木

AI 不认识「字」,它眼里只有一块块小积木,英文叫 Token。 一段话进模型前,会先被 分词器 剪开: 「我爱吃苹果」可能变成 [我][爱吃][苹果] 三块;英文单词常是一块,冷门长词会被剪碎;数字、标点各有切法。

最主流的剪法叫 BPE,思路朴素到家: 哪两个字总挨在一起出现,就把它们粘成一块积木。粘得越多,常用词就成了一整块,生僻词还是碎的。

说人话 先切积木,再拼积木。你付的钱、能聊多长、回答多快,数的全是积木数量——这就是为什么你必须知道 Token。
✂️演示 · 亲手切一块:迷你分词器随便打几个字试试
切出了 0 块积木 共 0 个字符 平均每块 0 个字符

* 这里用简化规则模拟(英文常用词整块、长词剪半、数字两两一组、中文按常用度 1–2 字一块),真实的词表有 5–15 万块积木,原理一模一样。 试试打一句中文再打一句英文,看看哪种语言更「费积木」。

常见误会 「AI 是一个字一个字读的」——不是,它一次看整串积木;「积木 = 单词」——中文一个字常是一块,英文一个词 1–2 块,冷门词碎成 3 块以上。

1.3 Embedding:给每个词在地图上安家

切好积木后,每块会被换成一串数字(向量), 这一步叫 Embedding。你可以想象成在一张巨大的地图上给每个词安了个家。

最神奇的是:家是 AI 自己学出来的,而且意思越近的词住得越近。 「猫」和「狗」是街坊,「猫」和「微积分」隔了半个地球。AI 后面所有的「思考」,本质上都是在这张地图上做数学题。

🗺️演示 · 语义地图(把几千维压成平面给你看)词会轻轻浮动 · 鼠标碰碰看
当前选中
—
把鼠标移到词上,
看它的街坊是谁;
点选两个词可测「相似度」。
同色 = 一个社区。

真实的地图有好几千个维度(不是平面),而且没人手工安排「猫」该住哪。这张 2D 图只求建立直觉。 「住得近 = 意思近」这招后面到处用:比如「拿你的问题去找相关资料」(第六章 RAG)就是比距离。

1.4 注意力:读到一个词,回头看谁

AI 读句子时,每碰到一个词都会做一件事:回头看看前文,找到跟我关系最大的那个词。 比如读「小猫没有过马路,因为它太累了」——读到「它」的瞬间,必须回头看「小猫」,才知道「它」说的是谁。 这个「回头看」的本领,就叫 注意力。

真实的 AI 里,这种「回头看」同时开着几十组(多头注意力), 各有分工:一组专门抓「他/她/它指的是谁」,一组管词语搭配,一组看整体语义——像几十个助教同时划重点。 几十上百层这样的结构叠起来(Transformer),就是 AI 的骨架。

🕸️演示 · 注意力连线(点任何一个词)换不同的「助教」看看

看点啥 页面打开时已经自动选中了「它」——注意那根最粗的线连向「小猫」(63% 的注意力)。 「它」就是靠这一眼,才知道自己指的是小猫。线的粗细 = 关注程度,所有线的百分比加起来正好是 100%(数学上和第五章的抽签表是同一套)。

1.5 猜下一个字:AI 唯一的核心技能

把前面三样拼起来,AI 干的事简单到离谱:猜下一块积木。 它每一步都交出一张「下一个字是谁」的概率表——「好」42%、「差」3%、「热」7%…… 然后从表里挑一个,接到句尾,再猜下一个。你看到的长篇大论,全是这样一个字一个字「接」出来的长龙。

🎲演示 · 你来当一回 AI看着概率表挑词,把句子接完
说人话 · 顺便埋个伏笔 你刚才挑词的方式,就是第五章的全部内容:永远挑概率第一 → 死板(低温); 按概率抽签 → 自然(中温);抽签前把表搅平 → 放飞(高温)。 而训练(下一章)就是让 AI 把这张表猜得越来越准的过程。