先搞懂一件事:
AI 眼里的文字长什么样
在聊「AI 怎么训练、怎么回答你」之前,先打四个地基: Token(文字被切成小积木)、 Embedding(意思变成地图上的位置)、 注意力(词和词对眼神)、 猜下一个字(AI 唯一会做的事)。 每个都配了演示,看不懂文字就玩演示。
1.1 AI 到底是个啥?一台超级接话机器
你平时用的 AI 聊天机器人,学名叫大语言模型(LLM)。说白了,它就是一台超级接话机器: 你说上半句,它接下半句;你写一个问题,它「接」出一个回答。
它肚子里没有词典、没有百科全书、也不能上网查(除非额外配工具)——只有几千亿个数字。 这些数字是怎么来的?让它把整个互联网的文字读了个遍,做海量「猜下一个字」的练习,慢慢练出来的一种「语感」。 就像一个人读书破万卷后,你起个头他就能像模像样地续下去。
顺便建立大小概念:早期模型十几亿「脑细胞」,现在旗舰模型据估计上万亿。越大越聪明(第二章细讲为什么), 但也越贵越慢——这是第三章「能不能塞进你显卡」的伏笔。
1.2 Token:文字被切成小积木
AI 不认识「字」,它眼里只有一块块小积木,英文叫 Token。 一段话进模型前,会先被 分词器 剪开: 「我爱吃苹果」可能变成 [我][爱吃][苹果] 三块;英文单词常是一块,冷门长词会被剪碎;数字、标点各有切法。
最主流的剪法叫 BPE,思路朴素到家: 哪两个字总挨在一起出现,就把它们粘成一块积木。粘得越多,常用词就成了一整块,生僻词还是碎的。
1.3 Embedding:给每个词在地图上安家
切好积木后,每块会被换成一串数字(向量), 这一步叫 Embedding。你可以想象成在一张巨大的地图上给每个词安了个家。
最神奇的是:家是 AI 自己学出来的,而且意思越近的词住得越近。 「猫」和「狗」是街坊,「猫」和「微积分」隔了半个地球。AI 后面所有的「思考」,本质上都是在这张地图上做数学题。
真实的地图有好几千个维度(不是平面),而且没人手工安排「猫」该住哪。这张 2D 图只求建立直觉。 「住得近 = 意思近」这招后面到处用:比如「拿你的问题去找相关资料」(第六章 RAG)就是比距离。
1.4 注意力:读到一个词,回头看谁
AI 读句子时,每碰到一个词都会做一件事:回头看看前文,找到跟我关系最大的那个词。 比如读「小猫没有过马路,因为它太累了」——读到「它」的瞬间,必须回头看「小猫」,才知道「它」说的是谁。 这个「回头看」的本领,就叫 注意力。
真实的 AI 里,这种「回头看」同时开着几十组(多头注意力), 各有分工:一组专门抓「他/她/它指的是谁」,一组管词语搭配,一组看整体语义——像几十个助教同时划重点。 几十上百层这样的结构叠起来(Transformer),就是 AI 的骨架。
1.5 猜下一个字:AI 唯一的核心技能
把前面三样拼起来,AI 干的事简单到离谱:猜下一块积木。 它每一步都交出一张「下一个字是谁」的概率表——「好」42%、「差」3%、「热」7%…… 然后从表里挑一个,接到句尾,再猜下一个。你看到的长篇大论,全是这样一个字一个字「接」出来的长龙。