同一个问题问两遍,
答案不一样——因为 AI 在抽签
AI 每写一个字之前,心里都攥着一张「候选字概率表」。从表里怎么挑字,就叫采样—— 这是它「性格」的全部来源:Temperature 是胆量旋钮(稳还是浪), Top-k、Top-p 是资格线(谁能进抽签箱)。 本章的实验场能让你把每个旋钮拧出肌肉记忆。
5.1 AI 的心里话:一张打分表
AI 写字前,会给词表里每一个字打一个分(分数可大可小、可正可负,行话叫 Logits)。 但分数不能直接用——要过一道换算(Softmax): 把分数统一变成加起来恰好 100% 的概率表。接下来一切采样魔法,都发生在 「改分数 → 换算成表 → 删掉不靠谱的候选」这三步之间。
5.2 拧拧看:温度怎么把表捏尖 / 捏平
下面是一张真实的候选分数(问题:「杭州最著名的景点是___」)。拖动 T,看概率表怎么变形:
5.3 Temperature:AI 的胆量旋钮
实际怎么选 T?经验区间:0–0.3 查资料、写代码(求稳,别发挥);0.5–1.0 日常聊天和写作(拿不准就从 0.7 开始); 1.2–1.6 头脑风暴、起名、写诗(求新,允许翻车)。 注意:T 不改变 AI 知道多少,只改变它敢不敢说偏门答案——「变笨」和「变浪」是两回事。
5.4 抽签实验场:所有旋钮一起拧
完整的抽签流程:分数 ÷ T → 换算成概率表 → Top-k 资格线 → Top-p 资格线 → 重新归一 → 抽签。 左边拧旋钮,右边看表变形,然后一个字一个字抽完整句话。
Top-k:只留前 k 名
不管表长什么样,硬性只保留概率最高的 k 个候选(k=1 就是永远选榜一;50 是常见默认)。 缺点:表很尖时 k 太大会放进垃圾候选;表很平时 k 太小会错杀好选择。于是有了更聪明的——
Top-p(核采样):按累计概率划线
从榜一开始往下加概率,加到 p(比如 90%)就停,只留这部分「核心团队」。 表尖时候选自动变少、表平时候选自动变多——自适应,所以现在比 Top-k 更常用。两个可以叠加。
5.5 贪心解码:永远的第一名,和复读机
每次都选概率最高的字,这叫贪心(把 T 调到 0 或 Top-k=1 就是它)。 输出完全固定、可以复现,写代码、做提取时很好用。但它有个著名的副作用——复读机:
你:用一句话夸夸我
AI:你很棒,你很棒,你很棒,你很棒,你很棒,你很棒,……
因为「重复出现过的字」总在榜一,贪心永远跳不出去。加点随机(温度/核采样)、或开启 重复惩罚,都是为了让它逃出死循环。
5.6 其他常见旋钮
🔁 重复惩罚
已经写过的字,分数打个折(比如除以 1.1),压住复读倾向。拧太大有副作用:人名、代码变量名这种必须重复的词也被打压,输出开始别扭地避讳。
🎚️ Min-p
动态资格线:只留概率 ≥「榜一概率 × p」的候选。表尖时候选少、表平时候选多,天生防「高温抽到垃圾」。新一代推理引擎的默认推荐。
🎲 随机种子
抽签用的「随机数」其实由种子决定。同种子 + 同参数 + 同输入 = 逐字相同的输出——实验场里可以验证。生产环境不设种子,每次都是新的一串。
5.7 幻觉:为什么会一本正经地胡说八道
根源不在采样,在训练目标:AI 优化的是「说得像真的」,不是「说的是真的」—— 它是接话大师,不是查证员。采样只是放大或收窄症状:高温让它敢选偏门字(更容易胡说), 低温让它固守高频套路(可能反复输出同一个错常识)。降温治标,给它资料才治本(下一章 RAG)。
| 你要干嘛 | 推荐设置 | 为什么 |
|---|---|---|
| 写代码 / 提取数据 | T 0–0.2,top-p 0.9 | 要确定、格式要稳 |
| 日常助手聊天 | T 0.6–0.8,top-p 0.95 | 正确和自然兼顾 |
| 文案 / 头脑风暴 | T 1.0–1.4,top-p 0.98,min-p 0.05 | 多样性优先 |
| 数学 / 事实问答 | T 0 + 给资料/工具 | 别靠抽签赌运气 |
「每个字怎么挑」讲完了。最后一章回到实际使用:怎么写提示词、怎么给它配资料和工具、什么时候值得花钱微调。