预训练
"读"整个互联网
耗时几个月
第 5 章
大语言模型是怎么工作的
这一章没有任何数学公式。用两个你天天用的东西来类比:手机输入法的联想功能,和一个很会读书的朋友。
核心机制:超级自动补全
你在手机上打字,"今天天气真——",输入法会弹出"好""不错""热"。这是自动补全——根据前面输入的字,猜下一个字。
大语言模型做的,本质上就是这件事。
输入:"今天天气真
→
好 72%
不错 15%
热 8%
手机输入法:预测 1 个字 | 大语言模型:预测几十上百字,考虑整段对话上下文
| 手机输入法 | 大语言模型 | |
|---|---|---|
| 看过多少文字 | 你打过的那些 | 几乎整个互联网 |
| 预测下一个 | 一个字 | 几十上百字连贯输出 |
| 理解上下文 | 前面两三个字 | 整篇对话 |
因为它"读过"的东西太多了,所以预测出来的结果,看起来像真的在思考。
训练:它怎么学会的
📚
第一步
→
👩🏫
第二步
对齐
人类训练师调教
学会"回答格式"
人类训练师调教
学会"回答格式"
→
🤖
结果
可用助手
能聊天、能写代码
能聊天、能写代码
第一步:大量阅读。模型"读"互联网上的海量文字——维基百科、书籍、论坛帖子、代码仓库。不挑内容,量大管饱。这一步结束后,它就是一个"什么都知道一点但不会聊天"的文字生成器。
第二步:学会对话。人类训练师告诉它:这种回答好,那种不好。慢慢地,它学会了"用户是在问问题,我应该给出有帮助的回答"。
三个关键概念
📏 上下文窗口
AI 对话时能"记住"的信息量。早期 ChatGPT 只能记几页纸,现在的模型能记整本书。如果对话太长,前面内容它可能"忘记",重要信息最好隔一段时间重新提一下。
🌡️ 温度
控制 AI"创造力"的旋钮。低温→保守,适合写代码;高温→跳跃,适合创意文案。WorkBuddy 写代码时默认用低温,所以代码通常比较规矩。
🎭 幻觉
AI 的核心机制是"预测下一个字"而非"核实事实"。当它不知道答案时,不会说"我不知道",而是生成一个看起来很合理的假答案。它不是故意骗你——这是工作原理决定的。降低幻觉:问具体问题、重要信息自己核实、代码实际跑一下。
本章小结
| 概念 | 一句话解释 |
|---|---|
| 核心机制 | 超级自动补全:根据前面的内容猜后面的内容 |
| 训练 | 先大量阅读互联网,再被人类调教成"会聊天"的样子 |
| 上下文窗口 | 它能记住的对话长度,太长了前面的会忘 |
| 温度 | 创造力旋钮,写代码时通常偏保守 |
| 幻觉 | 它会编造看起来很真的假话,不是故意的 |