一句话先说清楚:大语言模型(Large Language Model,LLM)不是“会思考的机器人”,而是一个超级会“接话”的程序——它读了海量的文字,学会了“在某个位置,下一个词最可能是什么”。给它一个开头,它一个词一个词地往下接,接出一段看起来很聪明的回答。
1先打个比方:它就是“接龙之王”
咱们玩过“词语接龙”吧?LLM 就是把这招练到极致。
类比 · 想象一个人把几百万本书、几亿个网页、几千万行代码全部背下来了。你说“今天天气真”,他立刻能接“好”“热”“不错”……因为在这些读过的文字里,“天气”后面接“好”最常见。他接得又快又多,像背熟了整座图书馆。
关键点来了:它并不是真的“懂心情”,而是疯狂地从记忆里找“最常见的接法”。这就是整个 LLM 的核心秘密。
2它接话的具体流程(核心原理)
把一句话喂进去,它怎么蹦出回答?就 5 步。
核心流程:分词 → 算下一个词的概率 → 选最可能的一个 → 重复。它就是这么一句一句“接”出来的。
Token(词块)
en: token
模型读的不是“汉字/字母”,而是把文字切成一个个小块。中文一个字常是 1–2 个 token,英文一个常见词是 1 个。切得越小,越能处理不同语言。
3它到底“学”了什么?
这一步最像训练——通过海量文字,把“接话能力”不断调准。
类比 · 玩一个“遮住答案的填空题”游戏:模型盯着一句只有前半部分的句子,猜下一个词。猜错了,就根据正确答案把它内部成千上万个“旋钮”拧一拧,让下次猜得更准。这一套动作,在几万亿个例子上重复了无数遍。
训练循环:取句 → 猜 → 对答案 → 调“旋钮”,反复几万亿次。那些“旋钮”就是下面要讲的 参数。
参数(Parameters)
en: parameters
模型内部成千上万、上亿个可调整的“数字旋钮”。训练就是在调它们。参数越多,模型能记住的“接话规律”越丰富。
训练(Training)
en: training
让模型在大量文字上反复做“猜下一个词”并修正的过程,也叫“预训练”。模型所有知识都来自这段阅读经验。
举个真实的量级:著名的 GPT-3 有约 1750 亿个参数。全世界人口约 80 亿,所以它的参数数量大约是全世界人口的 20 多倍。用这么大量的“旋钮”,它才能记下极其复杂的语言规律。(不同模型参数不同,这里只是让你感觉一下“大”的尺度。)
4为什么它“看起来”那么聪明?
它是怎么听懂你说话、还能讲道理、写代码的呢?
- 上下文(context):它不只盯着一句话,而是把整段对话都带进来一起算,所以能记得你前面说过什么,回答“接得上”。
- 注意力(attention):算下一个词的时候,它会“重点看”前面哪些词最重要,而忽略不相关的词。比如看“小猫在垫子上____”,它知道重点在“垫子”,所以更可能接“睡觉”而不是“飞”。
- 深度学习网络:参数不是简单相加,而是由一层层“神经元”组成的网络互相传递、放大、组合,才能处理这么复杂的语言。
神经网络(Neural Network)
en: neural network
由大量“神经元”分层连接组成的计算结构,灵感来自大脑,但远没那么简单。它是“聪明”的载体。
注意力(Attention)
en: attention
模型判断“此刻该重点看哪些词”的机制。它能抓住长句子里的关键线索,所以读了很长的内容也不乱。
5诚实的提醒:它到底“懂不懂”?
这是很多人的误解,值得说清楚。
它不是真的理解——它没上过学、没经历过世界,只是把“哪里该接什么词”的概率摸得极准。所以它会很自然地用对的词、对的语法、看起来有理有据,但并不等于它知道这是真的。
幻觉(Hallucination)
en: hallucination
当模型没读过正确答案时(比如一个冷门事实),它会“一本正经地编一个听起来很真的答案”,甚至引用一个不存在的书。这不是它撒谎,而是它在“编最可能像话的内容”。
⚠ 实际更复杂一点:训练不是“一次猜对答案就完”,而是用数学方法计算整体误差、一层层反向调参数;现代大模型还会经过“人类反馈强化学习(RLHF)”来让回答更符合人的喜好。这里的流程图做了高度简化,原理方向是对的,细节远不止这些。
💭 想一想(没有标准答案)
- 如果 LLM 只是“接龙之王”,那它写出来的诗,到底算不算“创作”?
- “它懂不懂”这个问题,你会因为它的回答很流畅,就相信它说的东西都是真的吗?那你自己得出的知识,和它的“知识”,有什么不一样?