从一次对话到 Token 预测:拆解 LLM 的推理过程
你每次和 ChatGPT、文心一言、通义千问、豆包对话时,背后那台"AI"到底在干什么?它真的在"理解"你的问题吗?这篇文章用尽量直白的方式,拆开大语言模型(LLM)的工作原理。
一、本质:一个超强的"接话茬"机器
大模型的核心任务只有一个:给定前面的文字,预测下一个最可能出现的字(或词块)。
它不检索数据库,也不"查答案",而是基于训练时见过的海量文本,算出"下一个字该是什么"的概率分布,再按一定策略选一个出来。你看到的整段回答,就是这样一个字一个字"接"出来的。
所以,大模型本质上是一个概率模型,而不是一个装满知识的图书馆。
二、分词:把语言切成模型能处理的"乐高块"
模型读不懂"字",先要把文本切成 token(词块)。英文常按子词切分,中文则常按字或词块切分。
比如 “unbelievable” 可能被切成 “un” + “believ” + “able”。token 是模型计算和计费的统一单位,你看到的"上下文长度"“花了多少 token”,都指这个。
三、Transformer:让模型学会"该看哪里"
2017 年,谷歌等机构在论文《Attention Is All You Need》中提出 Transformer 架构,这是现代大模型的基石。
关键机制是自注意力(self-attention):处理每个词时,模型会同时计算它和上下文所有词的相关程度,决定"该重点关注哪些词"。这让模型能捕捉长距离依赖,比如一句话开头的主语和句尾的代词之间的关系。
相比早期模型,Transformer 可以并行计算,训练效率大幅提升,也更能扩展到超大规模。
四、预训练:吞下整个互联网
模型先在海量无标注文本(网页、书籍、代码等)上做"续写"训练:遮住一部分,让它猜出来。
这一阶段让模型学会了语法、常识和世界知识。规模定律(scaling law)指出:在合理范围内,模型参数、训练数据、算力的增大,会带来可预测的能力提升。例如 2020 年发布的 GPT-3 约有 1750 亿参数,正是在这一思路下的产物。
五、对齐:从"会说话"到"会帮忙"
只做过预训练的模型只是个"续写机器",不一定按你的意图办事。2022 年的 InstructGPT 工作引入了 RLHF(基于人类反馈的强化学习):
先用人类示范数据做监督微调,再收集人类对多个回答的偏好,训练一个"奖励模型",最后用强化学习让模型倾向生成更符合人类偏好的回答。
经此对齐,模型变得更"有用、诚实、无害"。
六、推理:你提问时发生了什么
你发出问题后,模型把上下文编码,逐 token 生成回答,并把已生成的内容缓存(KV cache)以加速后续计算。
生成时并非总选概率最高的那个字,而是用温度(temperature)、top-p 等参数控制随机性:温度低更确定、保守;温度高更发散、有创意。
七、边界:它并不是全知全能
大模型有两个常被忽视的局限。
一是幻觉,即生成看似合理但与事实不符的内容;二是知识截止,模型只见过训练数据截止时间之前的信息,不会自动知道最新事件。
它擅长模式与语言,但并不真正"理解"世界,也不具备持续记忆与因果推理的可靠性。把它当作能力很强的协作者,而不是权威真理来源,会更稳妥。
小结
大模型 = 海量数据预训练出的"下一个字预测器" + Transformer 注意力机制 + 人类反馈对齐。它强大,但边界清晰。理解它怎么工作,才能更好地用好它。
参考来源
- Vaswani et al., 2017, 《Attention Is All You Need》(NeurIPS)
- Brown et al., 2020, 《Language Models are Few-Shot Learners》(GPT-3)
- Ouyang et al., 2022, 《Training language models to follow instructions with human feedback》(InstructGPT / RLHF)
- Kaplan et al., 2020, 《Scaling Laws for Neural Language Models》
更多推荐




所有评论(0)