你每次和 ChatGPT、文心一言、通义千问、豆包对话时,背后那台"AI"到底在干什么?它真的在"理解"你的问题吗?这篇文章用尽量直白的方式,拆开大语言模型(LLM)的工作原理。

一、本质:一个超强的"接话茬"机器

大模型的核心任务只有一个:给定前面的文字,预测下一个最可能出现的字(或词块)。

它不检索数据库,也不"查答案",而是基于训练时见过的海量文本,算出"下一个字该是什么"的概率分布,再按一定策略选一个出来。你看到的整段回答,就是这样一个字一个字"接"出来的。

所以,大模型本质上是一个概率模型,而不是一个装满知识的图书馆。

二、分词:把语言切成模型能处理的"乐高块"

模型读不懂"字",先要把文本切成 token(词块)。英文常按子词切分,中文则常按字或词块切分。

比如 “unbelievable” 可能被切成 “un” + “believ” + “able”。token 是模型计算和计费的统一单位,你看到的"上下文长度"“花了多少 token”,都指这个。

三、Transformer:让模型学会"该看哪里"

2017 年,谷歌等机构在论文《Attention Is All You Need》中提出 Transformer 架构,这是现代大模型的基石。

关键机制是自注意力(self-attention):处理每个词时,模型会同时计算它和上下文所有词的相关程度,决定"该重点关注哪些词"。这让模型能捕捉长距离依赖,比如一句话开头的主语和句尾的代词之间的关系。

相比早期模型,Transformer 可以并行计算,训练效率大幅提升,也更能扩展到超大规模。

四、预训练:吞下整个互联网

模型先在海量无标注文本(网页、书籍、代码等)上做"续写"训练:遮住一部分,让它猜出来。

这一阶段让模型学会了语法、常识和世界知识。规模定律(scaling law)指出:在合理范围内,模型参数、训练数据、算力的增大,会带来可预测的能力提升。例如 2020 年发布的 GPT-3 约有 1750 亿参数,正是在这一思路下的产物。

五、对齐:从"会说话"到"会帮忙"

只做过预训练的模型只是个"续写机器",不一定按你的意图办事。2022 年的 InstructGPT 工作引入了 RLHF(基于人类反馈的强化学习):

先用人类示范数据做监督微调,再收集人类对多个回答的偏好,训练一个"奖励模型",最后用强化学习让模型倾向生成更符合人类偏好的回答。

经此对齐,模型变得更"有用、诚实、无害"。

六、推理:你提问时发生了什么

你发出问题后,模型把上下文编码,逐 token 生成回答,并把已生成的内容缓存(KV cache)以加速后续计算。

生成时并非总选概率最高的那个字,而是用温度(temperature)、top-p 等参数控制随机性:温度低更确定、保守;温度高更发散、有创意。

七、边界:它并不是全知全能

大模型有两个常被忽视的局限。

一是幻觉,即生成看似合理但与事实不符的内容;二是知识截止,模型只见过训练数据截止时间之前的信息,不会自动知道最新事件。

它擅长模式与语言,但并不真正"理解"世界,也不具备持续记忆与因果推理的可靠性。把它当作能力很强的协作者,而不是权威真理来源,会更稳妥。

小结

大模型 = 海量数据预训练出的"下一个字预测器" + Transformer 注意力机制 + 人类反馈对齐。它强大,但边界清晰。理解它怎么工作,才能更好地用好它。

参考来源

  • Vaswani et al., 2017, 《Attention Is All You Need》(NeurIPS)
  • Brown et al., 2020, 《Language Models are Few-Shot Learners》(GPT-3)
  • Ouyang et al., 2022, 《Training language models to follow instructions with human feedback》(InstructGPT / RLHF)
  • Kaplan et al., 2020, 《Scaling Laws for Neural Language Models》
Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐