AI认知系列(2)| 从专家系统到 ChatGPT:六十年 AI 进化的四次范式跃迁
为什么写这篇文章
2022 年底 ChatGPT 横空出世,很多人以为 AI 是一夜之间变聪明的。但事实上,从最早的专家系统到今天的大语言模型,人工智能走过了近六十年的迭代之路。这篇文章将梳理这条进化脉络,拆解每一次技术范式跃迁背后的核心逻辑 ——"知识到底从哪里来"这个问题,是如何被一代代研究者不断重新回答的。理解了这条主线,你就能看懂今天 AI 为什么能做到这些事,以及它未来还将走向何方。
一、专家系统:把人类知识写成规则
上世纪 60 到 80 年代,AI 的主流路线是符号主义—— 研究者相信,智能的本质是对符号的逻辑操作。于是他们把领域专家的知识一条条编码成if-then规则,再配上推理引擎,让机器像专家一样做判断。
这一时期的代表作包括用于化学分子结构推断的 DENDRAL,以及用于血液病诊断的 MYCIN。在特定的窄领域里,这些系统确实能达到甚至超过人类专家的水平。
但专家系统有一个致命瓶颈 ——知识获取。每一条规则都需要人类专家手写,规模根本上不去;换一个领域就要从头建库;面对模糊和不确定性,僵硬的逻辑规则也无能为力。到 80 年代末,AI 进入了第一个 "寒冬"。
二、统计机器学习:让数据自己说话
90 年代起,随着算力提升和数据积累,研究者换了一个思路:与其手写规则,不如让模型从数据中自动统计规律。
这一阶段的代表算法包括支持向量机(SVM)、决策树、随机森林和朴素贝叶斯。在自然语言处理领域,n-gram 语言模型、TF-IDF 和统计机器翻译成为主流。模型终于能处理噪声和不确定性了。
但统计学习仍有一个绕不开的环节 ——特征工程。你得告诉模型 "看哪些特征",而这依然高度依赖人工经验。模型能学权重,但不知道该关注什么。语义理解也停留在词频和共现层面,并不真正理解 "意思"。
三、深度学习:模型自己学表示
2012 年,AlexNet 在 ImageNet 图像识别竞赛中以巨大优势夺冠,深度学习时代正式开启。
深度学习的核心突破在于:神经网络能自动从原始数据中学习分层特征表示,不再需要人工设计特征。 在图像领域,底层学边缘,中层学纹理,高层学物体部件,一切自动发生。
在 NLP 领域,几个关键节点接连出现:2013 年的 Word2Vec 把词变成稠密向量,"国王−男人 + 女人≈女王" 的经典类比让人们第一次看到模型捕捉到了语义关系;2014 年的 Seq2Seq 编码器 - 解码器架构让机器翻译质量飞跃;2015 年的 Attention 机制则解决了长距离依赖问题。
不过,当时的主流模型 RNN 和 LSTM 难以并行训练,处理长文本仍有力不从心之处。
四、Transformer 与预训练:大模型时代的黎明
2017 年,Google 发表论文《Attention is All You Need》,提出Transformer 架构—— 完全基于自注意力机制,抛弃了循环结构,可以大规模并行训练。这篇论文成为了此后所有大语言模型的基石。

Transformer 直接催生了预训练语言模型范式:先在海量文本上做自监督预训练,再针对具体任务微调。代表性模型如下:
GPT-3 带来了一个关键发现 ——涌现现象。当模型规模和训练数据大到一定程度,会出现量变引起质变:模型突然具备了小模型没有的推理、编程和多步任务能力,而且不需要针对每个任务重新训练,只需用提示词引导。
范式从此变成了 "一个大模型 + 提示词适配所有任务"。
五、ChatGPT:让 AI 学会 "说人话"
GPT-3 虽然强大,但本质上是一台 "续写机器"—— 给什么就接什么,不一定听得懂指令,也不一定按人类期望的方式回答。

ChatGPT 的真正突破在于对齐(Alignment),具体分三步:
- 监督微调(SFT):用人工撰写的高质量对话示范,教模型 "应该怎么回答问题"。
- 奖励模型训练:对同一问题的多个回答,由人类标注偏好排序,训练出一个能判断回答质量的奖励模型。
- RLHF(人类反馈强化学习):用 PPO 算法做强化学习,让模型不断生成人类更喜欢的回答。
经过这套流程,模型不仅 "会说",而且 "说得像人、听得懂指令、知道拒绝不当请求"。ChatGPT 由此成为 AI 史上用户增长最快的消费级产品。
六、四次范式对比
七、技术 FAQ
Q1:Transformer 的自注意力机制到底解决了什么问题?
自注意力让模型在处理每个词时,能直接关注句子中所有其他词,计算它们之间的关联权重。相比 RNN 必须按顺序逐个处理,自注意力可以并行计算,训练效率大幅提升;同时不存在长距离信息衰减问题,能更好地捕捉长距离依赖关系。
Q2:什么是 "涌现能力"?为什么大模型会突然变聪明?
涌现能力指模型规模突破某个阈值后,突然具备了小模型完全没有的能力,比如多步推理、代码生成。目前学界尚无统一解释,一种观点认为复杂任务需要足够多的参数来存储和组合中间表示,参数不够时任务根本无法被习得。
Q3:RLHF 和普通的监督学习有什么区别?
监督学习给的是 "标准答案",模型学习模仿;RLHF 给的是 "偏好排序",模型学习什么回答更受人类喜欢。后者更灵活 —— 好的回答不止一个,RLHF 能让模型在多种合理回答中选择更符合人类期望的那种,同时学会拒绝不当请求。
Q4:为什么大模型会出现 "幻觉"(编造事实)?
大语言模型的训练目标是预测下一个最可能的词,而非验证事实正确性。当训练数据中信息不足或存在矛盾时,模型会基于概率生成 "看起来合理但实际错误" 的内容。这是自监督训练目标与事实准确性之间的根本矛盾,目前通过检索增强生成(RAG)等方式缓解。
Q5:预训练和微调分别在做什么?
预训练是在海量通用文本上做自监督学习(比如预测被遮盖的词),让模型学到语言规律和世界知识,成本极高但只做一次。微调是在预训练模型基础上,用特定任务的标注数据做少量训练,让模型适配具体场景。大模型时代,微调正逐渐被提示词工程和少样本学习替代。
八、结语:总结与未来展望
回顾六十年,AI 的进化可以浓缩成一句话:人需要做的事情,正在被一层层外包给模型。 从写规则,到选特征,到连特征都不用选,最后连 "怎么跟人说话" 都靠人类反馈自动学习。每一次范式跃迁,都把人类从繁琐的工程中解放出来,同时把模型的能力边界推得更远。
展望未来,几个方向值得关注:多模态融合将让 AI 同时理解文字、图像、音频和视频;Agent 化意味着大模型从 "回答问题" 走向 "完成任务",能自主规划、调用工具、执行多步骤操作;端侧部署让 AI 能力进入手机、汽车等设备,降低延迟和成本;而安全与对齐研究将始终伴随 —— 能力越强,确保它按人类意图行事就越重要。
我们正处在一个罕见的技术拐点上。AI 不会取代所有人,但会用 AI 的人将取代不用 AI 的人。理解它从哪里来,才能更好地判断它将往哪里去。
更多推荐



所有评论(0)