一.感受下大模型

我们从下⾯⼏个例⼦直观感受下现在⼤模型的能⼒:

1. AI ⾃然语⾔编程

软件开发正经历⼀场由AI驱动的范式⾰命——“Vibe Coding”让编程从严谨的语法敲击,演变为轻松的灵感对话。开发者只需⽤⾃然语⾔描述功能需求,AI便能⾃动⽣成、优化甚⾄调试代码,仿佛与⼀位全能⼯程师实时协作。这⼀转变标志着⾃然语⾔编程时代的真正到来:不再需要记忆晦涩的API或纠结细枝末节的语法,想法即代码,意图即实现。随之⽽来的是代码编写成本的断崖式下降——从⼈⼒⼯时、开发投⼊到维护开销,各项成本正以⾁眼可⻅的速度趋近于零。未来,软件产品的价值将不再取决于⾏数多少,⽽取决于创意的⾼度与问题的深度。


2. AI对话图像处理

AI在图像处理领域正展现出前所未有的全能性。它不仅是“⽆中⽣有”的造梦师,能从⽂字或草图直
接⽣成逼真或奇幻的视觉画⾯;更是⼀位精通像素与语义的智能修图师,能对既有照⽚进⾏深度编
。⽆论是替换背景、移除杂物、改变光影,还是调整表情、转换艺术⻛格,AI都能精准理解⾃然语⾔指令,在保持物理真实感的同时实现局部重绘或全域改造。从扩图画布到拖拽变形,AI让图像编辑从繁琐的⼿动操作进化为智能的创意对话,真正实现了“所想即所得”的视觉重构。


3. AI智能体操控腾讯会议

AI智能体正在重新定义⼈与机器的协作边界。它不再是简单的对话机器⼈,⽽是具备⾃主感知、规划决策与⼯具调⽤能⼒的数字⾏动者。只需⽤⾃然语⾔交代⼀个⽬标——⽐如“整理下周⾏程并⽣成报告”或“分析这份数据并绘制图表”——智能体便会⾃动拆解任务,调⽤搜索、编程、办公软件等外部⼯具,多步迭代执⾏,并在过程中⾃我纠偏。这种“意图即执⾏”的模式,将繁琐的操作链浓缩为⼀次简单的对话,让软件使⽤的学习成本急剧下降,任务完成的边际成本⽆限趋近于零。未来,AI智能体将成为每个⼈的专属数字员⼯,让创造⼒直接落地为成果。

我们来感受下智能体,腾讯会议是腾讯推出的⼀块即时会议产品,可以多⼈参加会议,我们可以使⽤微信和⼩⻰虾聊天直接完成会议的预定和取消。

微信发起预定诉求:⼩⻰虾预定

腾讯会议预定成功

微信取消会议:

⼤模型如此强悍,背后到底如何⼯作的呢,接下来我们逐步学习下⼤模型到底如何⼀步步变的如此强⼒。


二.大模型是什么

人工智能(Artificial Intelligence)

⼈⼯智能(Artificial Intelligence),英⽂缩写为AI。是研究、开发⽤于模拟、延伸和扩展⼈的智能的理论、⽅法、技术及应⽤系统的⼀⻔新技术科学。⼈⼯智能是计算机科学的⼀个分⽀,它企图了解智能的实质,并⽣产出⼀种新的能以⼈类智能相似的⽅式做出反应的智能机器,该领域的研究包括机器⼈、语⾔识别、图像识别、⾃然语⾔处理和专家系统等。

本质: 对⼈类智能的模拟。⽆论是简单的逻辑规则(if-else)还是复杂的神经⽹络,只要能展现出“聪明”的决策⾏为,都算 AI。
现状:当前的⼈⼯智能,⼤多是在模仿智能的“⾏为”,⽽⾮复制智能的“本质”。

学界对AI的定义存在两条路:

  • 强⼈⼯智能:⽬标是制造出真正拥有⼼智、意识、能理解⾃⾝存在的机器。
  • 弱⼈⼯智能:专注于在特定领域表现出智能⾏为,像⼈⼀样做得好,甚⾄更好。

⼈⼯智能并没有⾮常严格的定义,简单来说,⼈⼯智能是让机器(特别是计算机系统)模拟、延伸甚⾄超越⼈类智能的理论、⽅法和技术,是⼀个⼈类期望达到的⽬标。

举个例⼦:⼿机⾥的语⾳助⼿⽐如⼩爱同学、宇树科技机器⼈、DeepSeek,都属于AI,早期的AI可能是通过规则实现的,可以理解为 “⼈⼯制定规则:当发⽣…,则…”


a.宇树科技机器⼈

四足智能巡检方案 - 宇树科技

蛇年春晚中,宇树科技的通⽤⼈形机器⼈H1以“扭秧歌”的形式惊艳亮相,表演了由张艺谋导演的
《秧BOT》节⽬。这些机器⼈⼿持红⼿绢,随着喜庆的⾳乐节奏扭动⾝姿,动作整⻬划⼀,场⾯喜感⼜魔幻。这是⼈类历史上⾸次全AI驱动全⾃动集群⼈形机器⼈的⼤型全球公开表演,引发了全球范围内的持续热议与⼴泛关注。


b.⼩艺请抬脚

问界 - 鸿蒙智行官网

“⼩艺请抬脚”是华为⾼阶智驾系统(如乾崑ADS)在触发⾃动紧急制动(AEB)时,通过⻋机语⾳助⼿“⼩艺”向驾驶员发出的语⾳提⽰,意思是:请⽴即抬起踩在油⻔踏板上的脚。


c.机器狼
第15届中国航展的现场,多型战机炫舞蓝天,各型⽆⼈装备勾勒出未来战场形态。其中,中国兵器装备集团⾃动化研究所有限公司⾃主研制的“机器狼”⾸次在中国航展现场进⾏动态展⽰。


机器学习(Machine Learning)

机器学习(Machine Learning),英⽂缩写为ML,是⼈⼯智能的⼀个⼦领域,其核⼼不再是⼿动编写规则,⽽是通过数据训练算法,让计算机从历史样本中⾃动总结规律,⽤以预测或决策新问题。
⼈⼯智能和机器学习到底是什么关系呢?

⼈⼯智能是⽬标,机器学习是实现该⽬标的主要⼿段。当代⼈⼯智能 ≈ 基于机器学习的⼈⼯智能。
本质:给定输⼊ x 和输出 y ,让机器⾃⼰找到那个函数 f(x) ≈ y 。


怎么理解这个本质呢?

⽐如我们打⻋,起步价10元(固定成本),每公⾥2元,求⼀下打⻋20公⾥多少钱?

这个公式对我们来说⾮常简单就可以求解出来 y=2x+10,这就是费⽤的计算规律。
那机器学习是什么呢?告诉你有下⾯的数据,然后需要计算⼀下X=20公⾥的时候,费⽤是多少?

很明显我们可以看到是⼀个递增的,设 y=ax+b,然后代⼊2组数据,可以求出来a=2,b=10。然后我们根据规律求出来20公⾥的时候费⽤是50块钱。


这个求出的a,b就是机器学习中的参数;(⼈类)输⼊给机器的原始素材x就是特征;机器学习对⽐我们⼈⼯求出来的这个过程是⾃动化求解,不需要我们⼈⼯代⼊数据去求解,这个⾃动化找参数的过程就叫模型训练(training)或者学习(learning);⽽且机器的x和y在现实世界中不全是数字,可以是复杂的问题,图⽚,语⾳等。 y=2x+10 就是我们训练好的数学模型。有了模型以后,我们根据X=20公⾥,计算费⽤总的费⽤为50,这个过程就叫做推理(inference)/预测(Prediction)。

实际⼯作中我们真正的模型往往很难如此简单,举个例⼦,我们要实现⼀个简单的图像分类,⽐如区分下图⽚⾥⾯是⻋还是⼈?我们要学习的函数变成了下⾯的形式,⻋和⼈我们很难⽤简单的⼏个参数来表⽰,就需要⽤机器学习来完成,学习到的参数往往也是⼏万⼏⼗万的参数,很难通过简单的⽅式来进⾏解释。

⻋ | ⼈ = f(图⽚)

如下图:

我们参与训练的图⽚和标签往往叫做样本,其中图⽚称为特征,Y称为标签,特征和标签组成了样本整体称为训练数据


1.按反馈信号分类

传统机器学习分为监督学习、⽆监督学习 、强化学习三类,随着技术发展,半监督在标注成本敏感的场景(如医疗影像)中成为独⽴赛道⾃监督在⼤模型时代成为核⼼预训练范式。它们的实现逻辑和评估⽅式已与传统三⼤类明显不同,因此被独⽴列出。

建模过程中,根据训练数据的标注情况(学习所依赖的反馈信号),可以把机器学习分为监督学习、⽆监督学习、半监督学习、⾃监督学习、强化学习。


a.监督学习(Supervised Learning)

监督学习是机器学习和⼈⼯智能中的⼀种算法学习训练⽅式。模型通过标记好的训练数据进⾏学习,⽬标是建⽴输⼊与输出之间的映射关系。监督学习靠“外部标准答案”(⼈⼯标签)反馈。有对错,直接纠正。


鸢尾花(Iris)数据集是机器学习中最经典的监督学习⼊⻔案例。它包含150个样本,每个样本都有4个数值特征(花萼⻓度、花萼宽度、花瓣⻓度、花瓣宽度)和对应的标签——即3种鸢尾花的品种。这种“特征-标签”的配对结构,完美契合了监督学习通过已知答案(标签)的数据来训练模型,从⽽对新数据进⾏预测的核⼼思想。因此,它常被⽤来演⽰分类算法,是理解监督学习流程的理想“HelloWorld”数据集。

该数据集在UCI机器学习库中的地址为:https://archive.ics.uci.edu/ml/datasets/Iris


⽆监督学习(Unsupervised Learning)

⽆监督学习的核⼼定义可以概括为:在完全没有“标签”(即标准答案)的情况下,让算法⾃⾏从输⼊数据中发现隐藏的结构、规律或模式,靠“数据内在结构”反馈。没有对错,只找规律。

⽐如“买尿不湿的⼥性”在实际的电商聚类中,算法会⾃然地把这类⽤⼾聚到⼀起,她们往往还同时
购买婴⼉湿⼱、奶粉、玩具等,消费频次⾼、客单价中等。业务上会给这个群体起名叫 “宝妈群
体”。

其他典型群体还可能包括:

  • “数码极客”:⾼频浏览电⼦产品、客单价⾼、男性居多
  • “家庭采购者”:购买粮油、清洁⽤品、复购稳定
  • “深夜冲动型”:多在凌晨下单、浏览品类跳跃、退货率⾼

半监督学习(Semi-supervised Learning)

半监督学习利⽤少量“有标签”的数据(带标准答案)和⼤量“⽆标签”的数据(⽆答案)共同进⾏
训练,以此来提升模型的预测精度
。介于两者之间,在我们拥有相对较少的标记数据和⼤量未标记数据的情况下,半监督学习结合了监督学习和⽆监督学习的优势,于是在此时可以发挥很好的作⽤。在海量数据⾯前,⼿动标记数据的成本过于⾼昂且繁琐,⽽未标记的数据很多、易于获取,且每⽇都会产⽣⼤量的数据。因此,我们可以只标记数据集中的⼀部分,⽽不是标记整个数据集,然后⽤半监督学习⽅式来学习。

举个例⼦,只有资深放射科医⽣才能准确标注 X 光⽚,医⽣时间昂贵且稀缺。但医院每天会产⽣海量的原始 X 光⽚(⽆标注)。


半监督做法:

1. ⽤ 500 张医⽣标注好的⽚⼦训练⼀个初始模型。
2. 让该模型去预测 10,000 张未标注的⽚⼦。
3. 挑选模型预测结果中置信度极⾼(⽐如 99% 确定是肺炎)的图⽚,给它们打上“伪标签”
(Pseudo-label)。
4. 将这些带有伪标签的数据加⼊训练集,重新训练模型。


⾃监督学习(Self-Supervised Learning)

⾃监督学习利⽤数据本⾝的结构来“⾃动⽣成”监督信号(即伪标签)。⾃监督学习⽬前是 AI 界的宠⼉,它是⽆监督学习的⼀种特殊形式,但其“学习过程”却极像监督学习。 既然⼈⼯标注
(Labeling)太贵,那就让数据“⾃⼰标注⾃⼰”。模型通过隐藏数据的⼀部分,然后尝试预测这部
分内容。它与半监督学习的核⼼区别在于:半监督学习仍依赖少量真实标签,⽽⾃监督学习完全不⽤标签。

⾃监督学习(Self-Supervised Learning, SSL) 是⼀种让机器学习模型“⾃学成才”的范式。它最⼤的特点是,不需要昂贵的⼈⼯标注数据,⽽是从海量的⽆标签原始数据中,⾃动“创造”出训练所需的“标签”或“监督信号”

下⾯我们来看个例⼦,Stable Diffusion (SD) 是⼀种可以通过⽂本描述(Prompt)⽣成⾼质量图像的深度学习模型。它在 2022 年由 Stability AI 联合 CompVis、Runway 等机构发布,因其完全开源和能在普通家⽤显卡上运⾏,彻底点燃了 AIGC(⼈⼯智能⽣成内容)的爆发。
扩散模型(Diffusion Model)的⼯作过程就是⼀个⾃监督学习的过程,它通过⼀套⾃给⾃⾜的逻辑来摸索世界的规律。


第⼀步:⾃导⾃演的“恶作剧”(加噪 - Forward Process)

想象你⼿⾥有⼀张清晰的《蒙娜丽莎》拼图。

1. 操作:你往拼图上撒了⼀把沙⼦(噪声),遮住了⼀点细节。
2. 继续:你⼜撒了⼀把沙⼦,画⾯变得模糊了。
3. 终点:最后你撒了⽆数把沙⼦,原来的画完全看不⻅了,只剩下⼀堆灰⾊的沙⼦。

为什么是⾃监督?

因为在这个过程中,“沙⼦”是你亲⼿撒的。你知道每⼀时刻加了多少沙⼦,也知道原图⻓什么样。这种“答案就在⾃⼰⼿⾥”的过程,就是⾃监督。


第⼆步:苦练“还原术”(去噪 - Reverse Process)

现在,你把这堆“沙⼦”交给模型,对它说:“我刚才往画上撒了沙⼦,请你把刚才那⼀层沙⼦从画
上‘吹’⾛,还原回前⼀秒的样⼦。”


  1. 前置任务:模型的⽬标不是直接变出⼀张画,⽽是预测并减去那层沙⼦。
  2. 反复横跳:模型会不停地对⽐:
  • 它以为的沙⼦ vs 实际上你撒的沙⼦。
  • 它还原出的画 vs 你⼿⾥的原图。

学到了什么? 为了把沙⼦吹⼲净,模型必须理解画作的内在规律。它得知道:
“这⾥有⼀条弧线,沙⼦下⾯可能是⼀个嘴⻆。”
“这⾥的颜⾊很暗,沙⼦下⾯应该是头发。”
“如果我胡乱吹,画出来的东西就不像‘画’,⽽像碎纸屑。”


第三步:⽆中⽣有的“超能⼒”(采样 - Sampling)

当模型练成了“顶级还原术”后,神奇的事情发⽣了。
即使你给它⼀堆全新的、完全随机的沙⼦(纯随机噪声),并对它说:“去吧,把这堆沙⼦⾥多余的东西吹掉。”

模型会凭借它在训练中学到的“经验”(即图像的概率分布),在虚⽆中⼀点点勾勒出线条、⾊彩和
结构。它以为⾃⼰在“还原”⼀张不存在的画,结果却创造出了⼀张全新的、写实的图像。
这就像⼀个学画画的⼈,每天的任务不是临摹名画,⽽是把名画打碎成粉末,再尝试把粉末粘回去。久⽽久之,即便不看原图,他也能⽤粉末堆出⼀幅⼤师级的作品。


强化学习 (Reinforcement Learning)

如果说监督学习是“照答案做题”(有标准答案),⽆监督学习是“⾃⼰找规律”(没有答案),那
么强化学习就是“在试错中积累经验,追求⻓期收益最⼤化”。
强化学习通过与环境交互来学习。它没有直接的标签,⽽是通过“奖励”或“惩罚”来优化⾏为策
略,⽬标是获得最⼤的⻓期累积奖励
。它的核⼼逻辑和我们训练宠物狗⼀模⼀样:做对了,给块⾁⼲(奖励);做错了,轻轻呵斥(惩罚)。久⽽久之,它就知道在什么情况下该做什么事,以获得最多的⾁⼲。

举个训练狗的例子:


以AlphaGo为例

第⼀阶段:通过“打谱”进⾏监督学习
这是 AlphaGo 的启蒙阶段。研究⼈员会输⼊海量⼈类⾼段位棋⼿的历史对局棋谱,让模型像⼈类初学者⼀样“打谱”学习。

  • 学习⽅式:监督学习。
  • 具体做法:模型学习“在某个棋局下,⼈类⾼⼿通常会下在哪⾥”。它的⽬标不是赢棋,⽽是尽可能准确地模仿⼈类的落⼦选择。
  • 成果:经过这个阶段,AlphaGo 已经拥有了超越绝⼤多数⼈类棋⼿的棋感,学会了合理的下法。

第⼆阶段:通过“左右互搏”进⾏强化学习
这是 AlphaGo 超越⼈类、实现进化的核⼼阶段。它的学习⽅式从“模仿⼈类”转变为“⾃我探索”。

  • 学习⽅式:强化学习。
  • 具体做法:

a. ⾃我对弈:让第⼀阶段训练出的多个不同版本的策略⽹络相互对弈数⼗万甚⾄数百万局。
b. 获得奖励:对弈的最终结果(赢或输)就是唯⼀的“奖励信号”。赢了,说明这局棋的策略是
好的;输了,则说明需要改进。
c. 优化策略:模型的⽬标是最⼤化赢棋的概率。它会不断调整⾃⼰的下棋策略,淘汰那些导致失
败的策略,强化那些能带来胜利的策略。

  • 成果:通过这种“左右互搏”,AlphaGo 不再局限于⼈类棋谱,⽽是⾃⼰创造出了许多⼈类从未⻅过的、极具创造⼒的新下法,⽐如那招让所有棋⼿震惊的“第37⼿”。这标志它真正超越⼈类知识的边界。

第三阶段:AlphaGo Zero摆脱⼈类偏⻅
值得⼀提的是,DeepMind 后来发布的 AlphaGo Zero 版本,进⼀步印证了强化学习的强⼤。

  • 彻底摆脱⼈类:AlphaGo Zero 完全摒弃了第⼀阶段的监督学习,它不再需要任何⼈类棋谱。
  • 真正的“从零开始”:它只被告诉围棋的基本规则,然后就开始和“⾃⼰”下棋,通过纯粹的强化学习,在短短40天内就成为了史上最强的围棋AI,并以100:0的战绩完胜击败李世⽯的旧版AlphaGo

各个类别的反馈信号

  • 监督学习:信号来⾃⼈⼯标注
  • ⽆监督学习:信号来⾃数据本⾝的内在结构
  • ⾃监督学习:信号由数据⾃动构造
  • 强化学习:信号来⾃环境给出的奖励(延迟、数值型)

2.按学习任务分类

根据机器学习的任务,常⻅的类型有以下⼏种。

分类(Classification)

分类是⼀种监督学习任务,旨在根据输⼊数据的特征,将其划分到预先定义好的、离散的类别标签中。机器学习可以通过对已知类别的数据进⾏学习,从⽽对未知类别的数据进⾏分类。⽐如在垃圾邮件识别中,机器学习算法可以通过学习已知的垃圾邮件和⾮垃圾邮件,来判断⼀封新收到的邮件是否是垃圾邮件。分类问题的常⻅算法有K近邻算法、逻辑回归、朴素⻉叶斯、决策树、随机森林、⽀持向量机(SVM算法)等。

举个例⼦

假设你刚⼊职⼀家公司,领导给你⼀个任务:把邮件分类成“正常邮件”和“垃圾邮件”。
领导扔给你 5000 封已经分好类的历史邮件(训练数据),让你⾃⼰看,⾃⼰总结规律。你开始认真翻看:

垃圾邮件的常⻅套路:

  • 标题含“免费”、“中奖”、“⽴即领取”
  • 正⽂频繁出现“点击链接”、“转账”、“账⼾异常”
  • 发件⼈是⼀串乱码邮箱,⽐如 sdf23@xx.com

正常邮件的常⻅特征:

  • 发件⼈是熟悉的同事、客⼾
  • 内容涉及⼯作安排、项⽬进度
  • 没有诱导点击的夸张话术

你看完 5000 封邮件后,脑⼦⾥已经形成了⼀套判断规则(模型)。


第⼆步:分类(推理阶段)

第⼆天早上,你打开收件箱,看到⼀封从来没有⻅过的新邮件:

发件⼈: service@unknown.com
标题:【紧急】您的账⼾存在异常,请⽴即点击链接验证

你⼤脑迅速扫描:

  •  发件⼈陌⽣
  •  标题含“紧急”、“⽴即”
  •  诱导点击链接

你果断判断:这是垃圾邮件! 然后⼀键拖进垃圾箱。
恭喜你,成功完成了⼀次分类推理


回归(Regression)

回归是⼀种监督学习任务,旨在建⽴⼀个数学模型,来拟合输⼊特征与连续数值型输出之间的映射关系。机器学习可以通过对已知的数据进⾏学习,从⽽对新的数据进⾏预测。⽐如在股票市场中,机器学习算法可以通过学习历史股票价格数据,来预测未来的股票价格。回归问题的常⻅算法有线性回归等。

看这个股票的走势,⽐如我们预测明天的股票价格

第⼀步:学习(训练阶段)

假设你是某基⾦公司的量化分析师,领导给你⼀个任务:根据历史数据,预测明天这只股票的价格。领导扔给你过去 500 天的每⽇股票记录(训练数据),每⼀条都包含

  • 当天开盘价
  • 当天收盘价(这个是已知的答案)
  • 当天成交量
  • 当天最⾼价、最低价

你把这些数据画在图上,横轴是时间,纵轴是价格,发现价格不是完全随机乱跳的——它隐隐约约遵循着某种趋势。

你的任务就是让计算机⾃动找到这种趋势的数学规律。


第二步:推理(预测阶段)

计算机通过分析 500 天的数据,⾃动学出了⼀个公式,简化版就像这样:

明天收盘价 = a × 今天收盘价 + b × 今天成交量 + c

你不需要⼿动去算 a、b、c 具体是多少,机器⾃动帮你算好了。
然后你输⼊今天的数据:

  • 今天收盘价:100 元
  • 今天成交量:1000 万股

计算机代⼊公式,秒算出:

明天收盘价 ≈ 102.5 元


聚类(Clustering)

聚类是⼀种⽆监督学习任务,旨在在没有预先给定类别标签的情况下,根据数据样本之间的内在相似性,⾃动将其划分为若⼲个不相交的簇(Group)。机器学习可以将数据按照⼀定的特征进⾏聚类,从⽽将相似的数据归为⼀类。⽐如在客⼾分析中,机器学习算法可以通过学习客⼾的购买⾏为和喜好,将相似的客⼾归为⼀类,从⽽对不同的客⼾群体进⾏针对性的营销聚类算法属于⽆监督学习,常⻅的算法有K均值算法(K-means)、层次聚类、DBSCAN、⾼斯混合模型(GMM)等。

⽐如我们常⽤的⾳乐APP

第⼀步:机器看什么数据(特征)

App后台有成千上万⾸歌,每⾸歌都被提取成⼀组数字特征:

  • 节拍速度(快/慢)
  • 乐器种类(有没有吉他、钢琴、电⼦合成器)
  • ⼈声特点(男声/⼥声/纯⾳乐)
  • 能量值(激昂/舒缓)
  • 情绪值(欢快/悲伤)

于是每⾸歌都变成了⼀个“坐标点”,⽐如:

  • 歌曲A:(速度120, 能量0.8, ⼈声男, 情绪欢快)
  • 歌曲B:(速度60, 能量0.2, 纯⾳乐, 情绪悲伤)
  • 歌曲C:(速度130, 能量0.9, ⼈声⼥, 情绪欢快)

第⼆步:机器⾃动“抱团”(聚类)

机器把所有歌曲按照这些特征“距离远近”⾃动分成若⼲堆,⽐如分成了4堆:


第三步:把你“塞”进某⼀堆

机器再看你过去⼀周的听歌记录:你单曲循环了20遍《起⻛了》,还听了5⾸类似的歌。
机器发现:这些歌全部属于“深夜emo”那⼀堆。
于是它得出结论:“这个⽤⼾⼤概率属于‘深夜emo’群体。”


第四步:给你推荐

机器从“深夜emo”那⼀堆⾥,挑出你还没听过的其他歌曲,塞进你明天的“每⽇推荐”⾥。
你第⼆天打开App,发现推荐的歌⾸⾸都像量⾝定做——这就是聚类的魔⼒。


关联规则(Association Rule Learning)

关联规则是⼀种⽆监督学习任务,旨在从⼤规模数据集中,发现变量(或项)之间有趣的隐含依赖关系或共⽣模式,通常表⽰为“X → Y”的蕴含式。机器学习可以从⼤规模数据中发现变量之间的有趣关联或频繁模式。例如在超市购物篮分析中,通过分析顾客购买记录,可以找出“购买尿不湿的顾客往往也会购买啤酒”这样的关联规则,从⽽优化商品陈列和促销策略。常⻅的算法有Apriori算法、FP-Growth算法等。


啤酒尿布是数据挖掘与商业分析领域最著名的经典案例之⼀,讲述了超市通过数据分析发现啤酒与尿布存在关联销售机会的故事。尽管其真实性存在争议,被视为“商业寓⾔”,但其背后的关联规则挖掘理论对零售业营销产⽣了深远影响。

故事内容:传说 20 世纪 90 年代,美国沃尔玛超市管理⼈员分析销售数据时发现,年轻的⽗亲在购
买尿布时,往往会顺便购买啤酒。
⾏为逻辑:当时美国家庭通常由⺟亲照看婴⼉,⽗亲负责外出购物,他们在完成妻⼦交代的买尿布任务
后,会买啤酒犒劳⾃⼰。
营销措施:据传超市随后将啤酒与尿布摆放在⼀起,结果两者销量双双⼤幅提升,成为关联营销的典
范


序列预测(Sequence)

序列预测,简单来说,就是利⽤过去⼀串有顺序的数据,来推断未来接下来会发⽣什么。它的核⼼在于数据点之间存在顺序依赖性(⾮独⽴同分布)。机器学习可以利⽤历史序列数据来预测未来的元素或趋势。⽐如在⾃然语⾔处理中,模型可以根据已⽣成的⽂字预测下⼀个单词,从⽽实现⽂本⾃动补全或机器翻译。序列预测的常⻅算法有循环神经⽹络(RNN)、⻓短期记忆⽹络(LSTM)、⻔控循环单元(GRU)、Transformer等。

以中英⽂翻译为例,核⼼的⽣成过程,本质上是由⼀系列连续的序列预测构成。

  • 输⼊序列(源语⾔): "我 爱 学习"
  • ⽬标序列(⽬标语⾔): "I love learning"

在翻译时,模型并不是瞬间变出整句英⽂,⽽是⼀个词⼀个词地“预测”出来的。


深度学习(Deep learning)

深度学习(Deep learning),英⽂缩写为DL,是⼀种机器学习的分⽀,它是通过构建多层神经⽹络来实现⾃主学习和预测的能⼒。深度学习的核⼼是深度神经⽹络,它由多个层次的神经元组成,每⼀层都可以提取出不同的特征信息,从⽽实现对复杂数据的学习和预测。深度学习的应⽤范围⾮常⼴泛,包括图像识别、语⾳识别、⾃然语⾔处理等领域。

相⽐于传统机器学习(如SVM、决策树)需要⼈⼯设计特征(特征⼯程),深度学习的本质区别在于,它不仅能⾃动学习参数(权重),更重要的是,它能通过多层结构⾃动从原始数据中逐层构建出⾼层次的抽象特征(如从像素到边缘,再到轮廓,最后到物体部件),从⽽避免了传统机器学习中繁琐的⼈⼯特征⼯程。”

机器学习我们知道学习了⼏百上千万的参数,这些参数如何表⽰呢,就是⽬前流⾏的神经⽹络
(neural network)
,神经⽹络的参数学习就是深度学习,典型的神经⽹络架构如下所⽰。

输⼊层和输出层之间的层被称为隐藏层,层与层之间的连接密度和类型构成了⽹络的配置。
神经⽹络由多个层组成,包括:

  • 输⼊层(Input Layer):接收原始输⼊数据。
  • 隐藏层(Hidden Layer):对输⼊数据进⾏处理,可以有多个隐藏层。
  • 输出层(Output Layer):产⽣最终的输出结果。

如果⽤数学语⾔描述深度学习的本质,它不再是简单的 y=f(x),⽽是:y = f(...f(f(x))...)

这⾥的每个 f 通常代表神经⽹络的⼀层(Layer),⽽整个模型就是这些层功能的逐级嵌套。


举例如下:

案例:AI如何判断西红柿炒鸡蛋的呢?

你开了⼀家外卖平台,需要开发⼀个AI系统:⽤⼾上传⼀道菜的照⽚,AI⾃动判断它是不是“西红柿炒鸡蛋”。


这个AI的⼤脑是⼀个深度神经⽹络,它的判断过程就像⼀条后厨品控流⽔线,每个师傅只负责⼀道极简单的⼯序,然后传给下⼀个⼈:

第⼀站:输⼊层(接收原始照⽚)

你上传了⼀张⼿机拍的菜品的照⽚。

输⼊层的⼯作:啥也不⼲,就是把这张照⽚拆解成计算机能认的 像素值(数字矩阵),原封不动地传给下⼀个师傅。


第⼆站:第⼀个隐藏层(找基本颜⾊)

第⼀个师傅接过这堆数字,他的任务很简单:图⽚⾥有没有“红⾊”和“⻩⾊”?
他扫描⼀遍,发现有⼤量红⾊像素(西红柿)和⼤量⻩⾊像素(鸡蛋)。于是他在报告上写:“检测到⼤量红⾊ + ⼤量⻩⾊。”

这⼀步学到的是:最基本的“颜⾊”特征。


第三站:第⼆个隐藏层(找形状)

第⼆个师傅不看原图,只看第⼀份报告。他的任务是:这些红⾊和⻩⾊是不是“块状”的?
他发现红⾊聚成不规则的⼤块(西红柿块),⻩⾊聚成⼩块的絮状(鸡蛋块),⽽不是均匀涂抹的红⾊酱汁(⽐如番茄酱)或⻩⾊流质(⽐如咖喱)。于是他写:“红⾊呈块状 + ⻩⾊呈絮状。”

这⼀步学到的是:中级的“形状”特征(块状 vs 糊状)。


第四站:第三个隐藏层(判断组合关系)

第三个师傅只看第⼆份报告,他的任务是:这两种颜⾊有没有“混合在⼀起”?
他发现红⾊块和⻩⾊块是交错混杂的(西红柿和鸡蛋是炒在⼀起的),⽽不是分开放置的(⽐如红⻩各占⼀半的拼盘)。于是他写:“红⻩交错混合。”

这⼀步学到的是:⾼级的“空间关系”特征(是否混合)。


第五站:输出层(最终判断)

最后⼀个师傅(输出层)只看第三份报告。他的脑⼦⾥只有⼀个对照表:

果满⾜ “红⾊ + ⻩⾊ + 块状 + 絮状 + 混合” → 输出 “是西红柿炒鸡蛋” (正确)
如果不满⾜ → 输出 “不是西红柿炒鸡蛋” (错误)

他看完报告,果断敲章:“结论:是西红柿炒鸡蛋!”

 把“嵌套公式”映射到这个菜谱⾥

y = f₃( f₂( f₁( x ) ) )

每⼀层都在上⼀层的结果上继续加⼯,信息越来越抽象,越来越接近最终答案。


这个例⼦让你彻底悟透的三个点


为什么叫深度呢?

深度 = 层数多,深度学习”这个名字⾮常直⽩,就是在描述这类⽹络层次很深的特点。我们来看下下表⼤模型常⻅的层数。


按照数据模态分类

1.计算机视觉 - (Computer Vision,CV)

计算机视觉是⼈⼯智能的核⼼领域之⼀,⽬标是让机器“看懂”世界——从图像或视频中提取信息、
理解内容,并做出决策。它涉及多个交叉学科,包括计算机科学、数学、神经科学等。

常见任务:

a.图像分类 (Image Classification) 是计算机视觉中最基础也是最核⼼的任务:给定⼀张输⼊图像,算法需要从预定义的类别集合中指定⼀个最能描述该图像内容的标签。直⽩点就是识别图中“是什么”。


b.⽬标检测

⽬标检测可以理解为⼀个核⼼问题:它不仅需要回答“图像⾥有什么?”,还要回答“它们在哪
⾥?”。
简单来说,⽬标检测的任务是:

  • 识别(What): 确定图像中物体的类别(如⼈、⻋、猫)。
  • 定位(Where): ⽤⼀个边界框精确框出每个物体的位置。


c.语义分割

语义分割是计算机视觉中⽐⽬标检测更进⼀步的任务。如果说⽬标检测关⼼的是“在哪⾥有什么(画框)”,那么语义分割关⼼的是“每个像素是什么”。
简单来说,语义分割的⽬标是:将图像中的每⼀个像素点,都划分到对应的类别中(如⼈、⻋、天
空、道路等)。

Roboflow Playground: Test & Compare Vision AI Models Free


e.实例分割

在图像或视频中,实例分割 (Instance Segmentation)是将每个感兴趣的物体的轮廓精确描绘出来,并且区分开同⼀类别的不同个体。


f.⽬标跟踪

⽬标检测关注的是单张图⽚,⽽⽬标跟踪关注的是视频流。在视频的第⼀帧给定⼀个⽬标(或者模型⾃动检测出⽬标),在后续的帧中持续定位这个⽬标的位置。核⼼在于建⽴时序上的关联,知道“这⼀帧的物体就是上⼀帧的那个物体”。


g.关键点检测

关键点检测不关⼼物体的轮廓,它只寻找那些能定义形状的特定坐标 (x, y)。


h.⽂字与符号识别 (OCR)

⽂字与符号识别,通常被归为光学字符识别(OCR, Optical Character Recognition)的范畴,是计算机视觉中专⻔处理图像中的⽂字和符号的任务。它的⽬标是:让计算机像⼈⼀样,从图⽚、视频帧或扫描⽂档中“读”出⽂本内容,并转化为可编辑、可搜索的字符信息。


2.⾃然语⾔处理 -(Natural Language Processing, NLP)

⾃然语⾔处理(NLP)是⼈⼯智能领域中以⾃然语⾔⽂本(离散符号)为核⼼处理对象,研究如何建⽴⼈类语⾔形式与机器可计算语义之间可逆映射关系的学科。它旨在赋予计算机具备对语⾔符号进⾏形态分析、语义理解、逻辑推理及连贯⽣成的能⼒,从⽽消除⼈类⾃然语⾔的模糊性、歧义性与机器严格指令系统之间的鸿沟。

a.研究⽅向

  • ⾃然语⾔理解 (NLU):让机器理解⼈类想表达的意思。

重点在于语义和意图。
例如:判断“我想吃苹果”是指⽔果,还是指⼿机?

  • ⾃然语⾔⽣成 (NLG):让机器根据数据或意图,⽣成⼈类可读的⽂本。

重点在于流畅度和准确性。
例如:写新闻稿、写邮件回复、⽣成诗歌。


b.常⻅任务

NLU(⾃然语⾔理解)

(1)⽂本分类

将⼀段不定⻓的⽂本,⾃动打上⼀个或多个预先设定好的类别标签。它是NLP最基础、最成熟的任
务。
技术本质:通常是⼀个多分类或多标签问题。

  • 主题分类:输⼊ “中国乒乓球拿下奥球会⼤满贯”--> 输出 [体育] 。
  • 意图分类(智能客服):输⼊ “我想改⼀下收货地址”--> 输出 [修改订单] 。
  • 新闻打标:输⼊ “央⾏宣布降低存款准备⾦率”--> 输出 [财经] 、 [政策] (多标签)

(2)情感分析

它是⽂本分类的⼀个特殊⼦集,专⻔⽤来判断⽂本背后的主观情绪、观点或态度(通常是极性或强
度)。
例⼦:

  • 细粒度情感:输⼊ “酒店位置绝佳,但房间隔⾳差到离谱”--> 输出 位置[正向],隔⾳[负向]。
  • 电商评价:输⼊ “这⼿机电池太不耐⽤了”--> 输出 负向(Negative)。
  • 社交媒体舆情:输⼊ “XXX明星官宣结婚,祝福!”--> 输出 正向(Positive) 且 情绪[喜悦]。

(3)命名实体识别(NER)

从⾮结构化的⽂本中,识别出具有特定意义的实体指代,并将其归⼊预定义的类别(如⼈名、地名、组织名、⽇期、专有名词等)。它是信息抽取的基⽯。
例⼦:

  • 输⼊: ⻢云在杭州创办了阿⾥巴巴,时间是1999年。
  • 识别结果: ⻢云 (⼈名) / 杭州 (地名) / 阿⾥巴巴 (组织机构) / 1999年 (时间)


(5)语义相似度

计算两段⽂本在含义层⾯上的相近程度(⽽不是字⾯重复程度)。这是搜索、问答和智能推荐的核⼼算法。
例⼦:

  • 句⼦A: “如何给⼿机快速充电?”
  • 句⼦B: “⼿机快充有哪些技巧?”→ 相似度:0.95(极⾼,语义⼀致)
  • 句⼦C: “今天⼿机电量消耗很快。”→ 相似度:0.15(极低,话题不同)
  • 注:如果只是字⾯重叠,“快充”和“充电”有重叠,但模型会发现“技巧”和“消耗”语义完全不同,这就是该任务的难点。

中文分词 | 在线演示


c.NLG(⾃然语⾔⽣成)

(1)机器翻译
将⼀种语⾔的⽂本⾃动翻译成另⼀种语⾔。
例⼦:

  • 输⼊(中⽂): “今天天⽓很好”
  • 输出(英⽂): “The weather is very nice today.”


(2)对话⽣成

对话系统指的是构建能与⼈类进⾏多轮交互的聊天机器⼈。
例⼦:

  • ⽤⼾: “帮我查⼀下明天的天⽓。”
  • 系统: “您所在的城市是哪⾥?”
  • ⽤⼾: “上海。”
  • 系统: “明天上海晴转多云,22℃〜28℃。”

我们可以借助⾖包(豆包 - 字节跳动旗下 AI 智能助手)来创建漫画,ppt等,下⾯是我让⾖包⽣成的⼀个⼩红书爆款⽂案.


(3)⽂章摘要

将⻓⽂本压缩成包含关键信息的短⽂本

  • 抽取式:直接从原⽂中摘取重要句⼦。
  • ⽣成式:重新组织语⾔⽣成新句⼦。

例⼦:输⼊⼀篇数千字的新闻,输出摘要为 “5⽉6⽇,XX公司发布新款⼿机,配备最新AI芯⽚,起售价5999元。”

现在的⼤模型已经具备⽂章摘要能⼒,我们来看下deepseek(DeepSeek)如果摘要⽂章

提⽰词:

总结下这个博客的核⼼内容输出 https://claude.com/blog/common-workflow-patterns-for-
ai-agents-and-when-to-use-them

总结结果如下,可以看到总结的内容和博客的内容还是⽐较⼀致的。

注意:

从“任务分类”到“⼤模型统⼀”:过去,上述每个任务都需要单独训练⼀个⼩模型。但现在,⼤语
⾔模型(LLMs,如GPT系列、⽂⼼⼀⾔)已经通过“预训练+微调/提⽰词”的⽅式,⼏乎能⽤同⼀个模型完成以上所有任务。


3.语⾳处理

语⾳处理是⼀⻔涉及信号处理、计算机科学、语⾔学和⼈⼯智能的交叉学科,核⼼⽬标是让机器能够分析、理解、合成和处理⼈类的语⾳信号

(1)常⻅任务

a.语⾳识别
语⾳识别(ASR,Automatic Speech Recognition):即语⾳转⽂字是将⼈类语⾳中的词汇内容转换为计算机可读的⽂本或指令的过程。⽬前的系统通常基于Whisper、Paraformer等先进架构。常⻅的应⽤智能⾳箱(如⼩爱同学、Alexa)、会议纪要⾃动⽣成、语⾳输⼊法、⽆障碍辅助(为听障⼈⼠提供字幕)、⻋载语⾳控制。我们⽇常使⽤的微信语⾳转⽂字就是典型的语⾳识别应⽤。


b.语⾳合成

语⾳合成(TTS,Text-to-Speech):即⽂字转语⾳是让计算机将⽂本转换为⾃然、流畅且富有表现⼒的语⾳。⽬前的TTS模型(如VITS、NaturalSpeech、ChatTTS)能够⽣成⾼度拟⼈、带有情感和韵律的语⾳,甚⾄可以⽀持少样本克隆(仅需⼏秒样本即可模仿特定⼈声)。
下图是讯⻜(
在线语音合成_文字转语音-讯飞开放平台)推出的在线语⾳服务,点击播放就可以把⽂字转换为声⾳,⽽且⽀持⽅⾔。


4.多模态

“多模态”是⼈⼯智能领域的⼀个核⼼概念,指同时处理、理解或⽣成两种及以上不同类型数据(模
态)的技术。在⼈类认知中,我们天然就是多模态的——通过视觉、听觉、触觉等多种感官来理解世界。
常⻅的模态包括:

  • 视觉:图像、视频、图表、⼿势
  • 听觉:语⾳、⾳乐、环境声⾳
  • ⽂本:⾃然语⾔、符号、代码
  • 传感器数据:触觉(压⼒、振动)、深度图(如激光雷达)、惯性测量单元数据、体温等

(1)常⻅任务

多模态AI主要解决三类问题:

  • 理解与推理:从多种数据中提取含义。

例⼦:给出⼀张图⽚和⼀句相关的问题(“图中穿红⾐服的⼈在做什么?”),模型需要结合
视觉(找红⾊)和⽂本(理解问题)来回答。

  • ⽣成与创作:根据⼀种模态⽣成另⼀种模态。

例⼦:⽂本⽣成图像(如Stable Diffusion、Midjourney)、⽂本⽣成视频(Sora)、图像⽣成⽂本(看图写话)、⽂本⽣成⾳乐。

  • 对⻬与检索:找到不同模态之间的对应关系。

例⼦:⽤⽂字描述“⼀只在沙滩上的⾦⽑⽝”,从海量图⽚库中找出匹配的图⽚

下⾯看2个模态常⻅的例⼦:

(2)⽂⽣图/视频/⾳频

图像⽣成的⽬标是:让计算机从随机噪声、⽂本描述、条件图像或其他模态输⼊中,⾃动创建出逼
真、多样且符合要求的图像。

我们可以使⽤⾖包输⼊提⽰词创建⼀个图⽚,豆包 - 字节跳动旗下 AI 智能助手


(3)视觉问答 (VQA)

视觉问答 (VQA)不仅仅是识别出图像中的物体,⽽是要对整个场景进⾏语义层⾯的解析。它综合了感知(Perception)、推理(Reasoning)和知识(Knowledge),试图回答关于图像的⾼阶问题。图像理解追求的是:让计算机像⼈⼀样,看懂图像中到底发⽣了什么,并能够⽤⾃然语⾔描述、推理或回答关于图像的问题。


深度学习和传统机器学习的区别

  1.  特征提取⽅式:传统机器学习⾼度依赖⼈⼯特征⼯程(专家⼿动设计特征),⽽深度学习通过端到端学习,⾃动从原始数据中抽象出⾼阶特征。
  2.  模型可解释性:传统算法(如决策树、线性回归)具有强可解释性,能清晰看到推理路径;深度学习是“⿊盒”模型,内部复杂的⾮线性映射导致⼈类难以直观解释其决策逻辑。
  3. 数据依赖性:深度学习对海量标注数据⾼度依赖。⼩样本场景下,传统机器学习的效果更稳定,且不易过拟合;只有在⼤数据规模下,深度学习才会展现出压倒性的性能优势。
  4. 计算资源消耗:深度学习在训练阶段需要庞⼤的算⼒集群(GPU/TPU)和存储资源,投⼊巨⼤;但在推理阶段,经过模型压缩后可以部署到端侧设备。

生成式人工智能(Generative Artificial Intelligence,GenAI)

⽣成式⼈⼯智能(Generative AI,简称GenAI)是⼈⼯智能(AI)的⼀个分⽀,它能够根据⽤⼾的输⼊,⾃主地创造全新的内容,例如⽂本、图像、⾳频、视频和代码等。它标志着AI从“分析世界”到“创造世界”的跨越。

⽣成式⼈⼯智能是⼈⼯智能领域的重要分⽀,⼀类通过学习数据中的内在规律和分布,能够⽣成在结构上复杂、在组织上符合逻辑、在表现上具有整体⼀致性的全新内容的⼈⼯智能系统。这⾥的“内容”可以是⽂本、图像、⾳频、代码、视频等。

传统AI和⽣成式AI的核⼼区别在于“分析”与“创造”。

  • 传统AI(分析式AI):像⼀个“精准的检索员”或“判断者”。它擅⻓从已有数据中识别模式、进⾏分类和预测。例如,⼈脸识别解锁⼿机、搜索引擎匹配关键词、电商平台推荐商品。
  • ⽣成式AI(⽣成式AI):像⼀个“创意的创作者”。它通过学习海量数据中的内在规律,能⾃主⽣成全新的、从未存在过的内容。例如,根据⼀句话⽣成⼀幅画、⼀段⽂章或⼀⾸⾳乐。

我们可以借助深度学习的⼿段来实现GenAI,当然也可以不借助深度学习,严格意义上GenAI并不属于深度学习但是⽣成式⼈⼯智能太复杂了,⽬前的实现都是基于深度学习,所以⼤家谈论的深度学习都是归结于深度学习。


假设现在不打⻋了,我们来预测明天会不会下⾬。
传统的机器学习(分类)是:输⼊今天的天⽓数据 xx,输出 y=1(下⾬)或 y=0(不下⾬)。这还是y=f(x)。
但⽣成式 AI 不这么⼲。它学到的不是 y=ax+b,⽽是学到⼀个“概率抽奖机”。

  • 它⼼⾥的公式变成了:

结果=随机抽奖(概率列表)

举个例⼦:模型看了海量数据后,算出“明天下⾬”概率 60%,“不下⾬”概率 40%。

⽣成式 AI 的本质不是直接告诉你“下⾬”,⽽是根据这 60% 和 40% 的⽐例去掷⼀次骰⼦。如果骰⼦落在 60% 范围,它就⽣成“下⾬”;落在 40%,就⽣成“晴天”。
所以,它的数学本质不再是固定的 y=f(x),⽽是:y∼P(x) (读作:y服从于 xx 的概率分布)

通俗理解:以前的 ML 是“计算器”(按 2+3 必得 5);GenAI 是“⼀个懂⾏的赌徒”(根据历史胜率下注,这次押赢,下次可能押输,结果不固定)。这就是为什么同样的问题问 ChatGPT,它每次回答的字眼都不完全⼀样。


按⽣成内容分类

(1)⽂本⽣成

让AI根据你的要求写出⽂字内容。它可以写⽂章、诗歌、代码、邮件、剧本,也可以帮你总结⽂档、翻译语⾔、进⾏逻辑推理。就像拥有⼀个知识渊博、⽂笔流畅的助⼿。DeepSeek,ChatGPT,Kimi都都是业界知名的产品。


举个例⼦,好多男⽣和⼥朋友没有话题聊,或者⼥朋友说肚⼦不舒服,我们就可以呼叫我们的⽂本⽣成的⼤模型,问问他我怎么回复好些。下⾯是我问了deepseek的回复,来看看deepseek是不是是个很好的“军师”。

可以看到deepseek的考虑还是很周全的,另外说⼀句deepseek有app版本,装到⼿机上⼤家就是随⾝携带了⼀个军师。


(2)图像⽣成(跨模态)

AI根据你的⽂字描述或参考图,⽣成图⽚、插画、海报、产品设计图等视觉内容。它可以帮助设计师快速出图、修改细节、拓展创意,让“脑洞”直接变成画⾯。业界知名产品,Midjourney,DALL·E3,Stable Diffusion,⾖包等。


下⾯是我⽤⾖包⽣成的⼀个图⽚,⾸先我是⽤deepseek优化了下提⽰词,原始提⽰词“把下⾯的提示词的细节写丰富些 ⽣成⼀个云上⻜跃的蓝鲸”。


(3)⾳频⽣成(跨模态)

借助AI⽣成声⾳内容。包括:克隆某个⼈的声⾳(语⾳合成)、⽣成背景⾳乐、创作歌曲(包括⼈声演唱)、⾳效制作、甚⾄让⼀段录⾳换成另⼀种语⾔但保留原声线。业界知名产品如Suno,Udio,⾖包。


我⽤suno(https://suno.com/)⽣成了⼀⾸歌曲,⼤家可以听⼀下,还是⾮常的动听,⽽且还有对应的歌词,歌词的意境也表述的很清楚。

提示词可以看下很简单:

⽽且竟然还有⾼潮部分。


(4)视频⽣成(跨模态)

AI根据⽂字或图⽚⽣成动态视频、创建3D模型、数字⼈播报,业界知名产品有可灵,⾖包,即
梦,Runway,Veo等

下⾯是我⽤可灵(Kling AI: Next-Generation AI Creative Studio)⽣成的视频,提⽰词信息如下:

视频效果如下:(这里视频我没法导入用的是图片)


大语言模型

“⼤语⾔模型”(Large Language Model,简称 LLM)是当前⼈⼯智能领域的核⼼突破,它通过海量的⽂本数据训练,参数规模达数⼗亿以上,使机器能够像⼈类⼀样理解、⽣成和处理语⾔。⼤语⾔模型可以理解为:⼀个通过海量⽂本训练⽽成的、拥有巨量参数的、能理解和⽣成⼈类语⾔的概率模型。


⽣成式⼈⼯智能是⼀个⼴泛的领域或技术类别,⽽⼤语⾔模型是实现这个领域⽬标的最核⼼、最成熟的⼀种技术路径,特别专注于⽂本的⽣成。


1.有多⼤

之所以叫“⼤”语⾔模型,主要体现在三个⽅⾯:

  1. 数据⼤:它学习过⼈类互联⽹上⼏乎所有的公开⽂本,包括书籍、维基百科、新闻、论⽂、代码等,规模可达数万亿单词(Token)的量级。
  2. 参数⼤:参数可以理解为模型的“脑细胞”或“记忆抽屉”。参数越多,模型越“聪明”。从早期的⼏亿参数,发展到今天主流模型拥有数千亿甚⾄上万亿的参数。
  3. 算⼒⼤:训练这样⼀个模型需要成千上万张顶级显卡,耗费数⽉时间,电费成本⾼达数百万甚⾄数千万美元。

我们以GPT3和DeepSeek为例:
chatgpt3(2020年) 核⼼数据如下:
数据来源于 OpenAI 在2020年发布的原始论⽂ Language Modelsare Few-ShotLearners

[2005.14165] Language Models are Few-Shot Learners

  • 原始数据量:约 45TB 的压缩⽂本数据,这是清洗前的规模 。
  • 清洗后数据量:约 570GB,经过过滤和去重后实际⽤于训练的有效语料 。
  • 模型参数:1750亿(175 billion),是当时最⼤的密集参数语⾔模型


DeepSeek-V3的核⼼数据如下:

数据来源 DeepSeek-V3技术报告(arXiv:2412.19437)

https://arxiv.org/pdf/2412.19437

DeepSeekV3 预训练数据量14.8万亿(14.8 trillion)tokens,总参数量:671B(6710亿)。


2.有哪⼏种

a.仅编码器 (Encoder-only) —— “阅读理解⼤师”

  • 核⼼能⼒:双向理解。它能同时看到句⼦“左边”和“右边”的上下⽂,像做阅读理解⼀样,把⼀整段话完整地吸收、消化,然后输出⼀个“语义理解结果”。
  • 通俗案例:给你的商品评论做“情感分析”。

你输⼊⼀句话:“这家餐厅的菜虽然贵,但是好吃到爆。”
模型只有输⼊,没有“⽣成”的过程。它把整句话看完(既看到“贵”,也看到“好吃”),

综合判断出你的真实情感是:“正向(好评)”。

  • 代表模型:BERT。常⽤于⽂本分类、命名实体识别(如提取简历中的“姓名、学校”)。

b.仅解码器 (Decoder-only) —— “天才续写家”

  • 核⼼能⼒:单向预测。它只看得⻅“之前”写过的内容,看不⻅“未来”的词。它的⼯作就是根据上⽂,⼀个字⼀个字地“接⻰”往下编,直到编完。
  • 通俗案例:你雇了⼀个帮你“写周报”的AI助⼿。

你输⼊开头:“本周主要完成了项⽬A的测试,发现了⼀个Bug……”
模型是⾃回归⽣成。它只能看着你给的提⽰词,然后预测下⼀个最可能出现的字(“并”),
再预测下⼀个字(“且”),⼀路推演下去,最终产出⼀篇完整的、你从未⻅过的新周报。

  • 代表模型:GPT 系列。常⽤于聊天机器⼈(ChatGPT)、写代码、写邮件。

c.编码器-解码器 (Enc-Dec) —— “⾼级同声传译”

  • 核⼼能⼒:信息转换。输⼊和输出的序列⻓度或语⾔完全不同。编码器负责“读完”并压缩原始信息,解码器负责把这个压缩包“解压”成另⼀种形式的输出。
  • 通俗案例:把⼀篇中⽂新闻“翻译”成英⽂。

编码器(读):把整段中⽂语法和语义吃透,压缩成⼀个“中间语义向量”。
解码器(写):拿着这个向量,像写英⽂作⽂⼀样,⼀个词⼀个词地⽣成对应的英⽂句⼦。输⼊是中⽂(3个字),输出是英⽂(10个字⺟)。

  • 代表模型:T5、BART。常⽤于机器翻译、⽂本摘要(把⻓⽂章读进去,输出短摘要)。

注意:从技术⼴义上讲,BERT 是 LLM;但在⽬前的⾏业语境下,⼤家聊的“LLM”通常特指以GPT 为代表的⽣成式模型。


3.⼈⼯智能、机器学习、深度学习、⽣成式AI和⼤语⾔模型的关系

⼈⼯智能全景图如下所示

问题:⽣成式⼈⼯智能与⼤语⾔模型是啥关系?

答案: ⽣成式AI指的是能够⽣成新数据(如图像、⽂本等)的⼈⼯智能,其应⽤不仅限于⽂本⽣成,还包括其他媒体形式。⼤语⾔模型则指处理海量⽂本数据、具备深度理解与⽣成⽂本能⼒的模型。不过,并⾮所有⼤语⾔模型都擅⻓⽂本⽣成,有些更侧重于⽂本理解和分析。例如,BERT模型作为典型的⼤语⾔模型,擅⻓把握上下⽂语义,因此被⼴泛应⽤于搜索、情感分析和⽂本分类等任务,但在⽣成连贯⻓⽂本⽅⾯表现不佳。


三.主流的人工智能大模型

1.国内外大模型

下⾯是当前国内外最主流的模型阵营梳理:

国内大模型(7家)

公司模型核心特点地址
深度求索DeepSeek性价比高,推理强官网 / 聊天 / API
阿里通义千问Qwen开源与闭源并行,企业服务优势明显官网&聊天 / API
月之暗面Kimi超长文本处理官网&聊天 / API
智谱AIGLM适配国产算力,性价比高,代码能力强官网 / 聊天 / API
字节跳动豆包多模态出色,文案能力强官网&聊天 / API
稀宇科技MiniMax情感陪伴与极速语音交互强官网 / API
百度文心一言中文理解能力突出官网&聊天 / API

海外大模型(4家)

公司模型核心特点地址
GoogleGemini原生大模型架构,超长上下文官网&聊天
AnthropicClaude编程能力强官网 / 聊天 / API
OpenAIGPT深度推理、复杂编程、专业办公、电脑自动化操控官网 / 聊天 / API
MetaLlama开源/开放框架标杆API

按使用场景推荐

场景推荐模型理由
日常对话/中文理解文心一言、豆包中文语料积累深,文案/多模态强
复杂推理/编程DeepSeek、GPT、Claude推理链条长,代码生成质量高
超长文档处理Kimi长文本是看家本领
企业级/国产算力通义千问、GLM阿里云生态 + 国产芯片适配
情感陪伴/语音MiniMax语音交互和情绪响应快
开源研究Llama、通义千问开源生态,可本地部署

2.DeepSeek

简介
官⽹:

聊天⼊⼝:DeepSeek

API ⼊⼝:DeepSeek

基本介绍:

DeepSeek是由中国公司“杭州深度求索⼈⼯智能基础技术研究有限公司”推出的AI助⼿,于2025年1
⽉15⽇正式上线。它的特点如下:

  • 模型开源:与ChatGPT等“闭源”模型不同,DeepSeek将其模型代码和权重向全球免费开放
  • 极致性价⽐,性能卓越:其模型训练成本远低于⾏业巨头。例如,DeepSeek-V3的训练成本约560万美元,⽽DeepSeek-R1的成本约为600万美元,仅为同类顶级模型训练成本的⼏⼗分之⼀,可以⼀次性处理像《三体》三部曲那么⼤体量的内容;以DeepSeek-V4为例,其API调⽤成本⽐GPT-5.4和Claude Opus 4.6便宜约50倍
  • 联⽹搜索功能:⽀持联⽹检索知识,汇总后输出
  • 国产算⼒适配:DeepSeek-V4从设计之初就深度适配华为昇腾等国产芯⽚,打破了英伟达算⼒⽣态的垄断
  • 普通⽤⼾完全免费:⽆使⽤限制

基本使用

操作步骤

1. 进⼊官⽹,可以看到DeepSeek分为对话和API两个产品系列,对话是可以直接聊天,开放平台让我们可以通过API直接调⽤


2. 点击开始对话我们登录,登录后可以和模型进⾏对话


3. 点击左上⻆的开启新对话我们可以和DeepSeek进⾏对话


4. 然后我们可以和DeepSeek进⾏聊天来进⾏⽂章写作、数学推理和写邮件等各种⽂字⽣成类业务

这种聊天框⽅式的产品已经随处可⻅,业界命名这种产品为Chatbot(聊天机器⼈)。


深度思考

我们选中深度思考模式下对应的⽣成结果,这种往往适合逻辑推理,先思考以后再进⾏回答,⽽不
只是直接就进⾏推理。我们可以看到Deepseek模型在回答的时候这⾥是有⼀个脑内⼩剧场的。


智能搜索

⼤模型的知识在模型训练完成后就固定了,但是他没有办法知道外部新的的知识或者事情,⽐如西
安的天⽓,现在的时间,这些需要通过联⽹搜索来解决,⾄于具体原理可以关注下⼯具部分的讲
解。


文档、图片识别

DeepSeek⽀持输⼊复杂的图⽚,经过ocr相关的识别后再⽣产对应的思考和输出,这样对于⼀些
复杂的难输⼊的数学公式⽐较友好。⽐如我们可以把下图粘贴过去,问下证明过程。

图片信息


输入信息


输出结果信息

可以看到完整的证明过程,如果证明过程的哪个部分不理解我们可以继续追问,直到所有的点都搞清楚了,这个对于复杂的论⽂、数学公式推理有极⼤的帮助。


识图模式

1. 我们选择识图模式,识图模式可以识别图⽚的内容,我们以⼀只狗为例


2. 可以看到开始思考


3. 输出结果


API使用

API ⽅式使⽤ DeepSeek,简单来说,就是通过编写代码来调⽤ DeepSeek ⼤模型的能⼒,⽽不是打开⽹⻚对话框⼿动输⼊。

操作步骤

1. ⾸先我们熟悉个⼯具Cherry Studio

https://bitejiuyeke.feishu.cn/wiki/GPNAwQtmciEV8zk7i5KcOhLKnofhttps://bitejiuyeke.feishu.cn/wiki/GPNAwQtmciEV8zk7i5KcOhLKnofhttps://bitejiuyeke.feishu.cn/wiki/GPNAwQtmciEV8zk7i5KcOhLKnof

2. 注册、登录DeepSeek的开放平台DeepSeek


3. 充值


4. 创建API Key


5. 我们找到模型服务,配置下秘钥


6. 之后就可以和⽹⻚⼀样和Deepseek进⾏聊天了


⽹⻚和API⽅式使⽤的有什么区别呢?
下⾯是两种⽅式的流程:

⽹⻚⽅式使⽤


API⽅式使⽤


两种⽅式对⽐

具体如何通过代码API调⽤⼤模型在我们后⾯的langchain⾥⾯有更加详细的讲解。上⾯这些使⽤⽅式是⽬前⼤模型常⻅的使⽤姿势。


3.通义千问(QWen)

简介
官⽹

聊天⼊⼝:千问-阿里 AI 助手

Qwen Studio

API⼊⼝:大模型服务平台百炼控制台

基本介绍:通义千问是由阿⾥巴巴通义实验室⾃主研发的超⼤规模语⾔模型系列,具备⾃然语⾔理
解、⽂本⽣成、视觉与⾳频理解及 AI Agent 互动等全⽅位能⼒,旗下拥有 Qwen3-Max、Qwen-Plus等多款模型,⽤⼾可通过通义千问官⽹体验相关服务。


千问的特点如下:

  1. 全球领先的开源生态:阿里已开源400余个模型,覆盖不同尺寸及全模态,为开发者提供了极大的定制化潜力和广泛支持。

  2. 原生多模态融合:从Qwen3.5系列开始,模型实现了从纯文本到原生多模态的代际跃迁。

  3. 强大的编程能力:Qwen3.7-Max在多项权威编程基准测试中刷新纪录,在大模型厂商中多项刷新全球最高分。

  4. 智能体(Agent)能力:模型可以作为一个“超级智能体”,自主规划、分解并执行复杂的、长周期的任务。例如,Qwen3.7-Max曾展示过在全新的芯片平台上,通过自主编程和超1000次工具调用,完成了长达35小时的复杂任务。

  5. 多语言与全球化支持:模型的多语言能力持续增强,从Qwen3支持119种语言,到Qwen3.5已扩展至支持201种语言和方言。


基本使用

1. 登录https://www.qianwen.com/,可以看到基本聊天窗⼝


2. 同样⽀持基本问答、深度思考,⽽且已经默认联⽹了。


图⽚⽣成和处理

千问可以⽣成图⽚和处理图⽚

  • ⾼质量⽂⽣图:⽀持⽣成原⽣2K超⾼清、真实质感细腻的图⽚,涵盖写实、⽔墨、⼿绘等多种艺术⻛格。
  • 智能图像编辑:⽀持对图⽚进⾏局部修改、物体增删、换背景、改变⼈物动作姿态以及⻛格迁移等指令编辑。
  • 多图融合与创作:⽀持同时输⼊多张图⽚进⾏合成,轻松实现多图融合、双⼈AI合影、九宫格多⼿势⾃拍等创意编辑。
  • ⽣图编辑⼆合⼀:采⽤统⼀架构,⽆需切换模型即可在同⼀对话中完成从⽣成到修改的⽆缝衔接。精准的内容识别与描述:你可以发给我任何照⽚或截图,我能快速识别图中的⼈物、物品、场景或动物,并为你⽣成详细、准确的⽂字描述。
  • 智能的图⽂多模态理解:我可以结合图⽚和你的提问进⾏综合分析。例如,我能精准提取图⽚中的⽂字(OCR)、看懂复杂的图表和报表数据,或是理解海报、漫画等复杂图⽂信息。

图像⽣成

我们⽣成⼀个端午节的海报


图像编辑

还可以把图⽚编辑⼀下


图像理解

我们可以问下图⽚⾥⾯有什么


图像融合

我们可以把2副图融合到⼀起

可以看到我们可以随意找模特来试⾐服了。


AI⽣视频

千问⽀持⽣成模型,底层由HappyHorse 模型⽀持。
HappyHorse主要提供以下四种视频⽣成与编辑能⼒:

  • ⽂⽣视频 (Text-to-Video):根据输⼊的⽂本描述,直接⽣成对应的视频内容。
  • 图⽣视频 (Image-to-Video):基于⽤⼾提供的⼀张⾸帧图⽚,结合⽂本引导,⽣成连贯的视频。
  • 参考⽣视频 (Reference-to-Video):⽀持传⼊多张参考图像,通过⽂本描述,将图像中的主体⻆⾊融合⽣成⼀段流畅的视频。
  • 视频编辑:⽀持对已有视频进⾏⻛格转换、局部替换等⼆次创作


任务助理

”任务助理”是千问的“超级执⾏模式”。它不仅仅是⼀个对话框,更像是⼀个全能管家。它的核⼼
能⼒在于“拆解”和“执⾏”:

1.多步骤规划(像⼈⼀样思考):
你给它⼀个复杂的⽬标,它会⾃动思考第⼀步做什么、第⼆步做什么。⽐如“我要去旅游”,它会⾃动拆解为:查攻略 -> 订机票 -> 订酒店 -> 规划路线。
2. 跨应⽤/跨平台执⾏(⻓出了⼿脚):
这是它最厉害的地⽅。它深度打通了阿⾥⽣态(淘宝、⻜猪、⾼德、⽀付宝等)。它不仅能陪你聊天,还能帮你下单买东西、打电话订餐厅、处理⼏⼗个⽂件。
3. 批量⽂件处理(超级⽣产⼒):
在办公场景下,它可以⼀次性处理多达 100个⽂件(Web端),进⾏数据提取、汇总和分析,这是普通对话模式难以做到的。

我们来看看从北京去西安旅游,千问能帮我们完成什么吧?

第⼀次询问:


补充信息,开始⽣成规划

可以看到⽣成的报告⾮常详细,包含了住宿、⾏程规划、交通信息等详细内容,是⼀个极其强悍的旅游助⼿。


深度研究

这是⼀个专⻔处理复杂、⻓耗时任务的智能体。它不仅仅是搜索信息,⽽是像⼈类研究员⼀样,能够⾃主规划搜索路径、阅读⼤量⽹⻚、筛选信息,最后整合成⼀份结构严谨的深度报告。它能帮你完成以往需要数⼩时的研究⼯作,现在只需⼗⼏分钟。

适⽤场景: ⾏业调研、竞品分析、学术⽂献梳理、复杂新闻事件背景调查。

我们让千问⽣成⼀个⽆⼈机发展趋势研究报告

主题发给千问后,经过⼀段时间的运⾏可以⽣成对应的趋势报告。下图是我截取的部分报告。


代码

千问在编程领域⾮常强⼤,特别是推出了Qwen Code智能体,⽀持终端命令⾏交互。它不仅能写代码⽚段,还能理解整个项⽬上下⽂,进⾏Debug、代码优化、甚⾄构建完整的功能模块。
我们可以⼀句话让千问⽣成⼀个贪吃蛇游戏


PPT

这是千问的⼀⼤亮点功能,⽀持“⼀句话⽣成PPT”。你可以直接输⼊主题,或者上传⽂档
(Word/PDF)、思维导图,它就能⾃动⽣成包含⼤纲、内容和排版的PPT⽂件,⽀持下载编辑。我们可以输⼊主体让千问⽣成PPT,并且可以编辑PPT


写作

这是⼀个能够根据你的需求,快速⽣成⻓篇、结构化⽂案的⼯具。它内置了多种模板(如公⽂、论
⽂、合同、⼩说等),不仅能⽣成内容,还能⾃动排版。
我们让千问写⼀篇⼩说,可以看到它⾃⾏脑补了“系统”,⽽且⼩说的对话还是极其流畅的。


录⾳纪要

我们可以使⽤录⾳记录会议内容,之后⾃动通过⼤模型转换为会议纪要。


API使⽤

官⽹:千问大模型_AI大模型_一站式大模型推理和部署服务-阿里云

使⽤步骤:

1. 进⼊官⽹,完成注册


2. 进⼊体验或者控制台,可以看到平台是阿⾥云百炼平台,阿⾥云百炼是企业级⼤模型服务与应⽤开发平台,通义千问是其核⼼⽀持的基础⼤模型之⼀。简单来说,百炼是“⽤模型的平台”,⽽通义
千问是“被使⽤的模型” 。


3. 阿⾥云百炼主要提供API⽅式使⽤,⾯向企业,提供了简易的体验聊天能⼒


4. API⽅式同样是⾸先获取到对应的APIkey


5. 最后有对应的参考demo,通过编码完成调⽤


6. 模型的使⽤情况有统计信息可以⼀览


7. 可以看到千问只是⽂本、视频、语⾳等各种形式的模型


8. 同样我们可以使⽤Cherry Studio来完成API的对接


4.ChatGPT

注意:这个属于海外的大模型,需要梯子,这个大家自行寻找

简介
官⽹
聊天服务⼊⼝https://chatgpt.com/

API 服务⼊⼝https://platform.openai.com/

基本介绍:

ChatGPT 是由 OpenAI 开发的⼈⼯智能对话助⼿,基于⼤型语⾔模型(LLM,Large Language
Model)技术构建,能够理解⾃然语⾔并⽣成类似⼈类的回复。主要有以下特点

综合能⼒均衡 —— 在推理、编程、创作、分析、视觉理解等⽅⾯整体表现突出,适⽤于个⼈和企业级应⽤。
代码能⼒优秀 —— ⽀持多种编程语⾔,可⽣成、调试、重构和优化代码。

https://openai.com/zh-Hans-CN/index/introducing-gpt-5/
多模态能⼒ —— 能同时理解⽂本、图⽚、⽂档、表格等多种内容。
图像⽣成与编辑 —— 可⽣成⾼质量图⽚、流程图、科研插图,并⽀持图⽚修改。
推理能⼒强 —— 擅⻓复杂逻辑分析、多步骤推理和问题拆解。
Agent 原⽣⽀持 —— 擅⻓任务规划、⼯具调⽤和多 Agent 协作流程。

交互体验⾃然 —— 上下⽂理解更准确,多轮对话衔接流畅,回答更加连贯。


基本使⽤

基本聊天同样⽀持,简单聊天、深度思考、⽹⻚搜索和图⽚识别。

1. 登录https://chatgpt.com/


2. 可以看到有个对话框,同样我们可以和chatgpt进⾏聊天


3. 同样⽀持深度思考和⽹⻚检索

a. 深度思考


b. ⽹⻚检索


图⽚⽣成

a.常⻅图像

chatgpt⽀持输⼊直接⽣成图⽚


b.科研图⽚⽣成

  • ⼼脏解剖图
⽣成⼀张⾼清晰度的⼼脏解剖学⽰意图,展⽰其内部和外部主要结构。视⻆为正前⽅,部分剖⾯图显⽰
四个腔室(左⼼房、右⼼房、左⼼室、右⼼室)。清晰标注⼆尖瓣、三尖瓣、主动脉瓣、肺动脉瓣,以
及主要的出⼊⾎管(主动脉、肺动脉、上腔静脉、下腔静脉、肺静脉)。使⽤红蓝配⾊区分含氧⾎和脱
氧⾎。背景为纯⽩⾊,⽮量图⻛格,线条⼲净,适合学术出版。不要写实照⽚的阴影,不要背景纹理。


  • 细胞⾃噬的分⼦机制
创建⼀张清晰的科研论⽂流程图,主题是[例如:细胞⾃噬的分⼦机制]。采⽤极简主义⽮量插画⻛格,
使⽤[例如:蓝、⽩、灰]的专业配⾊。包含扁平化的⼏何图形、清晰的箭头指向,带有微⼩的阴影效果
以增加层次感,⽩⾊背景,宽屏⽐例(16:9),⾼分辨率。


c.架构图/系统框架图

⽣成⼀张电商购物系统架构图。采⽤清晰的左中右结构,使⽤极低⾊彩饱和度的矩形衬底作为功能分
区。线条需横平竖直,绝对不能穿透任何⽂本框。现代科技感配⾊,扁平化设计,⽀持⾼精度学术排
版。


图像编辑

对图片进行修改、美化或修复,比如裁剪、调色、去水印、加滤镜、修瑕疵等,目的是让图片变得更好看或符合需求。


图像融合

把两张或多张图片合在一起,合成一张新图片,比如换脸、换背景、风格迁移、全景拼接等,目的是创造出一张原本不存在的合成图。


编程能⼒

在 ChatGPT 可以直接编写代码,并且运⾏预览。

案例:

用户: 帮我画⼀个冒泡排序的动画程序,使⽤html,js,css来完成
ChatGPT 会⽣成可视化代码或图像,你可以直接运行。

冒泡排序动画⽣成后,我们可以点击进⾏观看(这里我选择了动画的截屏)


深度研究

指⽤ ChatGPT 可以输⼊⼀个主体,然后由chatgpt⾃⼰做深⼊分析、整理资料、⽣成报告或论⽂型内容。
案例:
用户: 分析⼀下新能源汽⻋在中国的发展趋势

经过漫⻓的⼀段时间等待以后,⼀份专业的调研报告就⽣成了。


研究与学习

但现阶段升级后已经去掉这个

研究与学习的模式,可以拆解问题、反问理解、出题进⾏考你,可以把想象为⼀个能⼒强⼤的助教⽼师。

1. 主动访问引导师。

⽐如我们输⼊下⾯的提示词:

我想要⾼考英语150分

然后可以给你出计划


2. 出题考试

我们可以⽤这个模式出题以后,如果不会会有详细的解释。


API使⽤

1. 登录和注册https://platform.openai.com/login


2. 充值,需要在这⾥添加海外的信⽤卡后才可以使⽤


3.配置API key


4. 编写代码完成调⽤或者使⽤⽀持API key配置的应⽤进⾏使⽤,下⾯的链接提供了不同语⾔丰富的代码样例可以完成对应的调⽤。

https://developers.openai.com/api/docs/guides/text


5.Gemini

简介
官⽹

Gemini 同样主要有两个官⽅⼊⼝,分别⾯向普通⽤⼾和开发者

⾯向⼤众⽤⼾的交互式 AI 助⼿普通聊天⽹站(Gemini ⽹⻚版):https://gemini.google.com/

⾯向开发者,将 Gemini 模型集成到⾃⼰的应⽤程序、脚本或服务中的平台的API ⽹站:https://aistudio.google.com/


基本介绍

Gemini 是由 Google DeepMind 开发的下⼀代原⽣多模态⼤模型家族。与传统“先训练⽂本,再外挂视觉/⾳频组件”的拼接式模型不同,Gemini 从底层架构设计之初,就将⽂本、图像、⾳频、视频和代码等不同模态的数据融合在⼀起进⾏联合训练。这种原⽣多模态(Native Multimodal)设计,赋予了它极强的跨模态理解与深度推理能⼒。

核⼼特点如下:

  1. 原⽣多模态:Gemini采⽤了“早期融合(Early Fusion)”策略。它在预训练阶段就将不同模态的数据(如图像的像素块、视频帧、⾳频频谱、⽂本等)统⼀转化为“令牌(Token)”序列,并在共享的潜在空间中进⾏处理。这使得模型能建⽴跨模态的深层理解,⽽不是简单拼接。
  2. 庞⼤的上下⽂窗⼝:Gemini 拥有领先的超⻓上下⽂处理能⼒,标配版本通常⽀持 100 万个 Token 的上下⽂,部分版本甚⾄能处理更多。意味着它⼀次性可以“吃下”数万⾏代码、数百⻚的复杂技术⽂档、或者是数⼩时的⾳频,并且可以在这些庞⼤的信息中进⾏精准的推理和检索。
  3. 顶尖的代码与智能体(Agent)能⼒:编程和智能体能⼒是Gemini当前的突出⻓板。Gemini 3.5 Flash被⾕歌定义为“结合前沿智能与⾏动能⼒”的新⼀代模型,是其⽬前综合实⼒最强的智能体模型与代码模型。它在处理复杂⻓周期任务、代码⽣成等⽅⾯均有显著提升
  4. 卓越的智商与深度推理:Gemini 在⾼难度逻辑推理与专业标准化考试中表现出了极强的统治⼒,成功跨越了“记忆型 AI”到“通⽤逻辑型 AI”的鸿沟。在独⽴评测机构(如 Tracking AI)使⽤由⻔萨(Mensa)成员设计、且完全未在互联⽹上公开的全新图形矩阵与空间逻辑离线谜题盲测中,Gemini顶尖型号(如 Gemini 3.1 Pro)的智商估值稳定达到了 130 ~ 131 分段。这意味着它已经跨过了“天才线”,在纯逻辑、⾮记忆性的空间与⼏何推理中达到了⼈类前 2% 的⾼智商⼈群⽔平。GPQA
  5. Diamond(博⼠级硬核科学推理): 该测试由各领域的专家博⼠联合出题(⾮本专业博⼠盲测准确率也仅在 65% 左右),Gemini 在该项测试中拿到了 94.3% 的极⾼分数,具备了严谨的⾼等科学逻辑。这是⼀个汇集了⾏业最新评测的第三⽅⼤模型基准排⾏榜,其中收录并对⽐了包括 Gemini 在内的全球主流顶尖模型在 GPQA Diamond、MMLU-Pro 等研究⽣及博⼠级硬核推理测试中的真实得分和排名对⽐LLM Leaderboard.

基本使⽤

1. 登录https://gemini.google.com/app,同样我们可以看到聊天信息框


2. 同样⽀持基本聊天、深度思考、⽣成图⽚、图⽚识别,这些功能操作类似的我们不再重复演⽰

a. 基本聊天


b. 深度思考


c. ⽣成图⽚


d. 图⽚识别


⽣成⾳乐

Gemini⽀持⽣成⾳乐,旋律的契合度和主题还是很⾼的。


Deep Research

我们查看下研究过程:


学习模式

Guided Learning(引导式学习模式) 并不是直接把死板的答案或⼀整⻚教科书直接丢给你,⽽是像⼀位经验丰富的私教⼀样,通过交互式、拆解式的⽅法,带你⼀步步攻克知识难点。

根据指令一层一层的往下学习。


API使⽤

Gemini 同样提供了丰富的API来调⽤Gemini模型。

1. 进⼊Google AI Studio,https://aistudio.google.com/prompts/new_chat


2. 创建API Key


3. 使⽤代码或者使⽤应⽤程序接⼊ https://ai.google.dev/gemini-api/docs/quickstart?hl=zh-cn


综合以上的四种大模型的API调用方法如下图所示:

Cherry Studio 是个聊天/调用AI的客户端工具,它本身不带模型,需要你填 API Key 才能用。

但国内直接调海外模型(比如 Gemini)不方便,所以中间加个 “中转站” ——你先把API请求发给中转地址,它再帮你转给真正的模型服务商。

所以这条链路是:

Cherry Studio --> 中转站API地址 --> 海外模型(如Gemini)

或者国内模型(如DeepSeek)也可以走这个中转,看你配置。


四大模型简单小结:

国内军团——接地气与性价比之战

模型标签/定位
DeepSeek系列数学课代表,收费还便宜
通义千问Qwen大厂出来的“全能后勤”
Kimi过目不忘
GLM国产的“硬核攻城狮”
豆包真人聊天
MiniMax情感陪护专员
文心一言中文通

海外巨头——技术信仰与生态壁垒

模型标签/定位
Gemini“六边形战士”
Claude硅谷金牌程序员
GPT全能学霸
Llama社区老大哥

选择思路(三维度)

  • 看场景——你要解决什么问题?

  • 看成本——预算多少?API贵不贵?

  • 看生态——社区支持、文档、工具链是否完善?


当前主流大模型已不再是“通用聊天机器人”,而是向垂直能力深度发展

应用场景列举

聊天、图片生成和处理、音乐生成、语音摘要、真人聊天、视频生成、任务助理、PPT制作、编程、翻译、深度研究、学习模式、API使用


各模型定位速查

模型定位
DeepSeek强在逻辑推理
通义千问(Qwen)定位全模态创作平台
ChatGPT科研与编程助手
Gemini多模态创新先锋

最终结论

没有“最强模型”,只有“最合适场景”。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐