AI生成原理(大模型生成式AI)
·
文章目录
现在大家常说的AI生成(文本、图片、语音、视频),核心是 生成式大模型,基于概率预测来输出内容,并不是机器真正“理解”知识,而是学习海量数据里的模式、语言逻辑、常识、风格,按概率逐个输出片段。
一、文本大模型(ChatGPT类文字AI)
1.训练阶段
- 海量语料输入:网络文章、书籍、论文、网页等海量文本做清洗分词,把文字转成数字Token(词/子词编号)。
- Transformer架构,依靠自注意力机制:模型可以看懂上下文前后关系,知道哪几个词互相关联。
- 预训练目标:预测下一个词
拿一大段文本,遮住后面的词,让模型根据前面文字,预测下一个最可能出现的token。反复亿万次迭代,调整模型内部亿万参数,记住人类语言的规律、事实、逻辑、句式。
简单例子:输入“床前明月光,”,模型学习大量古诗后,计算概率,最大概率下一个token就是“疑”。
- 对齐微调(SFT+RLHF)
预训练只会续写文本,不一定听话。用人工标注问答数据微调,再通过人类反馈强化学习,让模型学会:服从指令、回答安全、符合人类价值观,减少乱输出。
2.推理生成阶段(你提问时发生什么)
- 你的提示词被编码成token送入模型。
- 模型一次只预测1个下token,算出候选词概率分布。
- 通过采样策略(top‑p、temperature温度参数)挑选下一个词:
- 温度低:优先选概率最高,回答保守、重复;
- 温度高:允许选概率偏低的词,创造性更强,但更容易幻觉。
- 把刚生成的token拼回上下文,再带入模型继续预测下一个,循环往复,直到输出结束标记,就得到完整回答。
二、AI绘画(Stable Diffusion类图像生成)
属于扩散模型Diffusion原理:
训练
- 训练集是大量【图片+文字描述】配对。
- 给清晰图片不断加噪声,一步步把图片变成纯噪点。模型学习任务:根据文字提示,学会把噪声还原回原图。
生成
- 先随机生成一张纯噪声图。
- 输入文字提示,文本编码器把提示词转成向量。
- 迭代去噪:几十步循环,不断去掉一部分噪声,参考文字条件约束,把噪声慢慢变成符合描述的图片。
- 输出最终图像。
三、通用核心共性
- 不是真正理解,是统计模式匹配:模型不拥有主观意识,记忆的是海量样本中的统计规律。
- 生成是自回归/迭代采样:文字一个词一个词吐;图像一步一步去噪。
- 输出受训练数据局限:训练集有什么风格、知识,模型才会输出;过时、错误数据会带来错误输出。
- 幻觉根源:当概率拼接出来一段通顺文本,但训练数据没有对应事实,就编造虚假信息。
四、简单通俗版本比喻
**文本AI:**就像看过亿万本书的超级复读生,不会真正懂道理,但极度擅长猜“接下来该写什么字最通顺合理”,一个字一个字续写整篇回答。
**AI画图:**相当于学会“擦掉噪点复原照片”的画师,给一团乱雪花,根据你的文字指令,一点点擦除噪声画出图片。
更多推荐




所有评论(0)