Agent技术------大模型(LLM)
生活中常见的豆包,deepseek,chatgtp等的核心都是大模型,LLM(Large Language Model),作为Agent开发人,我们不需要知道它的底层数学原理,但对于它的产生过程和特点还是需要懂的。
这里我推荐一个视频可以帮助不怎么懂的人有效了解大模型的产生过程。我个人看完之后觉得整个人醍醐灌顶。
产生过程:
简答来说,大模型是通过学习海量知识,拥有丰富的知识库,能有逻辑地回答问题的助手。
通过上面的简短总结,也可以看出大模型的一些特点,也能解释一些问题。
特点:
Token
Token是大模型处理文本的最小单位。一个Token可能是一个字,也可能是一个词。
大模型思考时,就算是在计算一个Token后出现的下一个Token是哪一个,通常这个过程其实带有随机性,因为大模型计算得到是当前Toke出现的下一个Token的概率,会有很多个,大模型会根据算法选择一个,但同样的情况,下一次的选择可能是不一样的,这也是为什么同一个问题,大模型的回答会不一样。
调用大模型API也是通过Token进行计费的,对话内容越多,Token消耗也越多,费用也会更高。
上下文窗口
大家应该听过或者体验过,聊着聊着,ai突然没有反应了,有点"死"了,需要打开新的对话,并且不会记得之前对话的内容。这中间就涉及到了大模型的上下文窗口。大模型的记忆是有限的,记不了太多的东西,这个存放记忆的容器就是上下文窗口。
同一个对话里你之前说过什么它会记得,新开一个对话就不记得了因为不是同一个上下文窗口了。
对于一个上下文窗口,因为Token容量有限,当达到最大值时,一般有两种处理方式。一种是不在支持对话,另一种是将最早的对话记录删除,给新对话腾地方。这也就导致大模型的记忆能力有限,Agent有一个技术RAG就是来解决这个问题。
再说一下,上下文窗口会放一些什么。包括系统提示词(System Prompt),用户和大模型的聊天记录,有的会包括一些上传文件 / 图片解析出来的文本(图片本身不进窗口,是图片转成文字放进去)等信息。
其实每次调用API的时候,大模型本身是空白的依赖传输来的历史记录才能了解的更清楚。
这个历史记录类似
伪代码
{
system prompt:"...........",
user:"..............",
ai:"..............",
user:"...........",
..........
user:"(新的问题)"
}
总结
大模型可以遵照给的人设(System Prompt)按照要求做事,能听懂用户的话,能思考做出计划,能生成用户想要的内容,比如文案,代码等。但它却不能真正动手做,比如,对大模型说帮我把某个地方的某个文件删除或者帮我给项目增加一个什么功能,解决一下报错,它会给出达到目标的方案,第一步怎么做,第二步怎么做,当具体还是需要人亲手去做。这是大模型的局限之处,而Agent的出现就是给大模型安装上手,让大模型真正地去做事情,让大脑和双手协作起来。
更多推荐



所有评论(0)