最近被AI Agent刷屏了,各种框架、各种概念满天飞。很多人看完还是一脸懵:Agent不就是ChatGPT套了个壳吗?

今天用人话讲清楚。

先说结论

ChatGPTAI Agent
本质对话模型自主决策系统
能力回答问题调用工具+自主规划
类比百科全书有手有脚的员工

简单说:ChatGPT是大脑,Agent是大脑+眼睛+手+脚。

一个例子说明白

场景:帮我查一下今天北京天气,然后发邮件给老板

ChatGPT的做法:

你:帮我查天气并发邮件
ChatGPT:北京今天晴,25度。建议您使用邮箱客户端发送。
(完了。它不会真的去查,也不会真的发邮件。)

Agent的做法:

Agent收到指令
  ↓
思考:需要查天气 → 调用天气API
  ↓
拿到结果:北京晴,25度
  ↓
思考:需要发邮件 → 调用邮件API
  ↓
执行:发送邮件给老板
  ↓
回复:已完成,北京今天25度,邮件已发送。

区别一目了然:Agent会用工具,会自己规划步骤。

Agent的核心组成

Agent = LLM(大脑) + Tools(工具) + Memory(记忆) + Planning(规划)

1. LLM(大脑)

就是ChatGPT、Claude这些大模型,负责理解指令、做决策。

2. Tools(工具)

Agent能调用的外部能力:

  • 搜索引擎
  • 代码执行器
  • 数据库查询
  • API调用
  • 文件读写

没有工具的Agent = 没有手的人,空有想法但做不了事。

3. Memory(记忆)

  • 短期记忆:当前对话的上下文
  • 长期记忆:历史对话、用户偏好

没有记忆的Agent = 金鱼,每次对话都从零开始。

4. Planning(规划)

Agent拿到任务后,会自己拆解步骤:

用户:帮我分析竞争对手的定价策略

Agent的思考过程:
1. 先搜索竞争对手的产品信息
2. 提取价格数据
3. 整理成表格
4. 分析定价规律
5. 给出建议

这就是Planning——不需要你一步步教,它自己知道该干什么。

一个真实案例

我用LangChain搭了一个简单的Agent,功能是:根据用户需求自动生成代码并测试

from langchain.agents import create_react_agent
from langchain.tools import Tool
from langchain.chat_models import ChatOpenAI

# 定义工具
def run_code(code):
    """执行Python代码"""
    exec(code)
    return "执行完成"

tools = [
    Tool(name="代码执行器", func=run_code, description="执行Python代码"),
]

# 创建Agent
llm = ChatOpenAI(model="gpt-4")
agent = create_react_agent(llm, tools, prompt)

# 运行
result = agent.run("写一个计算斐波那契数列第10项的函数并运行")

效果:

Agent思考:需要写代码 → 调用代码执行器
Agent思考:需要验证结果 → 再次调用执行器检查
回复:斐波那契数列第10项是55,代码已验证正确。

它自己决定写什么代码、怎么测试、什么时候停。不需要我干预。

Agent的几种类型

1. ReAct Agent(最常用)

思考 → 行动 → 观察 → 思考 → 行动 → ...

像人一样,边想边做。

2. Plan-and-Execute Agent

先规划完整步骤 → 逐步执行

适合复杂任务。

3. Multi-Agent(多智能体)

多个Agent协作,各司其职

比如:一个写代码,一个测试,一个审查。

现在能用Agent做什么?

场景示例
自动化办公自动读邮件、整理数据、生成报告
代码开发根据需求自动生成代码并测试
数据分析自动爬取数据、清洗、生成图表
客服系统自动回答用户问题、调用内部系统
个人助手管理日程、提醒事项、信息检索

下一篇预告

下一篇教你用LangChain搭一个能自动搜索+总结的Agent,10行代码,直接能跑。

如果你也在学Agent,评论区聊聊你打算用它做什么?

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐