回顾这条从 1956 年到 2026 年的演进脉络,能清晰看到四次关键跃迁:AI 学会了回答问题,这是 ChatGPT 打开的第一层门;AI 学会了完成任务,这是 2023 年 ReAct、Tool Use、AutoGPT 打开的第二层门;AI 学会了完成真实工作,这是 2024 到 2025 年 Coding Agent、Computer Use、企业软件 Agent 化打开的第三层门;

设想一个场景。你周五下午给系统发一句:把本周客户投诉整理成报告,标出三类最高频问题,给每条配一个处理建议,周一上午发给我和售后主管。

三年前,这句话会卡在"打开三个系统、复制粘贴、自己写总结"的环节里。今天,一个配置好的 Agent 会在后台自己拆任务、查工单系统、调分析工具、生成文档、按权限发给对应的人。你下班,它干活。

如果只用一句话概括过去三年 AI 领域发生的事,我会说:模型变聪明的速度,远没有 Agent 学会做事的速度惊人。

2023 年初,大部分人还把 ChatGPT 当成一个更聪明的搜索引擎。到 2026 年,已经有企业把 Agent 当作能独立完成工作的数字员工来排班。这中间到底发生了什么,很多文章只罗列了产品名字,没讲清能力是怎么一步步长出来的。

可能到现在,还有很多人为,Agent 是 2023 年才诞生的新物种。但是从斯坦福、MIT 的 Agent 理论论文库里,能翻出 1990 年代的 BDI 模型、2000 年代的强化学习框架。

这是为什么?答案很简单:Agent 不是被发明出来的,是被 LLM「激活」的。 大脑(LLM)在 2022 年才刚刚就位,但骨架(Agent 理论)已经等了快 70 年。

本文将这条演进史拆成六条并行的线索,横跨 1956 到 2026:

线索

演进路径

Academic(学术)

Agent Theory → Planning → RL → LLM → ReAct → Multi-Agent

Technology(技术)

Rules → Planning → LLM → Tool → Memory → Loop → Graph → Runtime

Product(产品)

Assistant → ChatGPT → AutoGPT → Coding Agent → Computer Agent

Engineering(工程)

Prompt → Context → Harness → Loop → Graph → Agent Engineering

Enterprise(企业)

Automation → Copilot → Agent → FDE → Digital Worker → AI Workforce

Organization(组织)

Human → Human+AI → Multi-Agent → AI Workforce → Autonomous Enterprise

这六条线不是各自平行发展,而是在每一个关键年份互相咬合、互相催化。

2022 年 Academic 线(ReAct)撞上 Technology 线(Tool),炸出了 2023 年 Product 线的 AutoGPT。

2024 年 Engineering 线开始收拢,反过来推动 Enterprise 线从 Copilot 走向真正的 Agent。

2025 到 2026 年,Organization 线开始出现「AI Workforce」这种在过去完全不存在的组织形态。

本文接下来会顺着这六条线,把 Agent 从理论构想走到「数字员工」的完整脉络讲透。这不是一篇预测未来的文章,文中内容,都是已经发生或正在发生的事实。

开篇:为什么需要重新认识 Agent?

在正式进入历史之前,得先把这个词的含义锁死。

过去三年里,Chatbot、Copilot、AutoGPT 都被叫过 Agent,但它们对人的依赖程度完全不同。

这一章先不急着讲演进,而是把「Agent 到底指什么」这个地基打牢:先区分三个时代的关系,再清掉六个最常见的误解,最后交代本文真正要回答的五个问题。

三个时代,三种关系

先做一个最基础的区分,这也是全文最重要的分歧点:

维度

Chatbot 时代

Copilot 时代

Agent 时代

交互模式

人问,AI 答

人做,AI 辅助

人定目标,AI 执行

典型产品

早期 ChatGPT

GitHub Copilot

AutoGPT、Devin、Claude Agent

核心能力

语言理解与生成

补全与建议

规划、调用工具、持续执行

出错代价

低(人负责判断)

中(人负责验收)

高(AI 直接产生行动结果)

是否需要「收工」能力

不需要

不需要

必须要

图2|三个时代,三种关系

这张表格里最关键的一格,是「Agent 时代」那一列的「人定目标,AI 执行」。这句话听起来轻描淡写,但它意味着 AI 第一次要为结果负责,而不只是为回答负责。

Chatbot 说错话,你多问一句就好了。Agent 走错了一步,它可能已经把生产数据库删了,或者把邮件发给了错误的客户列表。

这就是为什么 Agent 元年之后,行业突然涌现出一批此前不存在的工程概念:Guardrails、Verification、Rollback、Human-in-the-loop。

这些不是锦上添花的功能,而是给会做事的 AI 配的安全带。

六个常见误区

在往下讲之前,先帮大家清理一下脑子里可能装着的 2023 式旧认知:

误区一:Agent = Chatbot 加了个工具箱。 不对,工具只是「手」,没有持续循环、没有状态管理,加了工具的 Chatbot 顶多算个会查资料的助手。

误区二:Agent = Workflow(工作流)。 Workflow 是预先设计好的固定路径,Agent 的核心特征恰恰是它能在执行中动态调整路径。二者常常混用,但本质不同,后文 Part 5.5 会专门讲清楚。

误区三:Agent = Multi-Agent。 单个 Agent 完全可以独立完成复杂任务,多智能体只是一种组织形式,不是必要条件。

误区四:Agent = 一个 LLM 加一段 Prompt。 这可能是最大的误解。真正的 Agent 系统里,Prompt 只占极小的一部分,围绕它的 Context、Tool、Memory、State、Verification 才是决定成败的大头(这正是 Part 5 要讲的「工程时代」)。

误区五:Agent = 完全自主,不需要人。 现实世界里跑得最好的 Agent 系统,几乎都有明确的人类监督节点。全自主目前更多是营销叙事,不是生产级现实。

误区六:Agent 是一款独立软件。 到 2025 年之后,Agent 更像是一种能力层,渗透进 ERP、CRM、IDE 这些既有系统内部,而不是孤零零地存在。

本文要回答的五个问题

这篇文章会依次回答:

  1. Agent 到底从哪里来?(不是从 2023 年开始的)
  2. 为什么偏偏是 2023 年炸开了?(条件到底凑齐了什么)
  3. 2024 到 2026,Agent 经历了哪几次关键跃迁?
  4. 2026 年的 Agent 和 2023 年的 Agent,本质区别到底是什么?
  5. 现在正在发生的、还没被充分讨论的下一步是什么?

前面提到的 Chatbot/Copilot/Agent 三时代,恰好对应总图里 Organization 线的 Human → Human+AI 早期阶段,以及 Enterprise 线的 Automation → Copilot 起点。

记住这个坐标,后面每一章我们都会往这张图上「打点」。

Part 1|前史:Agent 不是 2023 年才诞生

要理解为什么 2023 年才「炸开」,得先承认一个事实:Agent 的理论比 LLM 早了半个多世纪。

这一章把时钟往回拨到 1950 年代,看骨架是怎么搭起来的,LLM 这块「大脑」是哪一年补上的,最后落到 ReAct 这个引爆点,以及它埋下的那行公式。

1950s–1990s:理论地基早就铺好了

如果你去查 Agent 的学术定义,会发现「Intelligent Agent」「Rational Agent」这些术语在人工智能教科书里出现的时间,比 Transformer 论文早了整整半个世纪。

Russell & Norvig 在《人工智能:一种现代方法》里给出的经典定义是:Agent 是「感知环境并采取行动以实现目标」的实体(Percept → Think → Act)。这个「感知-思考-行动」循环,正是今天 ReAct、Agent Loop 的祖先版本。

1990 年代,Michael Bratman 提出的 BDI 模型(Belief-Desire-Intention)进一步细化了 Agent 的内部结构:一个 Agent 要有信念(对世界的认知)、欲望(想要达成的状态)、意图(当下正在执行的计划)。

研究者后来将这套框架大量应用于多智能体系统研究,维基百科对 AI Agent 的历史梳理里对这条脉络有完整记录。

这个阶段的 Agent,绝大多数是基于规则(Rule-based)或经典规划算法运行的,没有语言理解能力,更谈不上「聊天」。它们活跃在机器人学、游戏 AI、专家系统里,是 Academic 线上真正的起点。

2000s–2017:Agent 走进数字世界,补上「环境反馈」

进入 2000 年代,Agent 概念从物理机器人扩展到了纯数字世界。搜索引擎的排序算法、电商的推荐系统、早期的虚拟助手(Siri、Cortana),本质上都可算作广义 Agent,它们感知用户行为(环境),做出响应(行动)。

这个阶段最关键的补丁,是强化学习(Reinforcement Learning)的成熟。DeepMind 的 AlphaGo、Atari 游戏 Agent,第一次让「Agent + Environment + Reward Feedback」这个闭环在复杂任务上跑通。

这一步的意义在于:Agent 第一次学会了从结果里学习,而不只是执行预设规则。但这个时代的 Agent 有一个致命短板,它们没有通用语言理解能力。

一个 RL Agent 精通下围棋,但你没法直接用自然语言告诉它「帮我把这个季度的报表整理一下」。缺的这块拼图,要等 Transformer 出现才能补齐。

2017–2022:LLM 给 Agent 装上「大脑」

2017 年 Transformer 架构问世,2018 到 2022 年间 GPT 系列快速迭代,到 GPT-3、InstructGPT 阶段,语言模型第一次具备了「听懂人类目标,用自然语言输出计划」的能力。

这是全文里最容易被忽略,但其实极其关键的一步:在 LLM 出现之前,Agent 有骨架(规划理论、BDI 结构、RL 循环),却没有能听懂人话的大脑。

LLM 出现之后,Agent 终于可以把 Human Language 直接转译成 Machine Goal,不再需要工程师手写规则或者训练专用的强化学习策略。

这也解释了一个常被问到的问题:为什么 Agent 理论存在了 60 多年,却要等到 2022 到 2023 年才引爆?答案很朴素,不是理论突然成熟了,是大脑刚刚就位。

2022 理论引爆:ReAct 让 LLM 边想边做,Tool Use 给它「手」

2022 年 10 月,Google Research 和普林斯顿大学联合发表了一篇后来被引用上千次的论文,《ReAct: Synergizing Reasoning and Acting in Language Models》。

ReAct 的核心洞察极其简单,但极其重要:过去让 LLM「先想清楚再回答」(Chain-of-Thought)和「直接执行动作」是两条分开的路径,ReAct 把它们缝合成一个循环,Thought(想)→ Action(做)→ Observation(观察结果)→ 再 Thought。

Google Research 官方博客是这样描述这个突破的:让语言模型在推理轨迹中交替生成「推理性文字」和「任务相关行动」,能显著提升在知识密集型任务和决策任务上的表现,同时让模型的行为更容易被人类理解和验证。

在 ReAct 之前,LLM 是个回答机器;在 ReAct 之后,它第一次变成了行动控制器。 这中间的跨度,比一句话大得多。Reasoning 没有 Action 支撑,就不算真正的 Agent,顶多是个话痨。

几乎在同一时期,Tool Use(工具调用)能力也在快速成型。Meta 提出的 Toolformer、随后各家跟进的 Function Calling / API Calling 机制,第一次让 Agent 拥有了「手」,不再局限于模型参数里存储的静态知识,而是可以主动查天气、查股价、执行代码、调用数据库。

ReAct 给了 Agent 大脑里的「思考回路」,Tool Use 给了它「手」。这两块拼图在 2022 年底基本到位,为 2023 年的全面爆发,埋下了公式的种子:

Agent = LLM + Harness

这个公式我们会在 Part 5.3 正式展开,但请读者先把它记在脑子里,2022 年 ReAct/Tool Use 的出现,正是这个公式第一次有了具体的技术抓手。

图3|ReAct:让 LLM 边想边做

Part 2|2023 爆发元年:从「会回答」到「自己做事」

理论憋了60多年,真正破圈却在 2023 年。这一年不是某一项技术突破,而是几个条件恰好在同一刻成熟。

这一章先拆开「为什么是 2023」,再用 AutoGPT、BabyAGI、MemGPT、Reflexion、AutoGen 几个代表作,还原 Agent 从「会回答」走到「自己做事」的全过程。

为什么突然爆发:三个条件同时成熟

2023 年不是 Agent 的发明年,是 Agent 的破圈年。破圈需要三个条件同时成熟,缺一不可:

第一,LLM 能力过了阈值,GPT-4 在 2023 年 3 月发布,推理能力第一次强到能支撑多步规划。第二,Tool Use 已经标准化,开发者可以低成本地给模型接入外部能力。第三,开源生态爆发式跟进,任何一个想法出现后,社区能在几天内做出可运行的实现。

这三条加起来,再叠加一条容易被忽视的因素,社交媒体的传播放大效应。一个「AI 自己给自己下达任务、自己执行」的 Demo 视频,天然比论文里的算法更容易刷屏。这一年,Agent 第一次从学术圈和极客圈,走进了大众视野。

图4|为什么偏偏是 2023 炸开?

AutoGPT:改变的是认知,不是技术

2023 年 3 月底,Toran Bruce Richards 发布了 Auto-GPT(当时叫 Entrepreneur-GPT),它的定位是「实验性开源应用,展示 GPT-4 的自主能力」:给它一个目标,它就会自己拆解任务、自己执行、自己决定下一步该做什么。

从纯技术视角看,AutoGPT 的架构并不复杂,本质上是一个包着循环逻辑的 Prompt 工程项目。

但它的意义完全不在技术难度上,而在于它是第一个让大众相信「AI 真的能自己做事」的产品。它在 GitHub 上的 Star 数在几周内冲到数万,成为 2023 年上半年最出圈的 AI 项目之一。

这里有个值得吐槽的细节:早期版本的 AutoGPT 经常陷入死循环,反复搜索同一个问题、反复失败又反复重试,甚至有用户吐槽它把 API 额度全部烧在了无意义的自我对话上。

这正暴露了会规划和能稳定完成任务之间,隔着一条巨大的工程鸿沟。这条鸿沟,后来花了整整三年才被逐步填平,也是本文后半段的主线。

BabyAGI:任务循环第一次成型

几乎同一时间(2023 年 3 月),Yohei Nakajima 发布了 BabyAGI,思路更加极简:给定一个目标(Objective),系统会不断执行「创建任务 → 排序任务 → 执行任务 → 根据结果生成新任务」的循环。

官方仓库形容它是「任务驱动自主 Agent 的精简版」,核心代码只有一百多行。

BabyAGI 的意义在于把「Task Loop」这个结构第一次剥离出来,变成一个独立、可复用的架构模式。Agent 从「一次性回答问题」,正式走向了「任务驱动的持续循环」。

Memory:Agent 开始拥有「过去」

2023 年 10 月,加州大学伯克利分校团队发表了 MemGPT: Towards LLMs as Operating Systems。

这篇论文的核心比喻非常巧妙:把 LLM 有限的上下文窗口,类比成计算机的物理内存,用「虚拟内存管理」的思路,在快速内存(当前上下文)和慢速内存(外部存储)之间动态调度信息。

在 MemGPT 之前,Agent 每次对话都是「失忆」的,一旦超出上下文窗口,之前的信息就彻底丢失。MemGPT 让 Agent 第一次有了跨会话记忆,它可以「记得」三天前和你的对话,可以在长文档分析中记住之前分析过的部分。

这是 Agent 从 Context 走向 Memory 的关键一步:Context 是这一轮对话装了什么,Memory 是这个 Agent 到底经历了什么。

Reflection:Agent 开始「复盘」

同月,Reflexion: Language Agents with Verbal Reinforcement Learning 论文提出了另一个关键补丁:让 Agent 通过语言反思来学习,而不需要更新模型权重。

它的循环是:Act(执行)→ Evaluate(评估结果)→ Self-Reflect(生成语言化的反思)→ Retry(带着反思重新尝试)。

论文里一个很直观的数据:在 HumanEval 代码生成基准上,Reflexion 达到了 91% 的 pass@1 准确率,超过了当时 GPT-4 的 80%;在 AlfWorld 决策任务基准上,配合 ReAct 使用,Reflexion 让 Agent 在 12 次自主尝试内达到了 97% 的任务成功率(arXiv:2303.11366)。

这个数据的意义在于:Agent 不需要重新训练,仅靠「写下自己的失败原因」,就能显著提升下一次尝试的成功率。这是一种极其廉价但极其有效的自我修正机制。

Multi-Agent:从单兵到团队

2023 年下半年,微软研究院开源了 AutoGen 框架,聚焦于让多个具备不同角色的 Agent 通过对话协作完成任务,Planner 负责拆解任务、Coder 负责写代码、Critic 负责审查、Executor 负责运行验证。

这类「群聊式」多智能体协作模式,第一次把 Supervisor / Planner / Worker / Reviewer 这些组织学概念,搬进了 Agent 系统设计。

如果用一句话总结 2023 年,我会说:这一年,Agent 学会了自己做事情

它不是技术上第一次成熟(前史部分已经证明理论早就在了),而是第一次让「AI 能自主完成多步任务」这件事,从学术论文和极客社区,变成了整个行业和大众都在讨论的话题。

回到总图坐标:本章讲到的 AutoGPT 对应 Product 线的 AutoGPT 节点,Memory/Loop 对应 Technology 线从 Tool→Memory→Loop 的跃迁,Multi-Agent 对应 Academic 线的分支延伸。

2023 年这一年,六条线里有四条同时冒出了新节点,这也是为什么它值得被单独称为「元年」。

Demo 再炸,也不等于能在生产里用。下一章我们就看 2024 年行业怎么把 Agent 从炫技视频,变成真能干活的数字工作者。

Part 3|2024 真实工作:从 Demo 到数字工作者

2023 年的 Demo 很炸,生产环境却很脆。进入 2024,行业心态从「能不能做」转向「能不能稳定做」。

这一章看几件标志性的事:Agent Engineering 这个工种的出现,LangGraph 把执行变成状态图,SWE-agent 攻下软件工程主战场,以及 Computer Use 和 Research Agent 把 Agent 带进更真实的工作现场。

Agent Engineering 出现:从「怎么做」到「怎么稳定做」

2023 年留下的最大问题是:Demo 很炸裂,生产环境很脆弱。AutoGPT 式的开放式循环容易发散、容易死循环、容易把预算烧在无意义的探索上。

2024 年,行业的关注点开始从「能不能做」转向「能不能稳定做」。Runtime、State 管理、Retry 机制、Observability(可观测性)、Evaluation(评估体系)这些此前只在传统软件工程里出现的概念,大量进入了 Agent 设计。

这一年,一个新词开始在从业者圈子里流行:Agent Engineering。它专指围绕 Agent 系统的稳定性、可控性、可维护性的工程实践,而不再只是写个好 Prompt。

LangGraph:从链式执行到状态图

2024 年初,LangChain 团队推出 LangGraph,标志着 Agent 编排方式的一次结构性转变:从早期的 Chain(线性链式调用),到 Workflow(带条件分支的工作流),再到 StateGraph(显式状态图)。

LangGraph 的设计哲学很直接:每一次执行都是一个显式的图(Nodes 做计算,Edges 控制流向),状态在节点间流转并持久化,可以在任意节点暂停、恢复、重放。

LangChain 官方产品页强调,这套设计支持单 Agent、多 Agent、层级式架构的灵活切换,并且不会给应用引入额外的性能开销。

这一步的意义在于:Agent 的执行方式,从「一条道走到底的线性逻辑」,变成了「可以分叉、可以并行、可以回溯的结构化图」。这也为后面 Part 5.5 要讲的 Graph Engineering,提前铺好了轨道。

SWE-agent:Agent 打入软件工程主战场

2024 年 4 月,普林斯顿大学团队发布 SWE-agent,专门针对真实 GitHub Issue 的自动修复任务设计,循环结构是 Understand(理解问题)→ Edit(修改代码)→ Test(运行测试)→ Debug(调试)→ Retry(重试)。

Coding 之所以成为 Agent 最早跑通、也最快产业化的战场,有几个天然优势:任务边界清晰(有明确的成功标准,测试通过)、反馈信号即时(代码能不能跑,几秒钟就知道)、执行环境本身就是数字化的(不需要跨越物理世界)。

这三个条件叠加,让 Coding Agent 成为整个行业验证「Agent 能不能真的干活」的第一个标准答案。

Computer Use:Agent 第一次拥有「电脑」

2024 年,Anthropic 推出 Claude 的 Computer Use 能力,让模型能够直接观察屏幕截图、控制鼠标和键盘,像人类一样操作图形界面。

这一步的边界意义远大于工具本身:在此之前,Agent 只能通过 API 世界行动,你必须先给它接口,它才能做事;有了 Computer Use 之后,Agent 可以直接进入整个数字世界,操作任何一个原本只为人类设计的软件界面。

这意味着,无数没有开放 API、只有图形界面的 Legacy 系统(老旧 ERP、内部管理后台、行业专用软件),第一次有了被 Agent 接管的可能性,不再需要企业先做一遍痛苦的 API 改造。

Research Agent:端到端知识工作初现

同一年,一批以「深度研究」为定位的 Agent 产品陆续出现,任务链路从 Research(检索)→ Analysis(分析)→ Synthesis(综合)→ Writing(写作)→ Review(审查),第一次实现端到端。

这类产品把 Agent 的应用场景,从单一任务(查一个天气、订一张票),扩展到了知识密集型的复合工作。

用一句话总结这一年:Agent 从「AI Demo」变成了「数字工作者」。它开始出现在真实的代码仓库、真实的研究报告、真实的业务流程里,不再只是发布会上的一段炫技视频。

从 Demo 到数字工作者,这一步迈出去之后,下一章看 2025 年 Agent 怎么从单点应用,长成一套平台能力。

Part 4|2025 平台化:从新软件到软件的新执行层

单点 Agent 跑通之后,下一步必然是平台化。2025 年的主题,是 Agent 从「手搓一个循环」变成「在平台之上组装能力」。

这一章讲三条线索:MCP 和 A2A 把连接标准化,Computer Use 成为产业主战场,以及垂直领域 Agent 爆发、企业软件开始 Agent 化。

Agent Platform:从应用到平台能力

2025 年,一个明显信号是:Agent 不再只是「某个团队做出来的一个应用」,而是变成了一整套平台能力,SDK、Runtime、Tracing(执行追踪)、Guardrails(护栏机制)、Eval(评估体系)、Tool Management(工具管理),各家云厂商和模型厂商纷纷推出自己的 Agent 平台产品线。

这标志着 Agent 建设方式,从「手搓一个循环」,变成「在平台之上组装能力」。

MCP:给 Agent 装上统一的「工具接口」

2024 年 11 月,Anthropic 发布了 Model Context Protocol(MCP),2025 年这套协议迎来了爆发式的生态采纳。

它试图解决一个此前极其麻烦的问题:每接入一个新工具、新数据源,都需要为 Agent 单独写一套定制集成代码,N 个模型对接 M 个工具,就要写 N×M 套集成逻辑。

MCP 提供了一套标准化的协议层,让任意 Agent 都能用统一方式连接任意支持该协议的工具、数据源、外部服务,本质上是给「Agent 连接世界」这件事,发明了一个类似 USB-C 的通用接口。

这套协议在 2025 年被 OpenAI、Google 等主要厂商相继采纳,并逐步走向标准化治理。Anthropic 后续宣布,将 MCP 捐赠给新成立的 Agentic AI Foundation,交由中立组织维护和治理,这是协议从「厂商标准」走向「行业公共基础设施」的关键信号。

MCP 的真正意义不止在「连接工具」这个功能上,而在生态互操作性,它让 Agent 生态第一次有了统一语言,工具开发者不需要为每一个 Agent 平台单独适配,大幅降低了整个生态的集成成本。

当然,学术圈也有不同声音,有研究论文提出 MCP 增强的 LLM 是否真的带来净收益,需要辩证看待,协议标准化在带来便利的同时,也可能引入新的安全暴露面和调用开销,这一点在后文争议部分我们还会回到。

A2A:从单 Agent 走向 Agent 之间的协作网络

如果 MCP 解决的是「Agent 怎么连接工具」,那么 Agent-to-Agent(A2A)协议解决的是「Agent 怎么连接 Agent」。

2025 年,由 Google 主导发起、后续联合多家产业伙伴推进的 A2A 协议,试图为不同厂商、不同框架构建的 Agent 之间,建立一套标准化的互调通信规范。

这一步的意义在于:Multi-Agent 系统此前几乎都局限在同一个框架、同一家厂商的封闭体系内(比如 AutoGen 内部的 Agent 互相对话),A2A 的目标是让跨厂商、跨框架的 Agent 也能互相调用,这是「Agent Network」甚至「Agent Internet」这个概念,第一次有了协议层的落地雏形。

Computer Use 成为产业主战场

2025 年,Computer Use 类产品迎来密集竞争。OpenAI 推出 Computer-Using Agent(CUA),并将其应用在 Operator 产品中,能够像人类一样在浏览器和操作系统界面上执行完整任务流程。

市场上随之出现了大量对比评测,比如 Claude / OpenAI / Gemini 三家 Computer Use 能力的横向对比矩阵,以及 Computer Use vs Operator vs Browser Use 的技术路线辨析。

这条战线之所以重要,在于它直接冲击了传统 SaaS 和 RPA(机器人流程自动化)的价值主张。过去的 RPA 需要为每一个界面元素配置精确的坐标脚本,一旦界面改版,脚本就失效;Computer Use Agent 靠视觉理解直接「看懂」界面,理论上具备更强的适应性。

这也是为什么 2025 年开始,大量传统 RPA 厂商纷纷宣布向「Agentic RPA」转型。

Vertical Agent 爆发:竞争维度从「聪明」转向「懂行」

2025 年另一个明显趋势,是垂直领域 Agent 的密集爆发,Coding Agent、Sales Agent、Customer Service Agent、Finance Agent、Legal Agent 各自在细分场景里快速迭代。

竞争逻辑发生了根本转变:早期比的是「哪个模型更聪明」,现在比的是「哪个 Agent 更懂这一项具体工作的业务细节、行业术语、合规要求」。

企业软件开始 Agent 化

2024 到 2025 年间,主流企业软件厂商相继把 Agent 能力嵌入自己的核心产品。

微软在 Copilot 体系里推出 Agent 功能,Salesforce 推出 Agentforce,SAP、Oracle、ServiceNow 也陆续在 ERP、CRM、HR、供应链管理系统中植入 Agent 层。

这一步标志着 Agent 不再是独立于企业系统之外的新软件,而是开始融入既有业务系统的执行层内部。

一句话总结:Agent 从「一款新软件」,变成了「软件的新执行层」。它开始寄生、融合、渗透进原有的企业信息系统内部,而不是作为一个孤立的新入口存在。

回看总图:MCP、A2A 对应的是 Engineering 线里 →Agent Engineering 这一段的关键补齐,企业软件 Agent 化则对应 Enterprise 线从 Agent → FDE 到 Digital Worker 的过渡区。2025 年这几条线,正在朝企业执行层收口。

Part 5|2026 工程时代:Context / Harness / Loop / Graph / Runtime

这一章是全文最核心的理论部分,也是理解「2026 年的 Agent 到底和 2023 年有什么本质不同」的关键。

工程关注点持续上移

回顾这条主线:Prompt → Context → Harness → Loop → Graph。每一次关注点上移,都意味着「决定 Agent 表现好坏的核心变量」发生了迁移。

2023 年,大家还在争论「怎么写一个更好的 Prompt」;到 2026 年,行业内的共识早已迁移,Prompt 只是冰山露出水面的那一小块,水面下决定成败的,是 Context 怎么组织、Harness 怎么搭建、Loop 怎么设计、Graph 怎么编排。

单独优化 Prompt 的边际收益,已经越来越低。

图5|决定 Agent 表现的五层工程

Context Engineering:让模型在正确的时间看到正确的信息

Anthropic 在 2025 年 9 月发表的工程博客 《Effective context engineering for AI agents》,给出了一个非常精准的定义:Prompt Engineering 关注的是怎么写好指令本身,Context Engineering 关注的是在 LLM 推理过程中,如何管理和维护那些「落进上下文窗口」里的最优信息集合,包括所有不属于 Prompt 本身,却影响模型判断的信息。

这篇文章里提到一个特别值得记住的设计模式,just-in-time 上下文加载:与其把所有可能相关的数据提前塞进上下文,Agent 应该只维护轻量级的引用(文件路径、存储的查询语句、网页链接),在真正需要的时候,用工具动态加载具体数据。

Anthropic 自己的 Claude Code 产品就是这么做的,它能对海量数据库执行复杂分析,却从来不需要把整个数据对象塞进上下文窗口,而是写针对性查询、存储中间结果、用 Bash 命令按需读取。

这套思路,其实是在模仿人类认知:我们从不会把整本资料全部背下来,而是靠文件系统、收件箱、书签这类外部索引系统,按需检索。

Context 里到底该装什么?简单说包括:当前任务状态、短期记忆、长期记忆、可用工具列表、对话历史、外部检索结果。管理好这六类信息的「进出节奏」,就是 Context Engineering 的核心工作。

Harness Engineering:Agent = LLM + Harness

现在,该正式推出全文最重要的一个理论节点了。

在 Part 1.4 我们埋下了这个公式的种子:Agent = LLM + Harness

什么是 Harness?直译是「挽具」,在 Agent 语境里,指的是围绕大语言模型建立起来的一整套「工作环境」:Context(信息输入)+ Tools(行动能力)+ Memory(历史沉淀)+ State(当前状态)+ Execution(执行环境)+ Feedback(反馈回路)+ Verification(验证机制)+ Guardrails(安全护栏)。

Anthropic 在其工程博客里,直接用了一个极为精辟的比喻来描述这套架构的演进方向,「Decoupling the brain from the hands」(把大脑和手分开)。

这篇文章里有一个非常关键的洞察:Harness 里编码的很多假设,是关于「Claude 自己做不到什么」的假设,而这些假设会随着模型能力提升而过时,需要被不断重新审视。

这句话值得反复咂摸。它揭示了一个反直觉的真相:**Agent 变强,模型变聪明只是一部分原因,更隐秘的是包着它的 Harness 也在变聪明。同一个模型,套上粗糙的 Harness 和精心设计的 Harness,实际表现能差出好几个档次。

这也是为什么很多团队会发现,用同样的底层模型,自己做的 Agent 效果远不如某些头部产品,差距往往不在模型,而在 Harness 的工程精细度。

模型负责想多深,Harness 决定思考能不能落地成靠得住的动作。后者才是 2026 和 2023 之间真正的鸿沟。

Loop Engineering:设计 Agent 怎么持续工作

如果说 Harness 是「环境」,Loop 就是「节奏」。一个完整的 Agent 循环大致包括:Trigger(触发)→ Plan(规划)→ Act(行动)→ Observe(观察结果)→ Verify(验证)→ Retry / Continue(重试或继续)→ Stop(终止)。

这里我提出一个分析性框架(需要说明,这是本文的观察归纳,并非行业标准公式):Autonomy = Loop Design

Agent 有多自主,模型聪不聪明只是一方面,真正的变量是这个循环怎么设计:什么条件触发重试?什么条件判定为失败并升级给人类?终止条件清不清晰?有没有防无限空转的机制(回想 2023 年 AutoGPT 经常死循环那个教训)?

Loop 设计得好,Agent 表现得像一个靠谱的员工,知道什么时候该继续尝试,什么时候该喊人来看一眼;Loop 设计得差,Agent 表现得像一个不撞南墙不回头的莽夫。

Graph Engineering:设计系统怎么组织

Loop 解决的是「一个 Agent 怎么持续工作」,Graph 解决的是更高一层的问题,整个 Agent 系统怎么组织。

这里要区分一下前文 Part 0.2 提到的 Workflow 和 Agent 的关系。Graph Engineering 的核心要素包括:Nodes(每个节点做什么计算)、Edges(节点之间的流转条件)、Routing(动态路由逻辑)、Parallelism(哪些环节可以并行)、State(跨节点共享的状态)、Verify(在图的哪些节点插入验证)。

前文 Part 3.2 提到的 LangGraph 就是这套思想的典型工程实现。相关框架对比资料提到一个很有意思的数据:Gartner 报告显示,多智能体系统相关的咨询请求量,从 2024 年第一季度到 2025 年第二季度,增长了 1445%,这几乎可以算是行业对「Graph 化 Agent 系统」关注度爆炸式上升的一个量化侧写。

Runtime Engineering:让 Agent 可靠地工作

这是很多同类文章会漏掉,但我认为极其重要的一环。

Runtime 关注的是 Agent 系统在真实生产环境里跑起来之后,怎么保证它「活得下去、出错能恢复、能被追踪审计」:State(状态持久化)、Retry(失败重试策略)、Timeout(超时控制)、Idempotency(幂等性,保证同一操作不会被重复执行造成损害)、Recovery(崩溃后如何恢复)、Escalation(何时升级给人类)、Tracing(全链路执行追踪)、Eval(持续评估)。

前文 Part 4.6 提到的 LangGraph 状态持久化能力(每个节点执行后,状态被持久化到数据库,支持在任意 checkpoint 暂停和重放),正是 Runtime Engineering 的一个典型落地。

如果说 Harness 是给 Agent 配的工作环境,Runtime 就是给这套系统配的「运维体系」,模型负责思考,Runtime 负责让思考可靠地变成行动,并且在出问题的时候,能被发现、能被追责、能被修复。

到这里,五个核心工程概念全部铺开。

Context 管的是「知道什么」,Harness 管的是「环境是什么」;再往下,Loop 管「怎么持续做」,Graph 管「系统怎么组织」,Runtime 管「怎么可靠地跑」。

这五层,就是 2026 年的 Agent 和 2023 年那套「LLM+Prompt+循环脚本」之间真正的差距。

五层工程概念摆齐,下一章看企业怎么把这些能力真正落地,而不是停在技术演示里。

Part 6|FDE:Agent 如何真正进入企业

前面讲的都是技术,但技术到位不等于价值到位。2025 年前后,不少企业卡在一个尴尬的位置:模型先进、框架也上了,业务价值却没出来。

这一章引入 FDE(前线部署工程师)这个概念,看它如何补上「AI 能力」和「企业真实工作」之间那道断裂的缝。

一个奇怪的现象:什么都有了,却没有价值

2025 年前后,不少企业客户和从业者都会遇到一个尴尬局面:模型是最先进的,Agent 框架也用上了,PoC(概念验证)Demo 跑得很漂亮,但真正落地到生产环境、产生实际业务价值的项目,却寥寥无几。

这不是危言耸听。据 Forbes 2026 年 8 月的一篇报道,OpenAI CEO Sam Altman 公开承认,AI 的落地速度比自己预期得更慢,他把原因归结为「经济系统的惯性」,人类组织对变化的抗拒,比技术进步的速度更慢。

同一时间段,Meta 内部一项名为「Project OT」(Office Transformation)的计划,原本打算用 AI Agent 系统重构部分团队,削减规模最多达 60%,最终被 Mark Zuckerberg 亲自叫停。

同一篇报道引用了 2026 年 Harvard Business Review 的一项调研数据:只有 6% 的企业表示,自己完全信任 AI Agent 去运行核心业务流程。

问题的关键从来不是「模型不够好」,而是 AI 能力和企业真实工作流程之间,存在一条巨大的鸿沟,企业的业务逻辑往往散落在遗留系统、非标准化流程、口口相传的隐性知识里,而不是整理成干净的接口文档等着 Agent 调用。

FDE 是什么:从一个岗位,升级为一套企业部署方法论

FDE(Forward Deployed Engineer,前线部署工程师)这个概念,最早由 Palantir 在 2005 年提出,用来解决他们最初的客户(CIA、NSA、美军情报单位)用传统咨询模式解决不了的问题。

据 相关产业分析,这套组织模式为 Palantir 带来了 2020 年 9 月至 2025 年中期约 640% 的公开市场回报,以及 2024 年约 28.7 亿美元的营收

FDE 的核心工作方式是:工程师不是坐在总部远程支持,而是直接嵌入客户内部,现场理解业务流程、现场写代码、现场迭代。

到了 Agent 时代,这套模式被重新定义为一套完整的企业部署方法论,流程大致是:Discovery(发现真实业务需求)→ Workflow Mapping(梳理现有工作流)→ Integration(系统集成)→ Design(设计 Agent 承接方案)→ Eval(评估效果)→ Deploy(部署上线)→ Optimize(持续优化)。

2026 年,这套打法被 Anthropic 和 OpenAI 几乎原样复刻。

据 相关报道,Anthropic 联合黑石集团(Blackstone)、Hellman & Friedman 等机构成立了一个估值 15 亿美元的企业部署合资公司,Anthropic 承诺投入 3 亿美元;OpenAI 也在同期成立了类似的「部署公司」,从 19 家投资方募集 40 亿美元资金,估值达 100 亿美元。

两家公司选择的投资方阵营完全没有重叠,这场景本身就说明,整个金融资本市场都在下注同一个判断:能不能把 AI 真正「部署」进企业,比模型本身聪明不聪明,更值钱。

同一份产业分析总结了 Palantir 打法里最容易被复制的七条原则:招募「工程师+外交官」复合型人才、深度嵌入客户内部、上线第一天就交付真实代码、把客户调研本身当作工程工作、构建客户专属的知识本体(Ontology)、产品反馈直接经由 FDE 回流、坚决拒绝沦为系统集成商角色。

而 2026 年 AI FDE 相比 2005 年最大的变化,是 AI FDE 每周有 30% 到 40% 的时间,花在对话式客户调研上,这个细节本身也说明,Agent 时代的 FDE,某种程度上正在借助 AI 工具本身来加速理解客户需求这件事。

另一个佐证数据:据同一篇报道,FDE 相关职位招聘数量同比增长了 729%,Palantir、OpenAI、Anthropic、Google、Salesforce 等公司都在大规模招募这一岗位。

FDE 填补的产业缝隙

回到本章开头的问题:为什么模型、Agent 技术、企业业务流程都摆在那里,却还是没有价值产出?答案在于中间缺了一环。

Frontier Model(前沿模型能力)→ Agent Tech(Agent 技术栈)→【 FDE:企业部署方法论 】→ Enterprise Workflow(企业实际工作流)→ Outcome(业务成果)

FDE 不是一个岗位,是连接「AI 能力」和「企业真实工作」之间那条断裂链路的关键缝合线。这也解释了为什么 2025 到 2026 年,几乎所有想认真做企业级 Agent 生意的公司,都在拼命招募和培养这类角色,没有这道缝合,再强的模型也只是空转。

缝合线找到了,下一章看这道缝补上之后,Agent 在企业里到底长成了什么形态。

图6|FDE:缝合 AI 能力与企业真实工作

Part 7|AI Workforce:Agent 成为「数字员工」

当 Agent 能稳定干活、能进企业,下一个问题自然浮现:它算不算「员工」?

这一章把视角从技术拉到组织,先区分 Copilot 和数字员工,再看一个 Agent 为什么撑不起「劳动力」四个字,接着看 Agent 团队怎么长出类似人类的组织结构,最后落到企业软件角色和企业管理方式的转变。

Copilot 与 Digital Worker:一字之差,鸿沟巨大

先弄清一个经常被混用的概念对比:

维度

Copilot(副驾驶)

Digital Worker(数字员工)

谁是主角

AI

谁做主要工作

人做,AI 辅助建议

AI 做,人负责监督审核

典型交互

建议、补全、提示

独立完成任务、汇报结果

出错责任链

人对结果负责

AI 承担执行责任,人承担监督责任

适用场景

创意性、判断性强的任务

流程明确、可验证的重复性工作

这条鸿沟,决定了很多企业在采购决策上的巨大分野,买一个「更好用的助手」和买一个「能替你干活的数字劳动力」,是完全不同的采购逻辑、不同的风险评估、不同的组织变革要求。

一个 Agent,撑不起 AI Workforce 这个词

需要特别强调一点:单个再强大的 Agent,也不等于 AI Workforce(数字劳动力)。

真正意义上的 AI Workforce,需要一整套系统性配置:Roles(角色分工)、Skills(技能库)、Memory(组织级记忆,不只是单个 Agent 的记忆)、Tools(工具集)、Workflow(流程编排)、Permissions(权限管理)、Collaboration(协作机制)、Governance(治理框架)。

这套配置清单,几乎和企业招聘、培训、管理一名真正的人类员工需要考虑的维度一一对应,这也正是「数字员工」这个说法的贴切之处。

AI Workforce 是一种工程化的组织建设,不是买一个更贵的 Agent License 就能解决的问题。

Agent 组织开始出现

在很多复杂业务场景里,一套典型的 Agent 团队配置已经浮现:Manager(统筹调度)→ Planner(任务拆解)→ Researcher(信息检索)→ Worker(具体执行)→ Reviewer(结果审核)。

这套结构,和人类团队的职能划分几乎一模一样,某种程度上,我们正在用 Agent 重新发明一遍「组织架构」这门古老的学问。

人与 Agent 的关系演进图谱

把全文的关系演进串成一条线:Tool(工具,被动使用)→ Assistant(助手,被动响应)→ Copilot(副驾驶,主动建议)→ Agent(智能体,自主执行单任务)→ Digital Worker(数字员工,持续承担岗位职责)。

这条线,正是本文标题呼应的落点:Agent 一路走来,主线不是智商增长,而是从工具一步步长成了员工。

图7|从工具到数字员工:人机关系演进

企业软件的角色变化:从界面到执行环境

这里要指出一个正在发生、却经常被忽视的结构性迁移。过去,企业信息系统的运作方式是:

Human → ERP/CRM/BPM(人类操作软件界面,完成业务)

而 2025 到 2026 年正在发生的变化是:

Human Goal → Agent → ERP/CRM/BPM/SaaS(人类设定目标,Agent 代为执行系统操作)

企业软件正在从「给人类看的用户界面(UI)」,转变为「Agent 执行环境(Agent Execution Environment)」。

这个转变的深意在于:往后评价一款企业软件好不好用,人类顺不顺手可能不再是唯一标准,Agent 能不能顺滑地在里面把事办了,会变得越来越重要。

这也是为什么前文 Part 4.6 提到的主流企业软件厂商,几乎全部在同一时间窗口密集推出 Agent 层,他们清楚,如果自己的软件不能被 Agent 顺滑操作,就有被绕过的风险。

Workflow 成为新的核心资产

过去十年,企业最重要的数字资产是 Data(数据)。

而在 Agent 逐渐承担实际工作的当下,比数据本身更值钱的,正变成 Workflow + Context + Knowledge + Agent Memory 的组合,流程怎么编排、上下文怎么组织、知识怎么结构化、Agent 积累的经验怎么沉淀,这些正在变成比「单点模型能力强不强」更关键的竞争维度。

这个判断可以用一个简单的推论来验证:假设两家公司用的是同一个底层大模型,凭什么一家公司的 Agent 系统效果显著更好?

答案几乎肯定不在模型本身,而在于这家公司对自身业务 Workflow 的梳理深度,以及围绕这套 Workflow 构建的 Context 和 Memory 体系。

企业开始管理「数字劳动力」

顺着这条逻辑往下推,一个新的管理命题正在浮现,企业需要像管理人类员工一样,去管理 Agent 的:Identity(身份标识)、Skills(技能范围)、Memory(记忆状态)、Permissions(权限边界)、Workflow(承担的流程职责)、Performance(绩效表现)、Cost(运行成本)、Risk(风险敞口)、Governance(合规治理)。

这套清单本身,就是最直白的结论:企业正在从「管理软件许可证」,走向「管理数字劳动力」。

这也呼应了 Part 5.6 提到的 Runtime 治理逻辑,Runtime 保证的是单个 Agent 系统的可靠性,而这里说的治理,是把这套可靠性扩展到组织层面,变成一整套「数字用工管理制度」。

回到总图坐标:本章内容对应 Enterprise 线末段的 Digital Worker → AI Workforce,以及 Organization 线的 Multi-Agent → AI Workforce

企业这条线已经走到了数字员工阶段,组织这条线,正在向 Autonomous Enterprise(自主企业)这个更远的前一级收口。

Part 8|收敛:2023 的 Agent 与 2026 的 Agent 到底有何不同

讲了八章,是时候收拢了。这一章把 2023 到 2026 的 Agent 系统压成一张「配方表」,一眼看清三年到底一层层叠加了什么,再用一句话给出这场进化的准确定义。

逐年「配方」对比

如果把每一年的 Agent 系统比作一份配方,变化会异常清晰:

年份

核心配方

2023

LLM + Prompt + Tools

2024

+ Memory + Workflow + Loop

2025

+ Harness + Runtime + Protocols(MCP/A2A)

2026

+ Context Engineering + Graph + Governance + Environment(企业执行环境)

这张表,是全文隐藏骨架的显形版本。它直白地回答了那个最常被问到的问题:Agent 三年间,到底进化了什么? 答案不是「模型变聪明了多少个百分点」,而是系统能力一层一层叠加起来的结果,从最初裸露的「LLM+Prompt」,一路叠加到今天完整的工程化系统。

如果只能用一句话概括这场进化,我会这样说:

2023 年的 Agent,像一个「会自主调用工具的 LLM」;2026 年的 Agent,像一套「运行在 Harness、Graph、Runtime、Governance 之上的数字工作系统」。

前者是一个聪明的个体,后者是一整套组织化的基础设施。这也正是本文标题里「进化脉络」四个字的意思:Agent 的进化,拼的不是模型智商涨了多少,而是系统能力一层层叠起来。

三年进化的定义给完了,最后一章我们看当下正在长出来的几个方向:Persistent Agent、Agent Network、Agentic OS。

Part 9|正在发生的演进方向:Persistent / Network / Agentic OS

需要再次强调,这一章讲的不是「未来预测」,而是截至当下,已经在生长的信号。

Persistent Agent:从单任务走向持续在岗

承接 Part 2.4 的 Memory 和 Part 5.4 的 Loop,当下正在发生的一个明显趋势,是 Agent 开始跨会话保持状态与记忆,从「一次性调用,任务结束即销毁」,走向「长期在岗,持续积累经验」。

这类 Persistent Agent 的运行模式,更接近一个长期在职的员工,而不是一个被随时调用又随时释放的临时工。

Agent Network:从 Multi-Agent 到 Agent 互调

承接 Part 4.3 的 A2A 协议,当下正在发生的另一个信号,是协议层让不同厂商、不同框架构建的 Agent,具备了互相调用的能力。

Agent Internet(智能体互联网) 这个说法,虽然听起来还带点未来感,但从协议基础设施的角度看,它的雏形已经出现,这正是把 Part 4.3 的协议进展,落到「网络化」这个更大趋势上的具体体现。

Agentic OS:把 Agent 当「进程」来管理

承接 Part 5 里 Harness、Graph、Runtime 的工程化积累,一个更系统性的趋势正在浮现:主流 Agent 平台开始把每一个 Agent,当作操作系统里的一个「进程」来管理,赋予它 Identity(身份)、Memory(内存/记忆)、Skills(可调用的能力集)、Permissions(权限)、Runtime(运行时环境)、Tools(工具访问)。

这套思路的类比再直白不过:传统操作系统管理进程的调度、内存分配、权限隔离;Agentic OS 管理的,是一个个具备自主行动能力的 Agent 进程。

这个类比,某种程度上也回应了 Part 2.4 提到的 MemGPT 论文里「把 LLM 当操作系统」的早期设想,只是三年之后,这个设想的对象,从单个 LLM 的记忆管理,扩展到了整套 Agent 生态的系统级治理。

Autonomous Enterprise:一笔带过,留个出口

最后要提一句「自主企业」(Autonomous Enterprise)这个更远的方向。

确有企业在探索这条路。组织运行的模式逐步演化为:

Human Strategy(人类定战略)→ AI Workforce(数字员工执行)→ Agentic Workflow(智能体流程)→ Enterprise Systems(企业系统)→ Feedback(反馈)→ Optimization(优化)

在明确的治理边界内实现高度自主,而不是完全无人化运营。

这个方向本身值得单独写一篇文章来展开,本文只在这里点一笔,就不展开叙述了。

回到总图坐标:本章的 Persistent / Agent Network / Agentic OS,对应 Technology 线的 Loop/Runtime、Academic 线的 Multi-Agent、Engineering 线的 Graph→Agent Engineering 这几条线在当下的延伸一步;而 Organization 线末级的 Autonomous Enterprise,在总图里已经标出,但正文只留了这一段简述,让整张图和正文的边界,保持一致闭环。

结语:Agent 的真正终点,不是聊天机器人

回顾这条从 1956 年到 2026 年的演进脉络,能清晰看到四次关键跃迁:

AI 学会了回答问题,这是 ChatGPT 打开的第一层门;

AI 学会了完成任务,这是 2023 年 ReAct、Tool Use、AutoGPT 打开的第二层门;

AI 学会了完成真实工作,这是 2024 到 2025 年 Coding Agent、Computer Use、企业软件 Agent 化打开的第三层门;

AI 学会了协作完成复杂工作,这是 2025 到 2026 年 Multi-Agent、MCP/A2A 协议、FDE 部署方法论、AI Workforce 治理体系打开的第四层门。

走到今天,Agent 正在成为企业生产体系的一部分,从一个孤立的智能体,走向一整套「数字员工」体系。

而 Persistent Agent、Agent Network、Agentic OS,正是这些系统能力,在当下这个时间点正在长出来的具体形态,不是遥远的预言,是正在发生的现实。

Agent 真正的终点,不是一个聊天机器人,而是一整套能被信任、能被管理、能持续干活的数字化劳动力。

所以,那些还在纠结「哪个模型更聪明」的人,该换个问法了。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐