原文链接:https://www.anthropic.com/engineering/building-effective-agents

前言

当下AI圈充斥着"全能自主Agent"的热潮,大量开发者上手就搭建重型多智能体框架,最后面临不可控循环、高额Token开销、难以调试等痛点。

Anthropic 2024年底发布的《Building Effective Agents》堪称LLM智能体落地的工程圣经。文章基于大量企业落地实践提出反共识结论:生产环境中最好用的智能系统,不靠复杂框架,而是循序渐进、按需增加复杂度

本文完整拆解原文核心架构思想,同时结合当下热门AI编程工具:Claude Code、TRAE普通模式 / SOLO模式做精准归类,帮开发者建立统一选型标准。

一、最核心分界:Workflow vs Agent(判断标准:谁掌握流程控制权)

原文首先终结行业名词混战,把所有带工具调用、多轮执行的系统统称为 agentic systems(智能体类系统),按照流程控制权划分两大阵营:

  1. Workflow(工作流):控制权在代码
    代码预先定义执行顺序、分支逻辑;LLM仅负责单步推理,不能自主决定下一步动作。
    ✅ 优点:结果稳定、可复现、易观测调试、成本可控
    ✅ 适用场景:任务边界清晰、执行步骤可以完整枚举
    类比:有轨列车,轨道提前铺设好

  2. Agent(自主智能体):控制权在大模型
    LLM自主规划路径、动态选择工具、自主循环执行、自行判断任务是否结束,不存在预先写死的执行链路。
    ✅ 优点:极强灵活性,适配开放、未知复杂度任务
    ⚠️ 缺点:不确定性高、容易无效循环、Token消耗更高、排障困难
    类比:自动驾驶汽车,根据路况动态调整路线

重点提醒:二者不存在优劣,只有场景匹配问题,不要盲目追求"自主Agent"。

二、三层渐进式落地架构(官方推荐开发路线:由简到繁)

强烈遵循原则:能用简单方案解决,绝不升级复杂架构

第一层:增强型LLM(最小基础单元,优先尝试)

单次LLM调用,搭配三类增强能力:检索RAG、单次工具调用、短期记忆。
执行模式:一问一答,无自动循环。
绝大多数简单业务:知识库问答、单文件代码查询、文本提取,仅仅依靠这一层就足够,完全不需要多轮智能体。

第二层:五大经典Workflow(代码管控流程,生产首选)

当单次LLM无法完成任务,优先选用工作流,而不是直接上自主Agent。

  1. Prompt Chaining 提示链:任务串行拆分,上一步输出作为下一步输入,可增加代码校验关卡;例:大纲撰写→正文生成→合规校对
  2. Routing 路由分发:LLM识别任务类型,代码分发至独立子流程;典型场景:智能客服分流
  3. Parallelization 并行执行:多个独立任务同时运行,最后汇总结果
  4. Orchestrator-Workers 调度-工人:调度模块拆分任务,分配给多个子任务执行器,适合中等规模复杂任务拆解
  5. Evaluator-Optimizer 评估-迭代器:生成器产出内容,评估器反馈优化意见,循环迭代直至达标;适合高要求文案、代码优化

第三层:自主Agent循环(最后备选方案)

闭环逻辑:观察环境反馈 → 思考规划 → 执行工具动作,持续循环。

仅满足以下条件再考虑使用:

  • 任务开放,执行路径无法提前枚举
  • 工具组合方式不确定,需要动态决策
  • 能够接受更高延迟与成本

同时必须增加防护:最大迭代次数、人工检查点、沙箱隔离,规避失控风险。

三、三大工程黄金准则(落地避坑)

  1. 极简优先,按需增杂
    开发顺序:增强LLM → Workflow → 自主Agent。不要上来堆砌LangChain、复杂多智能体框架;原型可以使用框架验证思路,生产环境建议剥离多余抽象。
  2. 完整可观测性
    记录Agent全部思考过程、工具参数、返回结果、上下文快照。自主Agent是黑盒,如果缺少全链路日志,故障几乎无法定位。
  3. 重视ACI(Agent-Computer Interface)
    工具描述、参数定义、返回格式需要和Prompt同等打磨。工具接口清晰度直接决定模型调用正确率。

四、实战归类:Claude Code、TRAE普通模式 / SOLO模式对照

依托上文标准,我们对主流AI编程工具精准分类,理清很多开发者混淆的概念。

工具模式 所属分类 核心特征
Claude Code(原生模式) 自主Agent(第三层) 用户仅提供最终需求;模型自主决定读取文件、执行命令、修改代码、自主迭代修复,全程自主闭环决策
TRAE IDE普通聊天模式 增强型LLM(第一层) 人类掌握控制权,一轮一问。AI执行完单次任务立刻暂停,等待用户下发新指令,不会主动持续执行多轮工具循环
TRAE SOLO模式 自主Agent(第三层) 用户下达目标后,模型自主规划完整开发流程,自动执行文件读写、调试、迭代;Plan确认弹窗只是人工护栏,流程决策权仍然属于模型

常见误区澄清

误区1:TRAE SOLO有Plan审批功能,属于Workflow

纠正:Workflow核心是代码预定义流程。Plan只是增加人工确认节点,执行方案、执行顺序依旧由模型动态生成,属于带护栏的自主Agent,不属于工作流。

误区2:只要能调用多个工具,就是Agent

纠正:区分关键:没有用户新指令的前提下,AI是否主动执行下一步动作。普通聊天模式哪怕连续调用工具,也是单次会话内动作,执行结束主动停止,不会自主推进任务。

五、场景选型指南(开发&日常使用双参考)

✅ 优先选用【增强LLM / Workflow】

  1. 标准化任务、步骤固定(报表生成、固定脚本、规范化代码检查)
  2. 业务对延迟、成本敏感、并发量大
  3. 出错代价极高:金融、合规审核、生产环境自动化

✅ 适合启用【自主Agent:Claude Code / TRAE SOLO】

  1. 跨文件大型重构、未知Bug深度排查、新项目从零搭建
  2. 问题开放,无法提前预判所有执行步骤
  3. 能够接受更长执行时间、更高Token消耗

简单总结:小改动、标准化流水线,手动交互普通模式;大型项目端到端开发,启用SOLO/Claude Code自主智能体。

六、总结与思考

这篇文章本质上在纠正行业浮躁风气:Agent不是噱头,而是特定复杂问题下的技术选型

很多团队沉迷打造"大而全"自主智能体,忽略最简单的方案往往稳定性最强。

无论你是自研LLM系统开发者,还是日常使用AI编程工具,都可以遵循这条思路:
先简单,后复杂;优先把控制权掌握在代码/人类手中,只有迫不得已,再交给大模型自主决策。

原文链接:https://www.anthropic.com/engineering/building-effective-agents
欢迎评论区交流:你在项目中会优先Workflow还是自主Agent?

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐