收藏 | 从ChatGPT到Coding Agent:小白程序员必看的大模型应用解析
本文深入探讨了从ChatGPT、Claude到Codex等大模型在编程领域的应用差异,明确指出能生成代码的大模型并不等同于Coding Agent。文章强调Agent系统需负责提供上下文、执行工具、维护状态等,而非模型本身。通过思想实验和系统层次分析,阐述了Workflow与Agent的区别,并澄清了AI、机器学习、大模型与Agent的概念边界。最后,文章提出了一套实用的责任判断方法,帮助读者理解模型、服务、应用和Agent各自的职责,为构建高效的Coding Agent打下坚实基础。

ChatGPT 能回答问题,Claude 能分析代码,Codex 还能搜索仓库、修改文件、运行测试。
它们看起来都在“思考”,但背后的系统并不是一回事。
一个最容易混淆的问题是:能生成一段正确代码的大模型,为什么还不等于 Coding Agent?
答案很直接:
模型负责根据上下文提出下一步;Agent 系统负责提供上下文和工具、执行动作、维护状态,并用外部证据判断任务是否完成。
如果这条边界没有画清楚,后面谈 Prompt、RAG、MCP、记忆、权限和评估,很容易把不同层的问题都归结为“模型不够聪明”。
这篇文章先把地基打牢。
同一个模型,放进三种应用会发生什么
先做一个思想实验:不更换模型,只改变模型外部的应用。
第一种:只有一个聊天框
用户问:“北京今天会下雨吗?”
模型可以解释怎样查询天气,也可能根据旧知识猜一个答案。但它没有实时天气数据,更没有打开天气服务的能力。
它能生成文字,不能凭这段文字自动获得最新事实。
第二种:请求里加入一份企业文档
模型现在可以依据文档回答报销制度、请假流程或产品规范。
变化来自本轮上下文,而不是模型权重被临时重训。文档没有覆盖的内容,它仍然无法可靠回答。
第三种:提供搜索、文件、终端和测试工具
模型可以先搜索代码,读取相关文件,提出补丁,再由运行时写入文件并执行测试。如果测试失败,新结果会回到下一轮决策。
同一个模型看起来突然从聊天机器人变成了 Coding Agent。
真正新增的并不是一块“Agent 大脑”,而是一套模型外的工程系统。

从模型服务到三种 AI 应用模式
这张图里最重要的不是层数,而是最后三种应用模式:
- 单次调用:应用组织输入,只调用一次模型;
- Workflow:代码预先定义执行步骤;
- Agent:模型根据中间观察,在约束内动态决定下一步。
因此,Agent 不是所有 AI 应用之上的“第四层”,而是 AI 应用的一种架构模式。
模型、服务、应用和 Agent,各自负责什么
把一次 AI 请求拆开,可以看到四个不同责任面。
模型
主要职责:根据输入 Token 计算下一步输出分布
输入与输出:Tensor → Tensor
不应该被误认为:会自行访问文件或数据库的程序
模型服务/API
主要职责:托管模型、鉴权、调度、流式传输
输入与输出:请求 → 响应
不应该被误认为:完整的业务应用
单次调用应用
主要职责:组织提示、数据和一次模型调用
输入与输出:用户输入 → 一次输出
不应该被误认为:能自主循环完成任务的 Agent
Agent
主要职责:围绕目标观察、决策、行动和验证
输入与输出:目标 → 动态轨迹与产物
不应该被误认为:一个“更大的 LLM”
这里有一个很实用的责任判断:
谁提出动作
模型可以输出“读取 pricing.py”“执行测试”或一段结构化工具调用。
这只是动作提议。
谁真正执行
服务端或客户端的执行器校验参数,在允许的环境中读取文件、写入补丁或运行命令。
这才会产生真实副作用。
谁决定完成
运行时检查退出码、测试、产物和验收条件,再决定继续、停止或请求人工处理。
模型说“已经修好”不是完成证据。
用一句话概括就是:
Model proposes,Harness disposes,Verifier proves。
模型负责提议,Harness 负责受控执行,Verifier 负责给出完成证据。
Workflow 和 Agent,区别不在“有没有工具”
很多 Workflow 也会调用模型、数据库和 API,所以“会使用工具”不能直接证明它是 Agent。
更稳定的判断方式是看:执行路径主要由谁决定。
Workflow:代码提前写好路径
例如一条固定的文档处理链:
系统层次
上传文件
→ 提取文本
→ 固定规则切分
→ 调用模型摘要
→ 保存结果
即使某一步使用了大模型,整体路径仍由程序预先规定。
Agent:模型依据观察选择下一步
例如修复一个未知 Bug:
系统层次
读取任务
→ 搜索相关代码
→ 根据搜索结果决定读哪个文件
→ 运行测试
→ 根据失败信息选择修改
→ 再次验证
开发者不会提前写死“第三步必须打开哪个文件”。模型需要根据每一轮的新观察改变动作。
判断一个系统是否采用 Agent 模式,可以连续问三个问题:
-
下一步是否会因为中间结果不同而改变?
-
动作结果是否会进入下一轮决策?
-
系统是否有明确的停止、失败与验收条件?
前两个问题都是否,它更像单次调用或固定 Workflow。只有动态路径,没有停止与验收,它也只是一个容易失控的循环。
LLM 是模型,Agent 是系统
另一个常见混淆,是把 AI、机器学习、大模型和 Agent 放在同一层比较。
它们其实回答两类不同的问题。
AI、机器学习、深度学习和大语言模型描述的是技术与模型谱系;Agent 描述的是应用怎样围绕目标组织模型、工具和环境。

AI、机器学习、大模型与 Agent 的概念边界
可以这样理解:
- 人工智能 AI
:让机器表现出感知、推理、决策或生成能力的广泛领域;
- 机器学习 ML
:从数据中学习统计规律的方法;
- 深度学习 DL
:使用多层神经网络学习表示的方法;
- 大语言模型 LLM
:在大量 Token 上训练的语言概率模型;
- Agent
:围绕目标持续组织模型、上下文、工具、状态和验证的系统。
所以,“给 LLM 接一个工具”只是构建 Agent 的一个条件,不是全部。
如果没有循环、状态、权限和验证,它可能只是一次带工具的模型调用。如果路径完全固定,它可能更适合被称为 Workflow。
大模型究竟在学习什么
自回归语言模型的核心目标可以压缩成一行:
提示词
P(下一个 Token|当前上下文)
训练时,程序从原始文本自动构造“前文—下一个 Token”样本。例如:
| 模型看到的前文 | 应该预测的目标 |
|---|---|
| Agent | 使用 |
| Agent 使用 | 工具 |
| Agent 使用 工具 | 完成 |
| Agent 使用 工具 完成 | 任务 |
真实训练会把许多序列组成张量,并行计算多个位置的预测。模型给正确 Token 的概率越低,损失越大;优化器据此调整参数。
推理时则没有标准答案。模型从当前概率分布中选择或采样一个 Token,把它追加到上下文,再预测下一个。循环持续到停止标记、长度上限,或产生需要外部运行时处理的工具调用。
“只预测下一个 Token”听起来很简单,但要在海量文本中把下一步预测好,模型必须压缩许多隐藏规律:
- 词语和语法怎样组合;
- 事实之间通常怎样关联;
- 问题后面常出现怎样的解答;
- 代码结构、错误模式和修改方式怎样对应;
- 不同任务和写作风格遵循什么模式。
这能产生非常有用的行为,但不意味着模型自动拥有外部世界的真值,也不意味着它说出的动作已经发生。
更稳妥的工程表述是:模型学到了足以在许多上下文中产生有用输出的统计表示;系统仍要用数据、工具与验证把输出接到真实任务上。
基础模型、对话模型和工具模型为什么表现不同
完成预训练后,基础模型首先擅长的是续写。给它一段需求,它可能继续写需求,也可能生成代码、解释代码或模拟后续对话。
现代可用模型通常还会经历后训练:
- 指令微调,让模型更稳定地遵循请求与输出格式;
- 偏好优化,让模型倾向于更有帮助、更安全的回答;
- 强化学习,优化可验证任务、多步推理或工具使用策略;
- 安全训练,塑造拒绝、风险识别与边界处理行为。
因此,“模型只是预测下一个 Token”描述了统一的生成机制,却不能解释全部产品行为。
一个 Coding Agent 的最终表现至少来自三部分:
-
模型在预训练与后训练中学到的能力;
-
当前任务提供的指令、文件、历史和工具描述;
-
Harness 对工具、状态、权限、失败恢复和验证的组织。
只看模型排行榜,无法完整比较两个 Agent 产品。
四个经常被混在一起的“规模”
讨论大模型时,还要区分四类生命周期完全不同的数字。
参数量
它是什么:训练后持久保存在权重中的可学习数值
主要影响:模型容量、存储与推理计算
激活值
它是什么:一次前向或反向计算产生的中间表示
主要影响:显存、并行与训练成本
训练 Token
它是什么:整个优化过程处理过的数据单位
主要影响:数据覆盖与训练预算
上下文 Token
它是什么:当前请求或会话中可见的序列
主要影响:本轮信息、延迟与费用
一个产品说“记住了很长的对话”,通常表示应用保留原始历史、摘要或外部状态,并在后续请求中重新提供;它不表示普通对话正在实时修改模型参数。
以后看到任何“规模”数字,先问一句:它属于训练阶段、单次推理,还是应用运行时?
这个问题能过滤掉大量概念误判。
用一个可运行实验验证边界
只讲概念还不够。仓库里的 chapter1/coding_agent_demo.py 用一个完全本地、确定性的实验,把“提议”和“执行”拆开。
任务是修复 parse_price(),让它能解析 ¥19.90,同时拒绝出现在数字中间的货币符号。
运行:
命令
python chapter1/coding_agent_demo.py
脚本不会调用真实大模型,而是固定一段补丁提议,以便只观察系统边界。关键结果是:
实测结果
修改前:exit_code=1,目标测试失败
模型提议:只是一段候选补丁文本
Harness:把补丁写入临时工作区
修改后:exit_code=0,3 个测试全部通过
这个实验不能证明某个模型会写出好补丁,也不能比较 Claude Code 与 Codex 谁更强。它只证明三件事:
-
候选补丁不会因为模型说出来就自动改变文件;
-
真实修改必须由有权限的运行时执行;
-
“完成”应由测试和退出码支撑,而不是由模型自述。
这正是 Agent 工程与普通文本生成之间最关键的一道分界线。
遇到 Agent 产品,可以这样拆
下次再看到一个“会自动完成任务”的 AI 产品,不妨按下面的顺序检查:
- 模型层
:模型实际接收什么上下文,输出文本还是结构化动作?
- 工具层
:有哪些工具,参数由谁校验,副作用在哪里发生?
- 循环层
:工具结果是否回到下一轮,失败后怎样继续?
- 状态层
:长任务怎样保存进度,重启后能否恢复?
- 权限层
:谁持有密钥,哪些动作需要审批,沙箱边界在哪里?
- 验证层
:系统凭什么判断完成,能否看到测试、Trace 或其他证据?
如果一个产品把这些信息全部藏在“模型很强”后面,你就很难判断它为什么成功,也很难在失败时定位问题。
写在最后
这一篇只需要带走三个结论。
第一,LLM 是模型,Agent 是系统。 模型负责生成下一步,系统负责把生成接到真实环境。
第二,Workflow 与 Agent 的核心差异,是执行路径由代码预先决定,还是由模型依据中间观察动态决定。
第三,模型输出不是外部事实,动作提议不是已经执行,模型自述也不是完成证据。
把这三条边界画清楚,后面讨论 Token、Transformer、工具调用、Harness、权限和评估时,就不会把所有能力与失败都错误地归因给模型。
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套 AI 大模型突围资料包:
- ✅ 从零到一的 AI 学习路径图
- ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
- ✅ 百度/阿里专家闭门录播课
- ✅ 大模型当下最新行业报告
- ✅ 真实大厂面试真题
- ✅ 2026 最新岗位需求图谱
所有资料 ⚡️ ,朋友们如果有需要 《AI大模型入门+进阶学习资源包》,下方扫码获取~
① 全套AI大模型应用开发视频教程
(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)
② 大模型系统化学习路线
作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!
③ 大模型学习书籍&文档
学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。
④ AI大模型最新行业报告
2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。
⑤ 大模型项目实战&配套源码
学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。
⑥ 大模型大厂面试真题
面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

以上资料如何领取?

为什么大家都在学大模型?
最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!

不出1年,“有AI项目经验”将成为投递简历的门槛。
风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!

这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

以上全套大模型资料如何领取?

更多推荐


所有评论(0)