过去两年,AI编程最常见的比较方式一直是:

谁写代码更快?

谁补全更准确?

谁修Bug更强?

谁能理解更大的代码仓库?

于是我们很容易把Codex、Claude Code以及其他Coding Agent理解成:

更高级的代码生成工具。

但2026年以来,一个变化越来越明显:

AI编程正在离开“写代码”这个单一场景。

2026年7月9日,OpenAI宣布Codex App开始并入新的ChatGPT桌面应用。新的桌面端把Chat、Work和Codex放在同一个应用中;与此同时,Codex继续增加Diff内联编辑、侧边栏PR Review、多仓库项目以及Computer Use等能力。

如果只从产品功能看,这可能只是:

ChatGPT和Codex合并到一个App里了。

但如果从Agent的发展方向看,这件事真正值得关注的不是:

App变少了。

而是:

AI的“思考入口”和“执行入口”正在逐渐合并。

这可能比单纯换一个更强的代码模型重要得多。


一、过去的AI编程,本质上还是“代码生产工具”

第一代AI编程体验非常容易理解。

人提出问题:

我要一个登录函数

模型返回:

Code

开发者复制进去。

后来进入IDE Copilot阶段,过程变成:

Developer
↓
IDE
↓
AI Completion
↓
Code

模型已经进入开发环境,但核心角色没有变化:

生成代码。

再后来,Coding Agent开始具备:

读取Repository;

搜索文件;

修改代码;

运行Terminal;

执行测试;

查看错误;

继续修复。

于是流程第一次发生变化:

Developer
↓
Goal
↓
Agent
↓
Repository
↓
Tools
↓
Test
↓
Result

这里真正重要的不是:

AI一次能够生成更多代码。

而是:

代码开始变成Agent完成任务的手段,而不是最终目的。

OpenAI在推出Codex App时就直接描述过这个变化:Codex正在从“写代码的Agent”演变成“使用代码在电脑上完成工作”的Agent;Skills则让它可以连接工具、运行工作流,并处理信息收集、分析、写作等超出单纯代码生成的任务。

这是一个非常关键的分界线。

过去:

Goal = Generate Code

现在:

Goal = Finish Work

而Code只是其中一个Action。


二、为什么Codex进入ChatGPT,比“增加几个新功能”更值得关注?

新的ChatGPT桌面端现在同时存在三个明显不同的工作入口:

Chat
Work
Codex

它们实际上对应三种不同能力。

Chat

主要解决:

理解与交流。

例如:

解释问题;

讨论方案;

分析信息;

形成判断。


Work

主要解决:

跨工具完成知识工作。

OpenAI目前对ChatGPT Work的定义已经不仅是聊天。它可以从团队工具和文件中收集上下文、规划工作方式,并在文件、桌面应用和连接工具之间采取行动,最后形成文档、表格、演示文稿等完成品。


Codex

主要解决:

工程执行。

现在OpenAI直接把Codex in ChatGPT定义成Agentic Coding的“command center”,支持Worktree、Cloud Environment、多Agent并行以及Skills,并且Codex可以在ChatGPT、IDE和Terminal之间通过同一个ChatGPT账号使用。

把这三部分放到一起,就能看到一个比“桌面App更新”更大的结构:

Understand
↓
Plan
↓
Execute
↓
Review
↓
Deliver

过去这些动作往往属于不同软件。

现在它们正在进入同一个AI工作入口。


三、这意味着“Chat”正在失去它原来的中心地位

过去我们把ChatGPT理解成:

一个聊天框。

所以使用方式天然是:

Question
↓
Answer
↓
Question
↓
Answer

即使回答非常聪明,本质上仍然是:

Request / Response。

但真正的工作不是这样发生的。

例如:

帮我分析为什么产品转化率下降。

真实任务可能包含:

读取数据
↓
查看历史报告
↓
搜索用户反馈
↓
分析指标
↓
制作图表
↓
形成结论
↓
制作汇报
↓
根据反馈继续修改

软件工程也是一样。

一句:

修复支付模块Bug。

背后可能是:

读取Issue
↓
搜索Repository
↓
复现问题
↓
查看日志
↓
修改代码
↓
运行测试
↓
检查Diff
↓
提交Review

所以未来真正重要的AI入口,很可能不再是:

Chat Interface。

而是:

Work Interface。

Chat仍然存在。

但它更像人类和Agent之间的:

Control Surface。

真正的价值发生在聊天框后面的执行系统。


四、Codex的角色,也正在从“Coder”变成“Execution Layer”

这是理解这个变化最重要的一点。

传统的软件开发助手可以抽象成:

Human
↓
AI
↓
Code

而Agent时代更接近:

Human
↓
Intent
↓
Agent
↓
Tools
↓
Environment
↓
Actions
↓
Evidence

例如一个Agent收到:

修复这个Bug。

它真正需要做的可能包括:

读取Issue;

检查Repository;

运行测试;

搜索代码;

修改文件;

重新Build;

检查Diff;

处理Review意见。

代码只是整个Action Graph中的一部分。

Codex现在支持多Agent并行、独立线程和Worktree,也是因为问题正在从:

一个AI怎么帮一个开发者写代码?

变成:

一个开发者怎么同时管理多个可以执行工程任务的Agent?

OpenAI推出Codex App时明确提到,开发者已经开始跨项目编排多个Agent,让任务并行运行;因此挑战正在从“Agent能做什么”转向“人如何大规模指挥、监督和协作”。

这意味着Coding Agent真正竞争的下一层,很可能已经不是:

Code Generation。

而是:

Execution Orchestration。


五、多仓库支持为什么比看起来更重要?

新的ChatGPT桌面端对Codex增加了多Repository项目支持。

乍看只是一个便利功能。

但它实际上对应了真实软件工程里的一个问题:

很多业务根本不是一个Repository。

例如一个电商系统可能包含:

frontend
backend
payment-service
auth-service
infra
shared-sdk

传统Coding Assistant往往以:

当前文件

或者:

当前Repository

作为工作边界。

但真实工程问题可能横跨:

Issue
↓
Frontend
↓
API
↓
Backend
↓
Shared Library
↓
Test

如果Agent真正承担的是:

完成任务,

而不是:

修改某个Repository里的代码,

那么跨Repo上下文本身就会越来越重要。

所以Multi-Repository并不仅代表:

一次打开更多代码。

它意味着Agent的工作单位正在从:

Repository

逐渐向:

Project / Goal

移动。

这是一个非常大的变化。


六、PR Review进入同一个入口,也说明“生成代码”已经不是终点

过去AI编程最容易形成一种错觉:

代码生成出来,任务就结束了。

但工程里真正完整的流程是:

Requirement
↓
Implementation
↓
Diff
↓
Test
↓
Review
↓
Feedback
↓
Revision
↓
Merge

新的Codex工作流正在把更多PR流程直接带进应用:用户可以查看Pull Request、Review changed files、查看Review Comments,再让Codex解释反馈、修改代码并继续检查。

这里真正重要的不是:

ChatGPT现在能看PR了。

而是:

Agent生命周期正在继续向代码生成之后延伸。

以前:

AI
↓
Code

现在:

AI
↓
Code
↓
Test
↓
Review
↓
Feedback
↓
Revision

这说明软件Agent正在逐渐进入:

Software Lifecycle。

而不是只停留在:

Code Generation Stage。


七、Worktree真正解决的是“多个Agent怎么同时干活”

当只有一个Agent时:

Human
↓
Agent
↓
Repository

非常简单。

但如果未来变成:

Agent A:修Bug

Agent B:写测试

Agent C:升级依赖

Agent D:处理Review

问题马上出现:

它们是不是都在修改同一个Workspace?

如果是,就很容易产生代码状态冲突。

这也是Codex为什么内置Worktree。

不同Agent可以在隔离的Repository副本中工作,再由开发者分别审查结果。OpenAI把这一能力作为Codex多Agent工作流的核心部分。

所以真正的变化其实是:

以前开发工具管理的是:

Files。

后来管理的是:

Projects。

未来越来越需要管理:

Agents。

这会直接改变IDE和开发环境的形态。


八、未来IDE可能不再是开发工作的唯一中心

过去开发者一天的大量时间都围绕:

Editor
Terminal
Git
Browser
Issue Tracker
Documentation

IDE承担的是代码工作中心。

但是Agent出现以后,另一个界面开始变得越来越重要:

Agent Control Surface。

你真正需要看到的可能不是:

当前光标在哪一行。

而是:

Agent A
正在修Issue #381

Agent B
测试失败

Agent C
等待Approval

Agent D
PR已经可以Review

这个变化非常类似:

开发者从:

直接操作每一个文件

逐渐转向:

监督多个执行单元。

所以Codex App最初被OpenAI称为多个Agent的“command center”,本身就很值得注意。

而现在这个Command Center正在被并入:

ChatGPT。

这意味着ChatGPT未来承担的角色可能越来越像:

统一的人机工作控制层。

这是我认为比单个Codex模型跑分更值得关注的趋势。


九、AI编程的竞争指标也会因此发生变化

如果AI编程只是:

Generate Code

那么大家自然比较:

准确率;

Benchmark;

首轮通过率;

Token成本。

但如果AI编程进入:

Execute Work

评价标准就必须增加。

未来真正重要的可能包括:

1. Task Completion

Agent最终有没有完成目标?

2. Long-Horizon Stability

运行几个小时以后还能不能保持目标一致?

3. Context Management

多个文件、Repo和工具之间能不能维护正确状态?

4. Tool Reliability

调用Terminal、Browser、MCP、API是否稳定?

5. Verification

Agent能不能证明结果真的正确?

6. Parallelism

能不能安全运行多个Agent?

7. Human Oversight

人能不能快速知道:

哪里成功,

哪里失败,

哪里需要接管?

所以未来评价一个Coding Agent,只说:

它写代码很强。

可能会越来越像评价一个程序员:

打字速度很快。

不是没价值。

但已经不是核心能力的全部。


十、ChatGPT、Work和Codex正在形成一个更大的三层结构

如果进一步抽象,我认为现在已经能够看到一个很有意思的架构:

Chat
↓
Intent / Reasoning

负责:

理解问题,

讨论,

形成目标。

然后:

Work
↓
Knowledge Execution

负责:

研究,

文档,

表格,

演示,

跨工具工作流。

再往下:

Codex
↓
Engineering Execution

负责:

代码,

Repository,

Terminal,

Test,

PR,

工程Agent。

这不是OpenAI官方给出的架构名称,而是根据目前产品结构做出的一个推断。

但如果这个方向继续发展,ChatGPT最终可能不再只是一个“聊天产品”。

而会逐渐成为:

Human → Agent System

之间的统一交互层。

OpenAI自己在新版ChatGPT桌面端发布说明中也把这次更新描述为更大愿景的第一步:让智能不只回答问题,而是帮助用户把想法真正转化成结果。


十一、真正重要的变化:人类开始从Operator变成Supervisor

过去开发者:

写代码
运行命令
测试
修改
提交

Agent进入以后:

定义任务
↓
Agent执行
↓
检查结果
↓
处理异常
↓
批准关键动作

这意味着人的位置正在发生变化。

从:

Operator

变成:

Supervisor。

这也是为什么最近越来越多Agent工程问题开始集中到:

Context Engineering;

Task Engineering;

Verification;

Worktree;

Approval;

Control Plane;

Evidence。

因为当Agent真正能够执行以后,

最大的工程问题就不再只是:

它够不够聪明?

而是:

我们怎样让它在正确边界内稳定工作?


十二、所以AI编程为什么“不再只是写代码”?

因为Coding Agent正在同时发生四个变化。

第一:

从:

Generate

走向:

Execute。


第二:

从:

Single File

走向:

Project / Multi-Repository。


第三:

从:

Single Agent

走向:

Multi-Agent。


第四:

从:

Code Output

走向:

Task Completion。

最终可能形成:

Intent
↓
Plan
↓
Agent
↓
Tools
↓
Code
↓
Test
↓
Review
↓
Evidence
↓
Result

当这条链真正建立以后,

“AI编程”这个词本身可能都会显得有些狭窄。

因为Agent真正承担的已经不是:

帮你写代码。

而是:

借助代码、工具和环境,把一个工程目标推进到完成状态。


最后

Codex进入新的ChatGPT桌面工作入口,我认为真正值得关注的不是:

ChatGPT又多了一个Codex按钮。

而是一个更大的产品方向:

思考、计划、执行、验证正在进入同一个Agent工作系统。

过去开发者打开AI,是为了:

问一个问题。

后来是:

写一段代码。

现在正在变成:

完成一个任务。

而下一步很可能是:

管理一组持续完成任务的Agent。

所以AI编程真正进入Agent阶段以后,决定开发效率的核心问题也会逐渐变化。

不再只是:

哪个模型代码能力最高?

而是:

谁能把Intent、Context、Agent、Tool、Environment、Verification和Human Review组织成一个稳定的工作系统?

从这个角度看,Codex正在进入ChatGPT,不只是产品合并。

它更像一个信号:

AI正在从软件里的一个功能,逐渐变成工作的入口本身。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐