ChatGPT、Codex趋势:企业AI真正的分水岭,为什么已经不是“会不会用”,而是“敢不敢把任务交给Agent”?
过去两年,企业讨论AI落地时,经常会问:
员工会不会用ChatGPT?
有没有接受Prompt培训?
多少人每周使用AI?
AI工具渗透率达到多少?
这些指标在AI刚进入企业时非常重要。
因为第一阶段的问题确实是:
Adoption。
先让更多人开始使用AI。
但进入2026年以后,一个新的分水岭正在出现。
OpenAI最新企业数据里有一个非常值得关注的信号:
截至2026年6月,在企业客户中,Codex已经贡献了ChatGPT与Codex合计输出Token的 64%。OpenAI把这种变化概括为企业AI正在从“asking”走向“doing”——从让AI回答问题,逐渐转向把更长、更复杂的任务委托给Agent执行。
这意味着企业AI真正的问题正在从:
员工会不会用AI?
逐渐变成:
企业敢不敢把真实工作交给AI?
这两件事看起来只差一步。
实际上背后对应的是两套完全不同的组织能力。
一、“会用AI”解决的是个人效率
传统ChatGPT使用方式非常熟悉:
Human
↓
Question
↓
AI
↓
Answer
↓
Human
例如:
帮我总结会议;
帮我分析数据;
帮我写邮件;
帮我解释代码;
帮我整理方案。
AI提供:
Assistance。
但工作真正怎么推进,仍然由人负责。
人负责:
找到资料;
决定下一步;
切换系统;
检查结果;
继续执行;
最终提交。
所以这种模式本质上是:
Human Workflow
+
AI Assistance
AI提高了其中某一步的效率。
但Workflow的控制权仍然在人。
二、Agent真正改变的是“任务所有权”
如果只是让AI回答:
这个Bug可能是什么原因?
AI承担的是:
Analysis。
但如果告诉Codex:
找出这个Bug的原因,修改代码,运行测试,并把结果整理出来。
结构就完全不同了。
Goal
↓
Agent
↓
Read Repository
↓
Analyze
↓
Modify
↓
Run Tests
↓
Observe
↓
Retry
↓
Verify
↓
Result
这时候人不再负责每一个中间步骤。
人开始把:
Task Ownership
的一部分交给Agent。
这也是“Assistance”和“Execution”最大的区别。
过去是:
AI helps me do the task
现在开始变成:
AI does the task for me
当然最终责任仍然在人。
但执行权正在发生变化。
三、这也是为什么Codex的64%比“使用人数”更值得关注
OpenAI最新企业数据并没有简单说:
“Codex用户很多”。
更值得注意的是:
Codex已经占企业客户ChatGPT与Codex合计输出Token的64%。OpenAI同时提醒,这个指标不能简单理解成64%的企业工作都由Codex完成,因为Agent任务通常更长、步骤更多,因此会自然产生更多输出Token。
但这恰恰说明一个问题:
企业正在把越来越长的工作链交给Agent。
普通聊天可能是:
Prompt
↓
500 Tokens
Agent任务却可能是:
Plan
↓
Tool
↓
Files
↓
Execution
↓
Verification
↓
Thousands of Tokens
所以真正值得看的不是单纯Token数量。
而是Token背后的:
Delegated Work。
四、企业AI真正的下一阶段可能叫“Delegation”
可以把企业AI采用简单分成三个阶段。
第一阶段:Access
员工有AI账号
目标:
让AI可以被使用。
第二阶段:Adoption
员工开始频繁使用AI
目标:
提高个人效率。
第三阶段:Delegation
真实任务
↓
Agent
目标:
让AI承担完整工作的部分执行责任。
这三个阶段的难度完全不同。
Access主要是:
采购问题。
Adoption主要是:
培训和习惯问题。
Delegation则变成:
组织系统问题。
五、为什么很多企业敢让员工问AI,却不敢让Agent真正做事?
因为:
回答错了
和:
执行错了
风险完全不同。
如果ChatGPT回答:
这段代码可能存在问题。
开发者可以不采用。
但如果Agent已经:
修改Repository;
运行Command;
更新CRM;
发送Email;
改变业务数据,
风险就已经进入真实系统。
因此企业会立刻遇到:
Permission
Sandbox
Approval
Verification
Audit
Recovery
这些问题。
所以很多企业实际上已经完成:
AI Adoption
但还没有真正进入:
AI Delegation
六、真正的分水岭是“允许AI产生Action”
这可能是一个很重要的判断标准。
AI如果只能:
Read
Think
Generate
它仍然主要是知识工具。
Agent开始拥有:
Read
Think
Act
Verify
以后,它才真正进入生产流程。
所以企业AI成熟度可以从另一个角度判断:
AI到底能不能产生真实Action?
例如:
Level 1
AI可以回答问题。
Level 2
AI可以生成文档。
Level 3
AI可以读取企业工具。
Level 4
AI可以修改系统状态。
Level 5
AI可以执行并自动验证完整Workflow。
越往后:
生产力潜力越大。
同时治理难度也越高。
七、为什么“同样都有ChatGPT”,企业差距反而会越来越大?
OpenAI最新数据还显示:
AI使用深度最高的前10%企业——官方称为Frontier firms——每位活跃用户产生的输出Token已经是典型企业的 8.3倍,而今年1月这一差距只有2.6倍。需要注意的是,这只是使用深度的代理指标,并不意味着生产力直接高8.3倍。
但趋势非常明显:
企业之间的AI使用深度正在快速分化。
为什么?
因为模型访问本身越来越趋同。
大家都可以买到类似能力。
真正拉开差距的是:
Context
Tools
Skills
Workflow
Permission
Governance
也就是说:
组织有没有能力让Agent真正进入工作。
八、Prompt能力可能正在从核心竞争力退到基础能力
早期使用AI,Prompt非常重要。
因为工作模式是:
Human
↓
Prompt
↓
Model
人需要不断告诉模型:
背景是什么;
目标是什么;
输出格式是什么。
但当企业开始建立:
Skills;
Plugins;
Workspace Agents;
自动化Workflow,
很多稳定知识会逐渐从:
Human Prompt
迁移到:
System Context
例如:
销售团队不需要每次告诉Agent:
我们的客户分级标准是什么。
这些规则已经进入:
Skill。
研发团队不需要每次告诉Codex:
测试命令是什么。
这些规则已经进入:
Repository Harness。
于是人的能力开始从:
怎么把Prompt写得更好?
逐渐转向:
怎样设计一个可以被Agent可靠执行的Workflow?
九、Frontier企业为什么更重视Plugins和Skills?
OpenAI最新企业数据里还有一个很明显的差距。
在每周活跃用户中,Frontier企业使用Plugins的比例为 21%,典型企业是9%;使用Skills的比例则是 19%对3%。
这非常值得注意。
因为Plugin和Skill解决的并不是:
模型更聪明。
而是:
模型能不能获得正确Context、工具和重复Workflow。
可以理解成:
Model Intelligence
+
Organizational Context
+
Tools
+
Workflow
=
Enterprise Agent
如果只有Model,
企业使用的仍然是:
通用智能。
加上组织Context以后,
它才开始变成:
企业执行能力。
十、真正的Agent化不是“每个人开一个Agent”
这是另一个容易出现的误区。
如果只是:
过去每人开一个ChatGPT窗口;
现在每人开一个Agent窗口,
企业结构并没有本质变化。
真正Agent化应该是:
Business Workflow
↓
Agent Capability
例如:
以前:
销售人员手动整理Lead。
后来:
销售人员让AI整理。
真正Agent化:
New Lead
↓
Agent
↓
Read CRM
↓
Research
↓
Qualification
↓
Draft Follow-up
↓
Human Review
AI不再只是一个:
Tool。
而成为Workflow中的:
Execution Node。
十一、这意味着企业需要重新定义“什么工作可以交给Agent”
不是所有工作都应该一次性自动化。
更合理的是先做任务分类。
第一类:低风险、可验证
例如:
格式整理;
信息分类;
测试运行;
状态汇总。
非常适合Agent。
第二类:有判断,但结果可以Review
例如:
代码修改;
研究分析;
报告生成;
客户分析。
可以:
Agent Execute
↓
Human Review
第三类:高风险、不可逆
例如:
生产数据删除;
重大财务决策;
高权限系统变更。
这类任务仍然应该:
Agent Prepare
↓
Human Approve
↓
System Execute
所以Agent Adoption真正需要建立的是:
Delegation Boundary。
十二、“敢不敢交给Agent”本质上取决于Verification
为什么企业不敢把更多任务交出去?
最核心的原因往往不是:
Agent完全不会做。
而是:
企业无法快速判断它做得对不对。
如果一个Agent生成一份200页报告,
但人仍然需要重新检查全部数据,
自动化价值非常有限。
如果Codex修改50个文件,
但开发者必须逐行重新理解,
同样如此。
所以真正推动Delegation扩大的关键是:
Execution
+
Verification
Agent必须能够提供:
测试;
Evidence;
来源;
Diff;
状态;
风险。
让人可以快速判断结果是否可信。
十三、没有Verification,Agent越强反而越可能增加人的负担
假设过去:
开发者自己一天完成3个任务。
现在Agent一天生成20个任务结果。
但每个都需要人工:
重新理解;
重新测试;
重新确认。
那么系统实际上把瓶颈从:
Code Generation
移动到了:
Human Review
所以:
Agent Throughput
提高,
不一定代表:
Organization Throughput
提高。
真正需要优化的是:
Task
↓
Agent
↓
Verified Result
↓
Fast Human Review
这条链。
十四、Agent真正改变的是“人的位置”
传统Workflow:
Human
↓
Execute
↓
Execute
↓
Execute
↓
Decision
Agent Workflow:
Human
↓
Define Goal
↓
Agent Executes
↓
Verification
↓
Human Decision
人的工作并没有消失。
但位置开始上移。
从:
Operator
逐渐变成:
Supervisor。
人负责:
目标;
边界;
风险;
异常;
最终判断。
Agent负责:
大量中间执行。
十五、RingCentral的案例为什么值得关注?
OpenAI在8月12日公布的RingCentral案例很能说明这个变化。
其AI-Native Challenge并不是只让员工体验ChatGPT,而是要求参与者借助ChatGPT Work和Codex完成完整的端到端项目,包括规划、实现、测试、文档、CI/CD和迭代;几乎所有参与者都建立出了可运行Repository。
这背后的关键不是:
AI会写代码。
而是员工开始尝试:
把完整生命周期交给AI协作完成。
这就是从:
Tool Adoption
走向:
Task Delegation。
十六、甚至非技术部门也在进入同一条路径
RingCentral的PMO团队还使用ChatGPT Work把原本分散在Jira、Google Sheets、CRM和其他系统里的状态信息连接起来,用于状态跟踪、报告、发布治理和知识交接。团队不再每次会议前手工询问“发生了什么”,而是让系统提前整理Blocker、Owner和Action。
这说明:
Agent化不是软件工程独有的问题。
其真正结构是:
Scattered Work
↓
AI Workflow
↓
Structured Outcome
↓
Human Decision
任何知识工作只要拥有:
重复步骤;
多个数据源;
明确结果,
都有可能逐渐进入这条路径。
十七、企业真正的AI壁垒可能变成“Delegation Rate”
未来也许可以出现一个很有意思的企业指标:
AI Delegation Rate。
例如:
AI参与任务
────────────
全部知识任务
还可以进一步看:
Agent Completed Tasks
──────────────────
AI Assisted Tasks
真正成熟的企业可能不是:
员工每天发送最多Prompt。
而是:
越来越多重复、明确、可验证的真实工作,不再需要人逐步操作。
十八、但Delegation Rate绝对不是越高越好
这一点也必须说清楚。
如果盲目追求:
100% Agent Automation
非常危险。
因为不同任务:
风险;
可验证程度;
业务影响
完全不同。
真正应该优化的是:
Appropriate Delegation。
也就是:
Low Risk
→ Agent
Medium Risk
→ Agent + Review
High Risk
→ Agent + Approval + Human Decision
所以Agent规模化不是:
减少人。
而是:
重新设计人应该出现在哪里。
十九、这会逼企业重新建设权限体系
一旦Agent真正承担Task,
企业必须回答:
Agent可以看什么?
Agent可以修改什么?
哪些Action可以自动执行?
哪些必须审批?
谁对Agent结果负责?
这就是为什么:
Sandbox;
Approval;
Identity;
Audit;
Governance
会越来越重要。
因为“敢不敢交任务”最终不是信任模型。
而是:
信任整个控制体系。
二十、所以真正的企业Agent能力不是“更聪明”,而是“更可信”
一个Agent可能非常聪明。
但如果:
无法限制权限;
结果无法验证;
失败无法恢复;
操作不可审计,
企业不会把核心工作交给它。
另一个Agent能力稍弱。
但拥有:
Clear Boundary
+
Verification
+
Approval
+
Audit
+
Recovery
企业反而更敢使用。
所以企业Agent真正需要优化的是:
Capability
×
Trust
而不是:
Capability Only
二十一、企业AI的竞争正在从Model Adoption走向Operating Model
早期企业竞争:
谁先接入GPT?
然后:
谁的员工用得更多?
下一阶段可能是:
谁把更多:
Context
Tools
Skills
Agent
Verification
真正组合进业务Workflow。
最终形成:
Business Goal
↓
Agent Workflow
↓
Tools
↓
Execution
↓
Verification
↓
Human Decision
这已经不是简单的软件使用问题。
而是:
Operating Model。
二十二、未来“不会用AI”的定义也会改变
过去不会用AI可能意味着:
不会写Prompt。
未来可能变成:
不知道哪些工作应该交给Agent。
或者:
不知道如何定义目标、边界和验证。
这其实是一个非常大的能力迁移。
个人AI时代的重要技能是:
Prompting。
Agent时代可能更重要的是:
Task Design
Delegation
Verification
Supervision
这四个能力。
二十三、为什么现在这个变化尤其值得关注?
因为从OpenAI最新企业数据来看,企业AI正在明显向更深、更Agent化的使用方式移动:Codex在企业ChatGPT与Codex合计输出中的占比已经达到64%,Frontier企业与典型企业之间的使用深度差距也从1月的2.6倍扩大到6月的8.3倍。
这说明:
AI访问权正在越来越普遍,但AI真正进入工作流的速度并不相同。
差距正在从:
有没有AI
变成:
AI到底承担多少工作。
二十四、真正的企业AI分水岭可能只有一个问题
未来判断一家企业AI成熟不成熟,
也许可以直接问:
如果今天把ChatGPT关闭,员工会不会只是写东西慢一点?
还是:
大量真实Workflow会直接停止运行?
如果只是前者,
AI仍然主要是:
Productivity Tool。
如果是后者,
AI已经逐渐成为:
Operational Infrastructure。
这两者之间,
就是非常大的成熟度差异。
最后
过去企业AI的第一阶段是:
Can Employees Use AI?
然后进入:
Do Employees Use AI?
下一阶段真正重要的问题可能已经变成:
Can We Delegate Real Work to AI?
也就是:
我们到底敢不敢把真实任务交给Agent?
这背后需要的并不是更好的Prompt。
而是一整套:
Task Boundary
Context
Tools
Permission
Execution
Verification
Review
Governance
当这些能力逐渐成熟以后,
企业AI才会真正从:
Assistance
进入:
Execution。
所以未来企业AI真正的分水岭,可能不是:
谁的员工最会使用ChatGPT。
而是:
谁能够把更多合适的真实工作,稳定、安全、可验证地交给Agent完成。
模型决定Agent:
能不能做。
组织能力决定企业:
敢不敢让它做。
而真正能够跨过这道门槛的企业,才可能从:
AI Adoption
真正走向:
Agentic Organization。
持续更新Codex、大模型开发相关技术内容。
长期使用各类代码大模型,整理了稳定的AI会员订阅渠道。
更多推荐


所有评论(0)