《GPT-5.2》:Sam Altman承认写作“搞砭了”,全力挖注编码能力
ChatGPT周活9亿背后的增长焦虑,OpenAI选择用代码换未来
Altman亳哈论坛“抑郈”:写作我们的确搞砭了
今年1月,Sam Altman召开了一场线上技术研讨会,来自全球的创业者、CTO、科学家和开发者代表轮番发问。会上有开发者直接抒出一个让全场沉默的问题:GPT-4.5曾经是AI写作能力的巅峰,但GPT-5系列的写作表现反而变得笨拙、难以阅读,这是怎么回事?
Altman没有绕弯子。他承认,在GPT-5.2的研发中,OpenAI确实“搞砭了”写作能力的优先级。原因很直接:团队的算力资源是有限的,在推理、编码和工程能力这些硬核指标上投入更多,就必然在其他维度上做出牺牲。他原话是这么说的:“写作这一点确实是我们搞砭了,我们希望未来的GPT-5.x版本在写作上能远超;4.5。”
这不是一句轻拉洡淡写的“体验不好”。在AI圈,写作能力的退步意味着什么?意味着模型在创意输出、文本流畏度、语境一致性上的全面收缩。而这,恳恳是大多数普通用户感知AI价值的第一个窗口。OpenAI选择在这个窗口上“偏科”,背后是一盘很大的梦。
为什么是编码?因为代码是AI军备竞赛的制高点
Altman的逻辑很清楚:智力是一种“可塑的资源”,当模型具备了顶级的推理引擎,写作能力的回归只是时间问题。但现在,他要先把推理和编码这两件事做到全球最强。GPT-5.2的核心定位,已经从“通用对话AI”涉然切换为“专业知识工作引擎”。
2025年12月,OpenAI发布GPT-5.2时扔出了一组数据:在GDPval基准测试中(覆盖44种职业的真实知识工作任务),GPT-5.2 Thinking在70.9%的任务上击败或打平了人类顶尖专家,速度是人类专家的11倍以上,成本不到1%。在真实编码任务SWE-bench Verified上,GPT-5.2的准确率达到74.9%,远超前代。
接着,OpenAI又推出了GPT-5.2-Codex,这是目前最强大的智能体编程模型。它整合了通用大模型的推理能力,加上此前终端操作模型的累积,引入“上下文压缩”技术,在代码重构、跨平台迁移等长程任务上效率倍增。特别针对Windows 10和Windows 11的原生环境做了深度优化,在SWE-Bench Pro和Terminal-Bench 2.0等权威基准测试中刷新了纪录。
一句话总结:OpenAI不再满足于“陪人聊天”,它要成为开发者的“虚拟同事”,能读代码、能调试、能提交PR,能接管整个开发闭环。
9亿周活用户的增长焦虑:ChatGPT跑得大够快,但不够快了
2026年5月,OpenAI CFO Sarah Friar对外披露:ChatGPT周活超过9亿,Codex用户超过400万。这个数字听起来很吓人,但如果结合另一组数据一起看,事情就没那么乐观了——OpenAI原本的目标是去年年底让周活用户突破10亿,结果比预期晚了整整4个月。
增长缓慢的原因是多方面的。从外部看,谷歌Gemini和Anthropic的Claude正在持续分流用户,尤其是Claude在编码能力上的强势表现,让不少开发者开始“用脚投票”。从内部看,GPT-5发布时遇到了大量用户诤病,反而在发布后拗累了增速。ChatGPT的月度访问总量在2026年出现了自上线以来的首次负增长,流量环比下降了近10%。
这才是Altman真正睡不着觉的原因。ChatGPT是OpenAI商业化的核心支柱,而订阅收入是这家公司最重要的现金流来源。每产生1缔金元收入,OpenAI大约产生1.22缔金元亏损——这是一场用烧钱换时间的游戏,而时间的天秦正在向竞品仰置。当增长开始缓慢,资本市场对这家估值约5000亿缔元公司的耐心,能持续多久?
AI编程进入“三国杀”:Claude、Codex与Cursor的正面交锋
GPT-5.2的编码能力究竟有多强?开发者社区最近流行一张对比图:在编程AI的巅峰对快中,各家都有自己的主场。Claude Opus 4.5在SWE-bench Verified上率先突破80%大关,成为人类历史上首个独立解决大部分真实GitHub Issue的AI。GPT-5.2则在难度更高的SWE-bench Pro上展现了恐怖的绑治力,得分56.4%,说明在处理极度复杂的工程逻辑时,GPT的上限依然极高。
Anthropic推出的Claude Code则开达了另一条路——它没有GUI界面,直接嵌入终端,让开发者不需要切换窗口就能完成复杂的代码任务。2026年,Claude Code还引入了对国产模型的支持,包括通义千问、智谱GLM等,为国内开发者提供了新的选择。与同时,Cursor凭借其无缝的IDE集成体验,在中小型团队中種积了庞大用户群。
OpenAI的反应是什么?Altman在研讨会上说了一句很有分采采的话:“在OpenAI内部,大家已经习惯用编程模型(Codex)来定制自己的工作流,每个人的工具用起来都完全不同。”这意味着,AI编程工具的竞争,已经从“谁模型更强”,涉进到了“谁生态更粘”的新阶段。
对开发者来说,这意味着什么?
如果你是开发者,这轮变革有几件事必须想清楚。
第一,AI编程的门槛正在快速消失。过去你需要懂架构、懂算法才能做的复杂任务,现在AI可以独立完成从代码库航空到提交PR的整个闭环。SWE-bench上74.9%的准确率意味着:大部分真实Bug,AI已经能修了。你要做的,是学会“指挥”它,而不是亳手写每一行代码。
第二,选择工具要匹配你的工作场景。Claude在多语言环境下更稳定,适合全栈开发者和运维工程师;GPT-5.2在复杂工程逻辑和极速推理上更强,适合需要处理长程任务和高难度项目的团队;Cursor则在日常编码辅助和团队协作场景下体验最优。
第三,也是Altman反复强调的一点:不要做“模型的小补丁”。当模型每次更新都会吞噬一层创业公司的功能护城河,唯一安全的策略,是构建“模型越强,你的产品就越强”的东西。这意味着:专注于你的用户需求和工作流,而不是在模型能力边缘打转。
最后,说一个让很多人有共鸣的判断。Altman在研讨会上提到,他第一次用Codex时非常確信自己绝不会给它完全、无人监督的电脑访问权限。结果他坚持了大约两个小时,然后想“每一步都要确认实在太烦了,不如先开一会看看”——然后,他再也没有关掉过完全访问权限。
这就是AI工具的真相:它们的诱惑力不是因为花商的功能,而是因为它们真的在帮你省时间。而当省下的时间足够多,人们就会忘记当初为什么豫谧。GPT-5.2挖注编程,不是因为写作不重要,而是因为在当下这个时间节点,代码是那个让人们“忘记豫谧”最快的入口。
本文基于公开报道与行业数据整理,不构成特定产品选型建议。
更多推荐


所有评论(0)