GPT-6 Astra 这几天讨论很多,不过我觉得光看跑分其实没什么意思。98%、99.9% 这种数字看着挺唬人,普通人最后还是会问一句:所以我拿它到底能干嘛?而且 Astra 是 9 月 3 日才正式发布的,现在还在分批开放,我觉得现阶段谁要说自己已经总结出了半年使用心得,多少有点扯。OpenAI 目前公开的定位也比较明确,它主要强化的是 coding、research、computer use,以及那种需要连续做很多步骤的工作。

我目前觉得最容易看出区别的,还是 Codex 这种场景。

以前让模型改一个项目,经常会出现一种很熟悉的情况:你让它“把登录系统从旧接口迁移到新接口,顺便把相关测试改掉”,它第一轮改登录,第二轮发现类型报错,第三轮修测试,第四轮又把前面一个东西改坏。最后你自己坐旁边像监工一样,一直说“继续”“看一下报错”“把这个也修了”。

Astra 比较值得期待的地方,是它明显在往“把整件事情做完”这个方向走。比如一个真实项目里,你可以让 Codex 先读仓库,找到认证相关代码,然后修改接口、检查调用链、跑测试、看报错,再根据测试结果继续修。它的 API 上下文现在是 105 万 token,这种比较大的仓库至少不用那么早开始丢上下文。

这个区别听起来没那么炸裂,但天天写代码的人应该能理解。如果原来一个任务你需要来回盯十几轮,现在能变成“我把需求说清楚,隔一会回来检查结果”,体验差距其实挺大的。尤其是那种不难,但是很烦的活,比如升级依赖、批量改 API、给老项目补测试、把几十个相似页面统一一下,我反而觉得比“让 AI 写一个贪吃蛇”更能体现模型水平。

另一个我觉得挺实际的场景,是 Excel、报告、PPT 这种工作。

假设老板给你三个 Excel、一份去年季度总结和一个公司的 PPT 模板,让你做这季度复盘。以前用 chatgpt,我一般会拆开来干:先分析数据,再让它找几个异常,再整理成文字,最后自己复制到 PPT,而且经常出现数据分析还行,一到做成最终文件就开始变得很“AI”,标题特别大,废话特别多,表格样式也跟原来的公司模板对不上。

Astra 这次其实专门强化了这一类工作。OpenAI 自己举的方向就是文档、电子表格、演示文稿以及多步骤专业工作,而且特别提到了按照已有模板生成内容。 所以我觉得一个更实际的用法可能是:把原始数据和去年模板扔进去,让它自己算同比环比,找异常,再把需要解释的几个数字写进报告,最后直接按照原模板生成 PPT。你最后当然还是要检查数据,但至少“分析—写结论—整理表格—做 PPT”这几个步骤,有机会从四件事变成一个任务。

这个对很多普通上班族可能比数学跑分有意义多了。你不需要会写提示词工程,也不用折腾什么 agent 框架,需求其实很朴素:“照去年这个格式,把今年的数据更新进去,重点解释华东区为什么掉了 12%。”如果最后出来的东西能直接改,而不是重新做,那就已经值很多时间了。

还有一个场景我自己会比较关注,就是查资料的时候让它真的去“做事情”,而不是给我一篇看起来很完整的答案。

比如我要研究五家公司的产品价格,以前的 chatgpt 很容易变成搜索几篇文章,然后整理一个表。但真正做研究经常没这么简单,有些价格藏在官网二级页面,有些要选套餐,有些需要看 FAQ,还有一些数据得从 PDF 里面找。你真正烦的是不停开网页、切页面、复制、核对。

Astra 这次 computer use 和 browsing 都属于重点提升方向。 如果它能自己打开这几家公司官网,找到对应套餐,把价格、限制、更新时间和来源整理出来,再做成 Excel,这种东西我觉得才算真正有用。不是回答得更像专家,而是原本我要点四十次鼠标的事情,它替我做掉了三十多次。

当然我现在不会因为 Astra 就建议所有人马上升级 pro。这个模型刚出来几天,而且目前还是分批开放,OpenAI 9 月 3 日的发布说明里也明确写着还没有完全 general availability。 如果你平时只是问问题、改改文字、偶尔让 AI 写点代码,plus 甚至原来的模型可能已经够用了。为了一个新模型马上充值、续费、升级会员,结果一个月只打开三次,其实挺浪费的。

反过来,如果你每天都在跑 codex,或者经常处理几十万字资料、大仓库、Excel、PPT、网页操作,这类人对 Astra 的感知可能会明显很多。尤其是 pro 用户,本来买的就不只是“回答更聪明”,更多是在买比较高的使用额度和复杂任务能力。如果你还准备找代充、代付之类的渠道去开通,我反而建议先确认自己账号有没有 Astra、当前订阅能不能用,再决定要不要折腾,别为了赶新模型先把钱充了。

至于 credits 消耗会不会很夸张,这个我暂时也比较保留。Astra API 官方价格是每百万输入 token 10 美元、输出 50 美元,而且超过 272K 输入之后价格还会提高,所以那种“把整个公司资料全部塞进去然后 max reasoning 跑半小时”的玩法,大概率不会便宜。 普通用户在 ChatGPT 会员里的实际额度体验,还得等大家多用一阵才能看出来。

所以如果一定让我举几个 Astra 比较实际的应用,我不会举“证明数学定理”这种离大多数人太远的例子。我更想看三个东西:能不能让 Codex 独立把一个真实项目改完,能不能把一堆 Excel 和旧模板直接做成能交差的报告,以及能不能自己在网页里连续操作几十步,最后给我一个靠谱结果。

这三个如果真做稳了,我觉得比跑分再涨 20% 都有意义。至少我自己用 AI,已经越来越不在意它能不能把某一道题答得特别漂亮了,我更在意的是:我把一个麻烦事交给它,它最后到底能不能真的给我做完。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐