在官方测试框架下,GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有 13.3%;但换用与 ChatGPT、Codex 更接近的运行方式后,得分直接提升至 38.3%,约提升 3 倍。

今天,对技术细节一直讳莫如深的 OpenAI,终于 OpenAI 了一把。

按照 Sam Altman 的说法,他们是公布了一篇:goblin-level 的 blog。

他们只改变了两个设置就能让模型在 ARC-AGI-3 的得分提升 3 倍!

图片

  • 链接:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

在官方测试框架下,GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有 13.3%;但换用与 ChatGPT、Codex 更接近的运行方式后,得分直接提升至 38.3%,约提升 3 倍。

在此期间,模型本身并没有发生变化,只是改变了两个设置。

OpenAI 发现,长期运行的 Agent 如果无法保留自己的推理过程,也无法有效压缩历史上下文,就很难基于过去经验持续学习。

这也带来了一个新的问题:当 AI Agent 开始执行越来越长、越来越复杂的任务时,我们评测的究竟是模型本身,还是模型所处的运行环境?

以下是博客内容。

一段加速播放的视频,展示了 GPT-5.6 Sol 尝试解决 ARC-AGI-3 基准测试中谜题的过程。左侧为官方测试框架(official harness),右侧为 Responses API 测试框架,该框架能够保留推理过程并支持上下文压缩。在该游戏的排行榜上,目前没有任何前沿模型能够通过第一关之后的关卡。而在 Responses API 测试框架下,GPT-5.6 Sol 成功解决了全部六个关卡。

ARC-AGI-3:测试 AI 如何学习陌生游戏

ARC-AGI-3 是一个用于评估 AI Agent 学习和推理能力的基准测试。

与传统问答任务不同,ARC-AGI-3 不会直接告诉模型游戏规则,而是让 Agent 自己探索陌生的二维游戏环境,通过观察结果和不断尝试,逐渐理解游戏机制。

因此,它测试的并非单次回答能力,而是 AI 在长期交互过程中的学习能力。

ARC-AGI-3 采用了一个较为通用的测试框架,不包含额外工具或针对特定模型的优化。

ARC 团队认为,这样可以更公平地比较不同模型,同时暴露模型在推理和学习上的不足。

但 OpenAI 在分析 GPT-5.6 Sol 的测试过程时发现,通用测试框架中的一些设计,可能影响了模型发挥。

GPT-5.6 Sol 为什么表现不佳?

最初,GPT-5.6 Sol 在 ARC-AGI-3 上的表现让 OpenAI 感到困惑。

此前,GPT-5.6 Sol 已经解决了一些长期存在的数学开放问题,也能够完成《宝可梦 火红》《杀戮尖塔》等复杂游戏任务。

但在 ARC-AGI-3 中,它的表现却明显下降。

OpenAI 检查模型运行过程后发现,问题并不完全来自模型能力,而是测试框架限制了 Agent 的长期记忆。

第一个问题:推理过程被丢弃。

GPT-5.6 Sol 在执行每一次游戏操作后,之前产生的私有推理过程都会被删除。

这意味着,每执行一个新动作,模型都需要重新理解当前游戏状态。

虽然它还能看到过去执行过的操作记录和简单说明,但无法访问此前形成的计划、规律判断以及行动背后的思考过程。

第二个问题:历史上下文被截断。

ARC-AGI-3 测试框架采用滚动截断机制。当上下文超过限制后,最早的消息会被删除。

因此,随着游戏持续进行,GPT-5.6 Sol 不仅无法记住过去的思考,也会逐渐失去对早期行动和观察结果的记忆。

OpenAI 认为,这两个因素共同导致模型难以在长时间任务中积累经验。

它就像一个玩家,每走一步都需要重新理解游戏规则,同时还会忘记自己之前尝试过什么。

两个设置,得分提高 3 倍

为了解决这一问题,OpenAI 使用了与 ChatGPT 和 Codex 更接近的运行方式,重新实现了 ARC-AGI-3 测试框架。

其中关键是两个 API 设置:

保留推理过程(retained reasoning)

OpenAI 的模型在生成回答或调用工具之前,会产生内部推理过程。在 ChatGPT 和 Codex 中,这些推理信息会作为上下文的一部分保留下来。

开启该设置后,GPT-5.6 Sol 不需要每一步都重新分析游戏,而是可以利用过去形成的理解继续行动。

OpenAI 观察发现,保留推理后,模型每次行动前需要的思考时间减少,同时能够基于过去经验形成更加连贯的策略。

上下文压缩(compaction)

此前 ARC-AGI-3 使用滚动截断方式解决上下文长度问题,即直接删除最早的信息。但这种方式会导致模型丢失关键历史。

上下文压缩则会对已有信息进行整理,在限制上下文规模的同时保留重要内容。

启用上下文压缩后,GPT-5.6 Sol 能够在更长时间运行中保持对游戏规律的理解,并减少输出 token。

图片

如图所示,在长时间任务中,GPT-5.6 Sol 会将此前累积的推理过程压缩为摘要,并继续基于压缩后的上下文进行推理,从而避免随着任务增长丢失早期信息。

中间列展示了两种测试框架对模型上下文窗口使用方式的差异。由于更改设置后能够更好地记住过去的信息,它在每次行动时所需的思考更少,执行速度也明显更快。

最终,在两个设置共同作用下:

  • GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的成绩从 13.3% 提升至 38.3%,约提升 3 倍。
  • 与此同时,模型输出 token 消耗降低了约 6 倍。

飞书文档 - 图片

写在最后

OpenAI 表示,这次实验希望提醒开发者,基准测试很少只测量模型本身。它们同时也受到 API 设置、测试框架设计以及提示词方式的影响。

对于希望最大化模型性能的 API 开发者,OpenAI 建议采用与自身产品一致的配置;对于模型之间的比较,OpenAI 也建议参考采用这些设置的评测结果,因为它们更接近 ChatGPT 和 Codex 中的真实使用环境。

ARC-AGI-3 为了保证评测公平,采用了一个统一、简化的测试框架,但这个框架没有考虑到 Agent 产品中的一些关键能力(如推理保留、上下文压缩),导致模型表现被低估。

这么说来,未来衡量模型能力,可能还需要一个更接近使用场景的评测体系。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐