两项 API 设置让 ARC-AGI-3 分数翻三倍——OpenAI 深度解析
事件概述
2026 年 7 月 29 日,OpenAI 发布了一篇博客,揭示了一项令人意外的发现:在 ARC-AGI-3 基准测试中,通过调整两个 API 设置,GPT-5.6 Sol 的得分从 13.3% 跃升至 38.3%,提升了近 3 倍,同时输出 token 数量减少了 6 倍。这一结果并非模型本身能力的提升,而是源于对评估工具链(harness)中两个关键配置的优化——保留推理(retained reasoning) 和 启用上下文压缩(compaction)。
ARC-AGI-3 是一个衡量 AI 代理学习与推理能力的 2D 解谜游戏基准。此前,GPT-5.6 Sol 在数学难题、复杂游戏(如宝可梦火红、尖塔奇兵)中表现出色,但在 ARC-AGI-3 上仅得 7.8%(公开集)。经过调查,OpenAI 发现问题出在评估工具链本身,而非模型。
关键技术点
官方工具链的缺陷
- 丢弃推理链:每次执行操作后,模型内部的私有推理内容(思考过程)被清空,导致模型每次不得不从头理解游戏状态,无法利用之前的推理积累。
- 滚动截断:当对话历史超过 175,000 字符时,最旧的消息被丢弃。这使得早期动作和观察逐渐消失,进一步削弱了模型对长期策略的保持能力。
OpenAI 的改进方案
- 保留推理:使用 OpenAI 的 Responses API(而非传统 Chat Completions API),通过传递前一个 response ID 自动保留跨工具调用和轮次的私有推理消息。恢复推理后,模型在每步操作前思考时间减少,且能基于过往计划采取连贯策略。
- 启用压缩(compaction):替代滚动截断,通过智能压缩历史内容来维持上下文完整性,而非粗暴删除。效果是模型在长序列中更有效地保留所学知识,并显著降低 token 消耗。
效果数据
- 官方工具链:GPT-5.6 Sol 在公开集中得 13.3%(RHAE 指标)。
- 启用保留推理 + 压缩后:得分 38.3%(人类平均约 48%)。
- 输出 token 减少 6 倍,推理效率大幅提升。
对数据科学或 AI Agent 落地的意义
这一发现对构建实用 AI Agent 具有直接指导意义:
- 记忆是 Agent 的核心能力:不保留推理链的 Agent 就像患有短期失忆症的人类,无法从过往思考中学习。在生产环境中(如 ChatGPT、Codex),OpenAI 默认保留了推理内容,这是这些产品能展现连续性的重要原因。
- 上下文管理策略至关重要:滚动截断是简单粗暴的上下文处理方式,容易丢失早期关键信息。压缩(compaction)提供了一种更智能的替代方案,在有限上下文窗口内保持策略一致性。
- 评估不能只看模型:基准测试结果往往包含工具链实现、API 设置、提示工程等隐性因素。数据科学家在对比模型或复现结果时,必须仔细检查评估环境的配置,否则可能得出错误结论。
我的技术点评
这篇文章揭示了当前 AI 评估领域一个普遍但容易被忽视的问题:评估结果反映的是“模型 + 工具链”的组合性能,而非模型本身。OpenAI 坦诚地展示了他们如何从“模型表现差”的表象出发,逐步定位到工具链的缺陷,并最终用工程手段解决了问题。
对开发者而言,这是一条宝贵的经验:部署 Agent 时,上下文架构与模型能力同等重要。保留推理和压缩是 OpenAI 自身产品中已经在使用的配置,现在通过 Responses API 对开发者开放。如果你正在构建依赖长期推理的 Agent(如自动化测试、游戏 AI、多步骤任务规划),建议优先采用这些实践。
当然,我们也应保持批判性:ARC-AGI-3 的原始工具链是为了公平比较各模型而设计的通用基线,其设计意图是暴露模型的短板。OpenAI 的改进虽然大幅提升了分数,但本质上是在模型能力不变的前提下,通过更贴近生产环境的配置释放了潜力。这提醒我们,针对不同目标(公平评估 vs. 最大化性能),可能需要不同的工具链设计。
原文链接
How enabling two settings tripled our scores on the ARC-AGI-3 benchmark - OpenAI
