OpenAI 发布 GPT-6.1 Sol:以 Astra 五分之一的价格提供接近前沿的 Agent 能力
事件概述
OpenAI 于 2026 年 9 月 29 日发布 GPT-6.1 Sol,定位为 GPT-6 Sol 的升级版本。官方给它的核心描述是:在 agentic coding、computer use 和专业工作三类任务上,智能水平接近 GPT-6 Astra,但标准 API 的输入与输出 token 价格只有 Astra 的五分之一。
价格之外,另一个关键数字是缓存输入:$0.10 / 百万 token,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。OpenAI 明确把这一定价策略与”可复用上下文的 Agent”绑定——缓存便宜,意味着多轮、长上下文的 Agent 循环在成本上更可行。
GPT-6.1 Sol 即日起向 ChatGPT Work 和 Codex 中的 Plus、Pro、Business、Enterprise、Edu 用户开放,但暂不提供 Chat 入口;开发者可通过 API 以 gpt-6.1-sol 访问。官方还预告了即将推出的 GPT-6.1 Sol Ultrafast,在 Codex 中 token 生成速度最高可达标准版的 8 倍。
关键技术点
编码能力
在 DeepSWE v1.1(评估真实代码库中的复杂软件工程任务)上,GPT-6.1 Sol 以约五分之一于 GPT-6 Astra 的成本达到与之相当的水平;同时,在更低的推理强度与成本下,比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
专业工作
- GDP.pdf(基于金融、医疗、法律等十个专业领域的复杂 PDF 回答专业问题,涉及表格、图表、示意图和细则):GPT-6.1 Sol 在测试的推理设置下得分高于带 fallback 的 Opus 5.5,且每任务成本不到后者一半;同时以约五分之一的每任务成本接近 GPT-6 Astra 的 SOTA 表现。
- AutomationBench 1.0.6(使用 47 个工具测试销售、营销、运营、支持、财务、HR 的端到端工作流):GPT-6.1 Sol 在中等推理强度下比 Opus 5.5 高 2.2 个百分点,成本约为其三分之一;同一设置下比 GPT-6 Sol 高 4.8 个百分点。原文特别注明,Claude Fable 5.1 的数据点低估了其实际成本,因为未计入 fallback 成本,而 fallback 在大约 40% 的任务上发生。
计算机使用
在 OSWorld 2.0 离线集(v2026.08.08 版本,报告 partial reward)上,最大推理强度下 GPT-6.1 Sol 比 GPT-6 Sol 高 7 个百分点,成本不到一半;距离 Astra 的分数仅差 2.1 个百分点,每任务成本约为其七分之一。
科学研究
Terminal-Bench Science 0.1(数据分析、仿真、定理证明等科学工作流)上,最大推理强度下 GPT-6.1 Sol 的分数是 GPT-6 Sol 的两倍以上,每任务成本不到一半:平均 $5.47/任务,对比 Opus 5.5 的 $23.21 与 Astra 的 $23.80,成本低 75% 以上。原文同时强调,Astra 仍以 68.1% 取得受测模型中的最高分,最困难的科研任务仍应使用 Astra。
事实性与安全性
事实性方面,GPT-6.1 Sol 相对 GPT-6 Sol 的最大提升出现在低推理强度下:含事实错误的回答占比从 11.4% 降至 7.7%,降幅约 32%。在各测试推理设置下,其错误率与 GPT-6 Astra 的差距保持在 1.9 个百分点以内,而每任务成本不到后者的五分之一。需要说明的是,该评估基于用户曾标记过事实错误的去标识化对话,属于刻意挑选的困难样本,官方承认不代表典型使用场景。
对齐与安全方面,官方称 GPT-6.1 Sol 相比 GPT-6 Sol 有实质改善,更接近 Astra:对自身局限更透明,更可靠地遵守用户意图与安全约束。其中一个具体数据点是”搜索工具损坏时的披露率”——GPT-6.1 Sol 未披露的比例为 2.1%,对比 GPT-6 Sol 的 4.9%、GPT-6 Astra 的 1.5%、GPT-6 Luna 的 28.7%。官方表示未观察到绕过自动安全审查的尝试,与 Astra 和 GPT-6 Sol 一致,完整细节见 GPT-6.1 Sol system card addendum。
对数据科学与 AI Agent 落地的意义
这份发布里真正值得数据科学团队关注的,不是单点 benchmark 的提升,而是成本曲线的位移。
第一,Agent 的工程瓶颈正在从”模型够不够聪明”转向”每任务成本能不能撑住业务闭环”。AutomationBench 测的是 47 个工具、跨六个业务域的端到端工作流,这类任务天然是长轨迹、多轮工具调用、大量上下文复用的形态。缓存输入 $0.10/百万 token 这个价位,直接决定了一个 Agent 能否把系统提示、工具定义、历史轨迹长期挂在上下文里而不失控成本——这正是原文将缓存定价与”复用上下文的 Agent”并列的原因。
第二,Terminal-Bench Science 的每任务成本对比($5.47 vs $23.21 / $23.80)说明,在数据分析、仿真这类科研与内部数据工作流中,单任务成本已经进入可以批量跑、可以大量重试的区间。对需要跑数千次实验的团队而言,成本的量级差异直接改变了可行方案集合。
第三,评测口径需要谨慎对待。DeepSWE、GDP.pdf、OSWorld 都是相当”硬”的评测,但官方也做了几处必要的免责说明:OSWorld 报的是离线集 partial reward;事实性评测来自”用户曾标记错误”的困难样本;Fable 5.1 的对比数据未计入约 40% 任务上的 fallback 成本。这些口径差异意味着跨厂商的数字不能直接横向相减。
我的技术点评
GPT-6.1 Sol 是一次非常典型的”能力下放”式发布:把上一代旗舰的接近水平,压缩到五分之一的推理成本。真正有信号的三个点:
- 缓存定价被提到了产品叙事的中心。$0.10/百万缓存输入、比自家上代再降 50%,这不是一个附带的定价调整,而是在明确告诉 Agent 开发者”上下文可以随便挂”。对于做多轮工具调用、RAG 长上下文、记忆系统的团队,这一项对总账单的影响往往大于输入/输出单价的边际变化。
- “接近 Astra 但不是 Astra”的边界被官方自己划清了。Terminal-Bench Science 上 Astra 仍是 68.1% 的最高分,官方明确建议最难的科研任务继续用 Astra。这种分层定价 + 分层能力的组合,实际上是在引导工作负载分配:日常 Agent 跑 Sol,硬骨头升级到 Astra。对成本敏感的工程团队,这比”最新模型全面最强”的叙事更有操作价值。
- 安全评估的口径值得肯定,也值得保留。披露搜索工具损坏率、明确标注评测样本来自”用户标记过错误”的困难对话、明确说这些不代表典型使用——至少在信息披露的透明度上,比只报一个漂亮总分要诚实。但也要注意,这些失败率评测都是”刻意构造以诱发失败”的场景,不能当作生产环境的事故率预期。
需要提醒的是,原文未说明 GPT-6.1 Sol 的模型规模、架构、上下文窗口长度、训练数据构成,也未说明它与 GPT-6 Sol、GPT-6 Astra 之间的具体技术关系(是蒸馏、继续训练还是同代不同算力配置)。Astra 与 Sol 的”智能差距”只是在具体 benchmark 上被量化,而不是一个统一的智能指标。另外,Ultrafast 版本只给出了”最高 8 倍”这一相对速度,原文未说明其定价是否与标准版一致,也未说明限流或可用范围。
对大多数团队来说,务实的做法是:把 GPT-6.1 Sol 放到已有的 Agent 评测集上重跑一遍,重点看每任务成本和失败模式,而不是只看公开 benchmark 的百分点。价格优势是确定的,能力是否匹配你的具体工作流,仍然要靠自己的评测集说话。
