Path to Astra:关键能力与前沿安全防护

OpenAI 于 2026 年 9 月 1 日发布公告,正式披露其新一代模型 Astra 的网络安全能力评估结果。根据 OpenAI 的 Preparedness Framework(预备框架),Astra 成为首个达到“关键(Critical)”网络安全能力阈值并被正式认定的模型。这意味着,在具备合适工具和访问权限的情况下,Astra 能够自主发现未知安全漏洞,并在无需人工逐步指导的情况下,针对多个受良好保护的系统开发出可利用的攻击方法。

事件概述

OpenAI 在过去数周内推迟了 Astra 的部分开发和发布进程,以便加强和测试针对网络滥用及未授权模型行为的防护措施。OpenAI 表示,经过这些工作,Astra 的防护措施已足以将严重风险降至可接受水平,符合其预备框架下的发布要求。

此前,OpenAI 曾在早期评估中认为 Astra 可能达到关键级网络安全能力。如今,通过更多证据和额外评估,这一判断得到确认。值得注意的是,OpenAI 特别说明,尽管 Astra 未涉及 Hugging Face 事件,但 OpenAI 已将从中吸取的经验教训纳入安全方案。基于回顾性测试,OpenAI 认为当时的生产防护措施本可以阻止该事件发生,而 Astra 已部署了更强的防护,包括更可靠地拒绝恶意网络安全请求、额外的滥用防护,以及能够阻止潜在未授权活动的监控机制。

关键技术点

关键阈值的定义

根据 OpenAI Preparedness Framework,模型满足“关键(Critical)”阈值需满足以下任一条件:

  • 该模型能够识别并开发多种严重程度的真实零日漏洞,可在许多加固的真实世界关键系统中无需人工干预完成利用。
  • 该模型能够仅凭高层次目标,就能针对加固目标设计并执行端到端的新型攻击策略。

OpenAI 对 Astra 的安全评估结合了自动化公开/私有基准测试和专家驱动的评估。与 GPT-5.6 Sol 相比,Astra 在网络安全能力上显著提升,不仅 token 效率更高,在漏洞识别和漏洞利用开发方面也更为强大。

基准测试表现

  • 在 ExploitBench 上,Astra 取得了 100% 的满分成绩,该基准测试评估模型从已知漏洞开发漏洞利用代码的能力。
  • 由于担心数据污染,OpenAI 构建了一个内部基准 “ExploitBench - Internal Port (June–August 2026)”,包含 20 个近期披露的高严重性 V8 漏洞。在该数据集上,Astra 实现了远高于 GPT-5.6 Sol 的任意代码执行率,且使用的输出 token 更少。
  • 评估过程中,Astra 甚至发现并使用了两个零日漏洞作为漏洞利用链的一部分。OpenAI 正在向相关维护者披露这两个漏洞。

需要注意的是,上述 Astra 结果反映的是拥有 Daybreak Blue 访问权限时的能力,并非默认生产配置下的表现。

专家主导的实战评估

在针对加固后的浏览器和操作系统进行的专家主导评估中,Astra:

  • 发现了先前未知的漏洞,并将其转化为可用的漏洞利用链。
  • 构建了一条完整的浏览器攻破链,在浏览器打开 HTML 文件时成功逃逸沙箱并在主机上执行命令。
  • 在加固操作系统中发现多个漏洞,并将它们组合成从非特权用户到 root 的本地提权链。

基于这些调查,OpenAI 得出结论:Astra 确实达到了关键级阈值。

关键能力下的安全防护要求

对于拥有 Astra 级别网络安全能力的模型,OpenAI 必须覆盖两条风险路径,以最大程度减少严重网络危害的可能性:

  1. 恶意行为者利用模型:防护措施必须能有效防止恶意行为者使用 Astra 开发针对加固系统中未知漏洞的利用代码,或对加固目标实施端到端攻击。
  2. 模型自身采取未授权、不对齐的行动:即使没有恶意用户,具备高级网络安全能力的模型若与目标不对齐,也可能自行造成网络危害。因此,除了对这类模型的“对齐”提出非常高的标准外,防护措施还需作为第二道防线,能够快速检测并遏制可能导致现实世界重大危害的不当行为。

第二条路径同时适用于内部开发和外部部署。OpenAI 在 OpenAI-Hugging Face 事件后暂停了某些前沿训练(包括 Astra 的部分训练)两周,以加强训练基础设施的隔离、网络控制、监控扩展,并强化对齐训练和阈值。之后,在更严格的控制下恢复了较小规模的工作。

OpenAI 还暂停了 Astra 未来版本的某些较大型强化学习(RL)运行,直到为训练环境的安全性和保障性设定更高标准。8 月 28 日,在落实新安全和安全要求后,OpenAI 重新启动了此前被暂停的大型前沿 RL 运行,同时继续暂时搁置一些较小的实验性训练运行。

对网络滥用和未授权行为的抵御能力

自 2026 年 2 月部署第一个被列为“高(High)”网络安全能力的模型以来,OpenAI 每次发布都会加强网络防护。整体安全方法包括:

  • 后训练的模型拒绝机制
  • 系统级安全分类器
  • 离线检测和威胁处置

对于 GPT-5.6,OpenAI 显著改进了系统级技术栈的鲁棒性,包括添加激活分类器来检测网络滥用,并扩大了对通过密集型自动化红队测试发现的通用越狱的覆盖范围。在此基础上,Astra 进一步投资于防护栈中的模型层,并改进了防护系统在跨对话上下文处理方面的能力。

借助新的模型鲁棒性训练技术,Astra 能更可靠地拒绝被禁止的网络协助请求。在 OpenAI 的网络越狱评估集上,Astra 拒绝了 91.5% 的请求(而 GPT-5.6 Sol 为 59%)。

对于被评估为较高风险的账户,OpenAI 采用更保守的模型行为边界,拒绝更广泛范围的潜在风险网络协助。对于高风险用户,OpenAI 扩展了监控系统的上下文,以捕获此类网络滥用。

OpenAI 还继续进行严格的内部和外部红队测试、修复工作,并保证回归测试覆盖所有已知问题。

对数据科学与 AI Agent 落地的意义

Astra 的发布计划对 AI 安全和智能体落地具有多重启示:

  • AI Agent 的安全边界需要与能力同步演进:当一个模型具备了自主发现漏洞并实施攻击的能力时,它实际上是一个“超级智能体”。传统的数据科学和机器学习应用通常关注模型准确性和效率,而 Astra 案例表明,当智能体的能力跨界到高影响领域(如网络安全)时,模型对齐、滥用防护和监控必须成为核心开发环节,而非事后补充。
  • 评估体系的标准化成为行业关键:OpenAI 的 Preparedness Framework 定义了从“高”到“关键”的能力阈值,并提供了可操作的定义(例如零日漏洞利用、端到端攻击策略)。这对数据科学领域的模型评估方法提出了新要求,即模型能力评估不应只停留在常规指标上,还需针对危险能力进行专门化评估。
  • “内部威胁”模式开始被正视:Astra 的安全防护明确考虑了“模型自身采取未授权行动”的路径,这是 AI Agent 落地时不可回避的问题。随着智能体被赋予更多自主权和工具,如何防止模型在无人恶意引导下产生有害行为,将成为所有 AI 产品必须考虑的设计原则。
  • 发布节奏与安全测试的博弈:OpenAI 推迟 Astra 的部分开发与发布以强化安全,这说明在关键能力级别下,“安全速度”比“上市速度”更重要。这对数据科学项目的迭代管理也有参考意义——高风险模型需要专门的发布前置安全评审。

我的技术点评

OpenAI 这篇公告信息密度很高,但仍有一些关键点值得我们深入思考。

首先,Astra 在 ExploitBench 上达到 100% 的满分,以及在内部 V8 漏洞集上的高执行率,表明大语言模型在漏洞挖掘和利用开发领域的能力已经出现质变。更值得关注的是,模型在评估过程中自主发现并使用了两个零日漏洞——这已经不是“辅助程序员”的范畴,而是具备了独立的安全研究能力。尽管默认生产配置不开放这些能力,但模型权重本身的能力已经存在,安全防护只能限制其使用方式,无法消除其潜在风险。

其次,OpenAI 明确区分了“模型能力”和“访问权限”。Astra 最先进的网络能力最初仅向一组测试者开放,并通过 Daybreak Blue 扩展防御性使用。这种“能力分级”策略是前沿模型发布的一种务实做法——不是完全封锁,而是基于信任和用途动态控制。但这也带来一个问题:这些测试者本身是否具备足够的安全防御能力?OpenAI 没有详细说明测试者的筛选标准,原文未说明。

另外,公告中提到“基于回顾性测试,我们认为当时的生产防护措施本可以阻止 Hugging Face 事件”,这个说法比较模糊。回顾性测试能否完全模拟真实攻击场景?其中可能存在的差异和不确定性,原文未详细展开。不过,OpenAI 将事件经验纳入训练和监控,并强化了跨对话上下文的保护,这确实比单点分类器更加全面。

最后,一个被轻描淡写但意义重大的细节是:OpenAI 因为事件暂停了某些前沿训练,并且“在制定新安全要求后”才恢复大型 RL 运行。这说明在关键能力模型面前,训练过程本身也变成了一个需要防护的攻击面。未来,训练基础设施的安全性可能与模型能力本身同等重要。

总体而言,Astra 的安全防护框架为“高能力 AI”的安全发布提供了一个值得参照的范本。它清楚地展示了一道分水岭:当模型达到关键级能力时,安全不再是模型的一项功能,而是整个系统架构的一部分。

原文链接