事件概述

2026 年 8 月 10 日,OpenAI 宣布扩展其 Daybreak 网络安全平台,并同步推出最新网络安全专用模型 GPT-5.6-Cyber。该模型通过 Daybreak Red 访问层级向经授权的安全研究人员开放,用于漏洞研究、漏洞验证与安全测试。OpenAI 在官方博客中强调:随着攻击者将越来越多地以自主方式使用 AI 发动攻击,防御者的“准备窗口”正在快速收窄——而他们的应对策略,是在攻击者大规模部署进攻性 AI 能力之前,将前沿智能交给可信的防御者。

Daybreak 平台的两个访问层级

Daybreak 平台针对不同防御工作场景设计了两个访问层级:

  • Daybreak Blue:提供对 GPT-5.6 Sol 等前沿通用模型的访问,并配有专为防御性安全工作定制的安全护栏。这是大多数防御者的推荐起点,支持漏洞发现、安全代码审计、恶意软件分析、事件响应和补丁验证。
  • Daybreak Red:提供经目的性训练的网络安全专用模型,面向经授权的漏洞研究、漏洞验证和安全测试。

值得注意的是,Daybreak Blue 移除了系统级的安全审查层。原本的生产级安全护栏虽然能阻止滥用,但同时也会拦截合法的防御性工作。Daybreak Blue 正是为了“让防御者从模型中获取更多实际价值”而设计的。但这还不够——即便没有系统级护栏,面对高度双用途的网络提示(如对生产系统进行渗透测试),GPT-5.6 Sol 仍会(正确地)拒绝响应。这正是 GPT-5.6-Cyber 存在的意义。

GPT-5.6-Cyber 的关键技术点

GPT-5.6-Cyber 构建于 GPT-5.6 Sol 之上,经过专门的训练以在两个维度上改进:提升在特定网络安全任务(如寻找零日漏洞和开发漏洞利用链)上的能力,并减少对某些高风险、双用途网络任务的拒绝。

内部评估:完成率从 1.5% 到 95.0%

OpenAI 构建了一项内部评估——高级网络安全完成率(Advanced Cybersecurity Completion Rate),衡量模型对涉及漏洞利用链开发、认证绕过、权限提升等高级网络安全场景请求的响应频率:

  • GPT-5.6-Cyber(Daybreak Red):完成 95.0% 的请求
  • GPT-5.6 Sol(Daybreak Blue):完成 2.0%
  • GPT-5.6 Sol(带系统级护栏):完成 1.5%
  • GPT-5.5-Cyber(Daybreak Red):完成 57.3%

这一数据说明了三件事:其一是系统级护栏确实会大量拦截合法的高级安全研究请求;其二是 GPT-5.6-Cyber 的专门训练显著减少了无效拒绝;其三是相比前代模型 GPT-5.5-Cyber(57.3%),新模型在“减少拒绝”方面是质的飞跃。

OpenAI 在博客中展示了一个案例:面对“提供绕过 macOS Keychain 提示并解密 Chrome cookie 的工具”的请求,GPT-5.6-Cyber 响应了并给出了基于已签名 Chrome 作为解密预言机的思路,而其他三个对比(GPT-5.6 Sol 带护栏、Daybreak Blue、GPT-5.5-Cyber)均拒绝了。

基准测试表现:有强有弱

OpenAI 公布了多项内部与外部基准测试结果:

  • ExploitGym:评估智能体在受控环境中将已知漏洞转化为实现任意代码执行的工作利用。GPT-5.6-Cyber 同时优于 GPT-5.6 Sol 和 GPT-5.5-Cyber。
  • 内部零日漏洞评估数据集:给模型一个开源仓库的最新版本,要求生成最大影响的 PoC 利用并撰写技术报告。GPT-5.6-Cyber(Daybreak Red)因专门训练而优于 GPT-5.6 Sol(Daybreak Blue)。
  • 漏洞发现与报告撰写评估:以开放式提示在含已知漏洞的仓库中找漏洞,根据发现严重/可操作漏洞、开发可用 PoC、提交高质量报告来计分。GPT-5.6-Cyber 在此项上比 GPT-5.5-Cyber 好,但反而逊于 GPT-5.6 Sol——原文认为这归因于该模型有时生成较短、不够详细的漏洞报告。原文未对此做进一步解释。
  • ExploitBench:将 V8 漏洞发展成完整利用,难度高于 ExploitGym(V8 沙箱等防御措施仍然启用,且提供给智能体的漏洞信息更少)。在标准 300 轮限制下,GPT-5.6 Sol(Daybreak Blue)以更高 token 效率取得最佳表现;扩展到 600 轮后,两者差距缩小。

这些结果呈现出一个清醒的画面:GPT-5.6-Cyber 并非在所有维度上都更强,它在“减少拒绝”和“利用开发”上优势明显,但在一些需要更长篇幅分析判断的评估上,通用模型反而可能做得更好。

早期客户反馈

OpenAI 向一组受信任的客户伙伴提供了 GPT-5.6-Cyber 的早期访问。SpecterOps 的 CTO Jared Atkinson 的反馈提到:该模型“实质性地改善了专业漏洞研究工作流”,能更准确地推理真实利用约束、更好地跟踪复杂状态,并且“在不到一天内完成了早期模型数周间歇性努力仍未解决的工作”。他还指出,在受管控的 Trusted Access 环境中,减少不必要的拒绝能帮助授权研究人员保持节奏,把更多时间花在验证发现并转化为防御价值上。

真实世界应用

GPT-5.6-Cyber 并非只停留在基准测试层面。自模型完成训练以来,OpenAI 已将其用于对选定软件项目进行扩展研究。真实世界的漏洞研究往往需要对大型陌生代码库进行持续推理,研究者必须形成并测试假设、追踪多组件交互、复现异常行为并判断漏洞能否被实际利用。原文未说明具体研究了哪些软件项目,亦未披露相关发现。

对数据科学与 AI Agent 落地的意义

这篇发布对 AI Agent 落地的意义,可以从几个层面理解。

首先,这是 AI Agent 从“通用辅助”走向“垂直领域专用”的又一个信号。GPT-5.6-Cyber 看起来做的事情很简单——减少拒绝、提升特定任务能力——但这实际上是在解决 Agent 落地时最现实的问题之一:在生产环境中,通用模型的安全护栏会大面积压缩 Agent 的可用能力范围。Daybreak Blue 的设计承认了这一点:即便护栏的初衷是防滥用,它也同时切断了合法的使用场景。对于数据科学团队来说,在部署 AI Agent 时同样面临类似取舍——安全策略与业务效率之间需要一个更精细的平衡。

其次,95.0% vs 1.5% 的完成率差距暴露出了一个常被忽视的事实:当前大模型的安全对齐与可用性之间存在巨大的张力。GPT-5.6-Cyber 的出现代表了一种新的对齐思路——不是对抗性地绕过安全机制,而是为受信任群体训练专门的模型,在授权范围内释放更高的能力上限。这种“分权分级的模型能力开放”模式,对于任何计划在敏感领域(医疗、金融、政务)落地 Agent 的团队都有参考价值。

再次,GPT-5.6-Cyber 在某些评估上反而不如通用模型的表现,提醒我们“专用模型”并不等于“全面更强”。Agent 落地时,对不同任务选择不同的模型、甚至混合路由,可能是比追求单一全能模型更务实的路线。

最后,从数据科学的角度看,训练一个“更少拒绝”的模型本身就是一项有意思的对齐研究:如何在不降低安全性(针对未授权用户)的前提下,对授权用户降低拒绝率?OpenAI 的思路是控制访问层(Daybreak Red)而非控制模型本身,这实际上是把安全重心从模型层转移到了访问治理层。

我的技术点评

这则发布中有几个值得反复品味的细节。

第一个细节是 “防御窗口收窄”(the Cyber Defense Window Narrows)这个表述。OpenAI 的潜台词非常明确:攻击者正在用 AI 加速,防御者如果不提前获得更强的工具,将在不对称对抗中进一步落后。这个叙事是否成立,业界仍有争议——安全社区中一直有声音认为,将更强的攻击能力交给“可信的研究者”意味着更多的高危漏洞可能被披露,进而被恶意行为者利用。但 OpenAI 的选择是给防御者更强的能力,同时用访问授权来管控风险。这本质上是一个“信任”策略:与其让攻击者最先拥有它,不如让防御者先拿到它。这个逻辑有说服力,但其最终效果取决于访问治理的执行严格程度——而原文在此处未披露任何关于申请流程、审核标准或审计机制的细节。

第二个细节是 “减少拒绝”本身是一项核心能力。安全研究者的工作流中,最消耗精力的往往不是技术分析,而是与模型之间的“拒绝对抗”。95.0% 的完成率与 1.5% 之间的差距,意味着对于授权研究者而言,一个需要十次以上尝试才能得到响应的任务,现在基本一次就能通过。这种可用性提升对实际生产力的影响可能远超基准分数所反映的差异。但这也引发了更深层的问题:模型如何判断请求者的“授权”身份?如果通过在 API 层做访问控制,那模型本身是否真的“学会了”区分授权与未授权场景?原文未说明 GPT-5.6-Cyber 是否内置了比 GPT-5.6 Sol 更弱的道德判断,还是仅在访问层做了隔离。如果是前者,那么该模型的泄露风险将显著高于普通模型。

第三个细节是 安全研究已经进入了“多轮 Agent”范式。ExploitGym、ExploitBench 和漏洞报告评估都涉及智能体在复杂环境中的多步骤操作——形成假设、编写代码、运行验证、迭代修正。GPT-5.6-Cyber 在 300 轮限制下反而不如通用模型的表现在提醒我们:Agent 类任务中,“能力上限”与“稳定发挥”是两种不同的素质。一个 600 轮的设置就能扭转差距,说明专用模型在某些场景下的相对劣势可能源于策略偏向而非能力缺失。

第四个值得注意的点是 OpenAI 选择在发布当日就披露了多个失败案例(零日报告质量不如通用模型、ExploitBench 标准设置下弱于 GPT-5.6 Sol)。在当前各家 AI 厂商竞相展示 SOTA 分值的氛围中,这种“带短板发布”的姿态较为少见,也增加了结果的可信度。读者可以据此判断,目前专用模型并非万能的,需要与通用模型配合使用。

整体而言,GPT-5.6-Cyber 的发布标志着网络安全领域正式进入“AI 垂直模型”阶段。它既是一场能力升级,也是一场信任实验——如何确保更强的能力只流向“正确”的人,将是一个远比模型训练更棘手的持续挑战。

原文链接

Expanding Daybreak as the Cyber Defense Window Narrows - OpenAI