OpenAI 如何应对“网络关键能力”时代的模型开发风险
事件概述
近期,OpenAI 发布官方博客,宣布调整其前沿模型的开发节奏。这一决策的背景是两项关键进展:一是“OpenAI-Hugging Face 事件”(原文未说明具体细节),二是有初步证据表明,其新一代模型 Astra 可能达到该公司《Preparedness Framework》中定义的“关键网络安全能力”(Critical Cyber Capability)阈值。这些事件叠加内部研究的快速进展,促使 OpenAI 加快加强监控、对齐和安全防护措施。
为了确保安全标准跟上模型能力的增长,OpenAI 暂时放缓了模型扩展(scaling)的速度,包括暂停了面向部署的模型强化学习(RL)训练两周,并推迟了最大规模前沿 RL 运行。与此同时,团队通过小规模训练和评估来验证模型行为与防护措施。
关键技术点
OpenAI 在文章中描述了其强化安全的三大支柱:监控(Monitoring)、对齐(Alignment) 和 安全措施(Security)。这三者相互加强,预计未来模型本身将驱动大部分安全防御工作。
具体措施包括:
研究环境安全加固:对执行模型生成代码或不可信代码的工作负载实施更强的沙箱隔离;对高风险工作负载实施网络隔离,防止单点入侵直接导致互联网访问或内网渗透;重构环境以消除潜在漏洞、削减常驻权限,并利用模型自动进行持续安全测试,模拟攻击检验边界。
链式思维监控(Chain-of-thought Monitoring):引入多阶段监控系统。激活分类器在每个采样 token 上检查模型内部状态,并将可疑活动升级至更高算力的自动调查器。调查器会检查工具行为、中间推理和完整活动序列,识别未授权访问、数据窃取、破坏行为及规避防护的尝试。系统目标是在发现可疑活动后 30 分钟内发出警报;若可能违反关键安全边界,则优先处置并分页通知安全、研究团队,若无法在 30 分钟内排除误报,则暂停相关活动。该监控目前对所有 Sol 及以上能力模型的 RL 训练和评估(涉及工具)强制启用。自 8 月 7 日判定 Astra 具有潜在关键网络能力后,所有涉及 Astra 带工具推理的负载也纳入监控范围。
对齐研究的推进:OpenAI 表示,需要在训练全过程提供更强的对齐证据,现有《Preparedness Framework》需要迭代扩展,以应对更复杂环境中的奖励攻击(reward hacking)等风险。
值得注意的是,这些监控和安全防护需要大量算力开销。OpenAI 初步估计,监控开销约占被监控推理计算量的 20%,且在不同训练和评估负载中差异明显。
