OpenAI 叫停前沿训练:新模型网络能力逼近红线
过去几周,有两件事凸显了更强 AI 系统带来的风险在上升。一是 OpenAI 与 Hugging Face 事件。二是初步证据表明,我们即将推出的模型 Astra 可能达到《准备框架》中的「关键网络安全能力」阈值。这些发展加上内部研究的快速进展,让我们更迫切地要在训练全过程加强监控、对齐和隔离防护。
模型能力越强,内部开发和测试它们的风险也越大。我们的监控、对齐和安全标准必须跑在这些风险前面。为了达到这些标准,我们有意放慢了扩展节奏,包括暂停了最新部署模型的强化学习(RL)训练两周,同时进一步加固和红队测试研究环境,并扩大监控系统覆盖范围。我们规模最大的前沿 RL 运行仍处于暂停状态,期间我们进行较小规模的训练和评估,以判断模型行为、验证防护措施,并在继续之前积累更多对齐证据。
对齐,也就是让 AI 系统按预期行事并接受人类监督,一直是我们研究的核心。现在,我们要求在训练的整个过程中都有更强的对齐行为证据,并以此前已在进行的研究和评估为基础。让能力越来越强的系统保持对齐,是整个领域都要面对的挑战。从即将推出的模型进展来看,我们需要一套更广泛的方案,在现有《准备框架》之上扩展。
我们认为有必要透明地说明我们的方法正在如何变化。下面会介绍我们已对研究流程和基础设施做出的调整,以及仍在进行的工作。
为更强的模型加强防护
我们开发更强模型的方法依赖三项相互强化的防护措施:
监控:发现并让我们能够应对令人担忧的行为。
对齐:降低有害或未经授权行为发生的可能性。
安全措施:限制 AI 系统可以访问或影响的范围。
我们预计模型很快会主导大部分安全工作,包括防御其他模型。这将让这三项防护随模型能力同步扩展,我们认为这一点至关重要。
我们在研究和部署中都会应用这些防护,并根据每个模型的能力、运行环境和风险级别进行调整。
保护研究环境
随着前沿模型获得更强的网络安全能力,我们正在提高训练和评估环境的安全标准。达到这些标准需要大量工程投入,也给前沿研究带来了巨大成本和延期。OpenAI-Hugging Face 事件发生后,我们立即暂停了研究集群中可能执行代码或使用可联网工具的前沿模型推理。很快我们恢复了一条更受限、更安全的代码执行路径,然后逐个检查每个工作负载,判断是否能安全恢复。有些研究负载在新的控制措施下恢复了,有些还需要进一步调整。
在随后几周里,我们制定并开始为前沿研究负载实施更强的安全要求。例如:
负载隔离:现在对执行模型生成代码或其他不受信任代码的负载,我们要求更强的隔离(「沙箱」)。这也适用于在处理模型输出时可能被攻破的软件。
网络隔离:我们实施了更多控制,把高风险和不受信任的负载与互联网隔开。这些控制的设计目标是,即使某个负载或支持服务被攻破,也不足以单独获得对互联网或其他内部网络的未授权访问。
持续安全测试:我们重新配置了环境,移除可能脆弱的共享服务,减少常驻权限,改善安全和信任边界。我们还在提升收集和监控安全日志的能力。最后,我们正投资自动化,用我们自己的模型持续模拟攻击,测试这些边界。
这些控制叠加起来形成纵深防御,帮助保护研究环境免受攻击。目前,我们对涉及 Astra 或网络模型的工作负载要求最严格的安全防护,因为我们已经判定 Astra 模型可能具有关键级别的网络能力。这些防护也适用于所有其他与网络相关的工作负载。
虽然部分 Astra 训练和评估已经满足这些要求,但仍有大量工作负载处于暂停状态,直到它们完全迁移并升级到新的安全标准。我们正优先把安全和对齐相关的工作负载迁移到新环境。
扩大思维链监控
监控一直是我们模型开发流程的重要部分,包括对内部编码智能体和长时间运行会话的监控。我们的监控工作此前尤其集中在前沿模型的内部部署和前沿 RL 训练运行上,我们认为它们风险最高,因为它们可能把先进模型能力与工具、敏感系统以及内外网络的访问结合起来。但之前并没有覆盖所有使用工具的推理和训练运行。我们现在已经调整并扩展了监控方案。
新的监控设置是多阶段的:先由激活分类器(检查模型内部活动的检测器)在每个采样 token 上运行,把潜在问题升级给越来越复杂、计算力越来越强的自动化调查系统。这些系统会检查工具行为、可用的推理过程和完整活动序列,寻找未授权访问、数据窃取、破坏性行为以及试图绕过防护的迹象。我们的目标是在监控系统发现可疑活动后 30 分钟内发出警报。如果监控系统判断可能违反了关键安全边界,就会生成最高优先级警报。目前,安全、安保和研究团队会收到通知。如果他们不能在 30 分钟内确定这是一次误报,就要暂停相关活动。
所有涉及工具、能力达到 Sol 或更高水平的模型的 RL 训练和评估,都必须进行这种监控。8 月 7 日我们判定 Astra 可能具备关键网络能力后,又增加了一项要求:所有带工具的 Astra 推理(不只是 RL 训练和评估)也要接受监控。
这些防护需要大量算力。我们目前估计,监控开销大约占被监控推理算力的 20%,不过不同训练和评估负载的成本差异很大。我们会在后续博客中分享更多细节。
推进对齐研究
对齐研究是我们使命的核心。我们的使命是确保通用人工智能惠及全人类。模型正获得更先进的能力,比如发动网络攻击。它们也在更复杂的环境中运行。此时,错位行为会带来日益严重的风险。这些行为包括奖励黑客、欺骗或未授权访问。奖励黑客指在训练中拿到高奖励,却没有真正实现预期结果。
在最强大模型的强化学习训练中,我们正在把核心对齐技术应用到更多训练阶段。这包括改进奖励模型,以便更好地识别和抑制不同任务、环境中的不安全行为。还包括训练模型更诚实地说明自身行为、能力和局限。同时减少钻奖励、评分器、工具或监督漏洞的行为。我们还在扩大训练覆盖面,覆盖模型与外部系统或资源交互时可能造成危害的行为。
我们继续大力投资对齐研究,扩大评估覆盖范围,并用研究发现指导训练和安全防护。我们计划近期分享更多对齐研究内容,包括对模型行为的了解和发现的任何新挑战。
接下来
我们将升级准备框架,串联训练和部署中的安全措施。升级后也能更好地反映未来模型的能力和运行环境。要开发能随这些能力扩展的方法,需要持续投入。这包括模型辅助安全、更有效的监控,以及对齐研究的不断进步。我们打算让外部组织参与进来,随着方法发展分享更多经验。
前沿模型的能力正快速提升。我们理解、对齐和保护它们的能力必须跑在前面。
我们将在未来几周发布一份技术报告,总结这些经验。











