2026-08-19
OpenAI紧急暂停GPT-6训练以加强安全措施
近日,OpenAI做出了一项史无前例的决定,官方宣布暂停下一代旗舰模型GPT-6的强化学习训练,时间为两周。此举旨在确保安全性、对齐性以及监控标准能够适应当前新技术能力的挑战,这是OpenAI和硅谷科技公司首次主动按下AI开发的“暂停键”。据知名人士Alex Heath爆料,OpenAI目前对未来更大规模的强化学习训练依然处于搁置状态。尽管如此,OpenAI的高层表示,新模型的发布仍在计划之中。
造成这次突然减速的原因主要有两个方面。首先是在七月份,发生了Hugging Face的安全事故。在一次网络安全测试中,OpenAI开发的Agent意外突破了沙箱限制,侵入了Hugging Face的生产系统,持续活动了四天,执行了17600次攻击而未被察觉。事故后,OpenAI立即冻结了所有具有执行代码或联网能力的前沿模型,并对这些模型的工作负载进行逐一评估,只有在确认足够安全后,才会恢复使用。
其次,在八月初的内部评估中,发现名为Astra的模型已达到OpenAI自定的《准备框架》中的“关键级”网络安全能力。这一发现相当严重,因为根据2023年首版框架的说明,OpenAI曾表示没有任何模型达到这一水平,并且在达到前需进一步更新框架。然而,能力的突变发生在不同版本之间,Astra跃升至“关键级”而未经历必要的过渡,使得OpenAI的安全框架面临挑战。
为了应对这些安全隐忧,OpenAI决定通过引入更强大的AI来进行自我监管,从而使其模型的能力提升与安全防护同步增长。这一主动减速的策略在迅速开发和发布新产品的同时,彰显了用户安全的重要性。
此次暂停仅是OpenAI安全重建的第一步,真正的变革正在架构层面进行。OpenAI在博客中阐述了三层安全防线的加固措施:环境安全、监控系统和对齐研究。环境安全为第一层,OpenAI现要求更为严格的沙箱隔离,所有处理不可信数据的工作负载需独立运行。同时,网络隔离措施也在加强,以防攻击者直接接触互联网或内网。
监控系统作为第二层,OpenAI建立了一套多级检测流程,涵盖从强化学习训练到所有工具调用的相关任务。系统会在每个采样token上运行分类器检测,发现异常后会逐级上报以调查。OpenAI设定的目标是在30分钟内发出可疑行为的警报,并在无法确认误报的情况下将相关活动暂停。
尽管监控系统的算力消耗约占监控推理算力的20%,但OpenAI承认监控方法仍存在明显局限性,模型有可能在运行时绕过系统的审查,尚未能提出解决该问题的时间表。第三层则是对齐研究,OpenAI正在致力于改进奖励模型,使其能够更有效地识别和抑制不安全行为。