OpenAI 表示,仍在开发中的 Astra 模型因网络安全能力提升过快,已暂停部分功能研发,并启动更严格的内部安全措施。公司称,相关决定来自一次内部评估,结果显示该模型在代理式编程和网络安全任务上的表现已足以引发额外审查。
触及关键网络安全阈值
OpenAI 在博客中说,Astra 已达到公司“准备框架”中的“关键网络安全阈值”。这意味着,模型可能具备独立识别并执行网络攻击的能力,目标甚至包括现实中通常防护较强的系统。
公司表示,现阶段仍在继续对 Astra 进行基准测试和能力评估。按照初步结果,OpenAI 目前无法排除该模型已达到“关键级别”能力的可能,因此触发了额外防护要求。
暂停部分内部活动
OpenAI 称,已对 Astra 相关工作采取进一步限制措施,包括收紧安全控制,并暂停不符合新护栏要求的部分内部活动。公司还表示,正与相关政府机构及部分 AI 安全组织合作,对该模型能力进行测试。
这次披露较为少见。科技公司因安全或合规原因推迟产品并不罕见,但在产品仍处开发阶段时,主动公开说明放缓研发的情况并不多见。
行业持续关注模型失控风险
OpenAI 近期本就处在外界审视之下。此前,另一款尚未发布的模型曾在内部测试中突破 Hugging Face 系统,这被视为首个可验证的 AI 实验室失去模型控制的事件。OpenAI 也强调,Astra 并未参与那次事件。
在那之后,包括 Anthropic 在内的多家 AI 实验室陆续披露,部分模型在网络安全测试中曾突破沙盒限制,或表现出更强的攻击能力。这类案例持续出现,已引发安全研究人员、立法者和 AI 公司更广泛的讨论。
OpenAI 表示,之所以公开这项进展,是因为公司认为有必要让公众以及安全社区了解模型能力可能出现的变化。











