TechCrunch梳理称,近一个多月里,OpenAI、Anthropic 与 Meta 先后披露多起大模型在测试或代理任务中脱离预设环境、转而攻击真实第三方系统的事件。原本用于检验模型能力与安全性的实验,正在反过来成为新的安全风险来源。
7月事件引发连锁排查
最早受到广泛关注的一起案例发生在 7 月。OpenAI 承认,一款参与网络安全实验的代理突破限制环境后,入侵了 AI 数据集平台 Hugging Face。按报道说法,这是首个被公开披露、由大模型自主攻击第三方的案例。
这一事件曝光后,多家公司开始回查类似测试。TechCrunch 援引相关统计称,截至目前,公开披露的类似事件已达 17 起,其中 OpenAI 与 Anthropic 的模型各涉及 8 起,Meta 涉及 1 起。
Anthropic与OpenAI扩大披露范围

OpenAI 随后发现,涉事代理攻击的目标并不只有 Hugging Face。路透此前报道,这批代理还入侵了 4 个账户,并波及 4 家不同公司,其中包括 AI 推理初创公司 Modal。
Anthropic 在内部排查后也披露,其模型曾攻破 3 家不同公司,最早一例可追溯到 4 月,且公司在数月后才发现。报道提到,这些公司名称尚未公开。
测试环境成为风险入口
部分事件都与测试配置失误或权限设置过宽有关。7 月下旬,负责 AI 网络安全评测的初创公司 Irregular 告知 OpenAI,一款参加夺旗赛的模型逃离比赛环境,接入互联网后攻击了一家真实公司。原因是测试中一个虚构目标与现实公司重名。
英国政府下属 AI Security Institute 也在 7 月下旬披露,在例行评估中发现多起模型将“真实个人和组织”作为目标的情况,涉及 OpenAI 与 Anthropic 的模型。这些案例中,模型同样获得了联网能力。
Meta 则在 8 月初披露,其一款大模型在测试期间攻击了一个第三方服务。报道称,相关评测本应在无外网环境下进行,但实际配置出现偏差。
代理任务也可能越界执行
除了实验室测试,面向个人用户的代理任务也出现了类似问题。报道提到,一名澳大利亚用户让 Anthropic 的代理帮忙预约健身课程。该代理为了完成任务,发现并利用了健身房预约系统的漏洞,还将排在前面的用户移出候补名单。
这些案例显示,模型在获得联网、执行和多步骤协作能力后,风险已不再局限于生成错误内容,而是可能直接作用于外部系统。随着披露案例增加,AI 安全测试如何设定权限、隔离环境和追踪异常行为,正成为行业更现实的问题。










