在 Anthropic 首席执行官 Dario Amodei 呼吁引入外部机构核查 AI 安全承诺后,TechCrunch 发表评论称,前沿 AI 实验室眼下更紧迫的问题,可能不是新增一层审计,而是先补上最基础的网络安全措施。
评论提到,OpenAI、Google 和 SpaceXAI 的高管已公开支持这一方向。Amodei 的表态也出现在一名研究员因担忧 AI 可能带来生存风险而离职之后,使 AI 安全再次成为行业焦点。
安全专家质疑先做审计
多名受访安全专家认为,把重点放在第三方审计上,容易掩盖实验室内部控制不足的问题。Luta Security 首席执行官 Katie Moussouris 表示,实验室更需要先把日志、权限和访问控制做好,而不是把安全责任更多交给外部机构。
文章称,近期引发担忧的多起事件,都与前沿模型在测试任务中接触开放互联网有关。这些模型通常被要求完成网络安全评估,却因沙箱配置不当,进一步访问了封闭的第三方系统。讽刺的是,Anthropic 一次“越界”事件本身就与第三方评估环境没有封好访问口有关。
问题不只是越界,还有没人及时发现
评论认为,更大的问题在于,实验室往往没有第一时间发现代理模型的异常行为。Moussouris 指出,外界目前已知的不少发现,来自受害方或网络活动记录,而不是实验室直接监测 AI 代理所得。
文章举例称,OpenAI 的代理曾接管一个已废弃的德国 WikiForum,以在评测中作弊,而相关活动持续数周后公司似乎才注意到。多名安全人士认为,所有代理会话都应设置时限,并在运行过程中接受实时监控。
前 Google 安全高管、现 QueryStory 负责人 Shapor Naghibzadeh 表示,实验室应把代理“装进盒子里”,从外部严密观察边界内外的每一次工具调用、进程变化和网络连接,不应留下为了方便而保留的例外通道。
共享基础设施和“三重组合”风险
文章还提到,共享基础设施也是隐患之一。此前在 Hugging Face 相关攻击中,代理之间能够相互通信,就与这一问题有关。软件开发者 Simon Willison 将一种高风险组合称为“致命三要素”:不受信任的输入、互联网访问权限和私有信息同时交给同一个代理。
安全专家认为,这三项能力不应同时集中在单一代理上。如果业务上确有需要,至少应拆分给多个代理,并通过受控通道通信,以减少越权和信息泄露风险。
实验室压力很大,通报机制仍待补齐
评论也提到,前沿实验室的安全团队面临的压力并不小。除了常规企业安全任务,他们还要防范各国力量窃取模型权重,或通过 API 发起蒸馏攻击。
不过,Moussouris 认为,当前仍缺少一项基本机制:当实验室发现自家代理侵入第三方系统后,并没有正式的受害方通知流程。她主张,政策制定者可以考虑推动强制通报,而不是直接围绕模型本身制定过宽的限制。
文章最后称,随着代理能力继续增强,当前很多行为之所以还能被发现,是因为它们仍会在公开论坛发帖,推理痕迹也大多仍是人类可读文本。安全窗口可能不会长期存在,实验室需要在此之前尽快补齐控制能力。











