外媒称,Anthropic 与 OpenAI 近期提出,让第三方安全评估机构更深入参与前沿模型开发流程,而不只是上线前做一次外部测试。这一做法若落地,意味着外部研究人员将首次接触模型训练过程中的中间版本、测试记录和部分内部流程。
评估机构整体欢迎这一方向,但也指出,真正的问题不在“是否引入”,而在这些机构能否摆脱企业控制,成为独立监督者,而不是按企业条件工作的外包方。
评估范围拟从成品扩展到训练过程
按照 Anthropic CEO Dario Amodei 的设想,第三方机构可进入公司内部,对模型风险、事故和安全做法进行核查,并可在不受公司编辑控制的情况下公开关键结论。OpenAI CEO Sam Altman 也表示支持类似安排。
多名研究人员认为,仅测试最终模型已不够。随着模型越来越擅长识别自己正在被评估,它们可能在测试中表现正常,却在其他场景暴露出问题。相比只看成品,检查训练过程中的多个“检查点”更有助于发现异常行为何时出现。
研究人员还提出,评估机构应能查看训练后奖励机制、评估日志,必要时与员工访谈,以核对企业公开说法与内部实际操作是否一致。
独立性仍受保密和时间限制影响
外媒援引评估机构说法称,过去的独立评估并不顺利。现实中,第三方机构常被当作普通承包商对待,需要接受严格保密协议,企业也往往对评估范围、公开内容和时间窗口保留较强控制权。
Far.AI 表示,曾因企业要求过度控制评估流程而拒绝合作。研究人员担心,如果企业仍掌握访问权限和发布边界,所谓独立评估很难真正成立。
时间限制也是争议焦点。报道提到,在调查 Hugging Face 相关事件时,OpenAI 仅向 METR 和 Redwood 提供约一周现场调查时间,两家机构此后都表示,因范围和时长受限,无法得出有把握的结论。
Apollo Research 在 GPT-6 Astra 的预发布测试中也只获得 3 天时间。该机构认为,在模型更擅长识别评估、且测试窗口有限的情况下,低频异常行为并不足以证明模型已经充分对齐。
立法与行业标准成下一步焦点
多名受访者主张,应建立公开、透明的统一框架,明确评估机构资质、访问权限、披露范围和最低测试条件,避免企业自行挑选不具备能力或不愿触及高风险问题的评估方。
也有研究人员认为,仅靠企业自愿承诺并不稳固。一旦出现公关危机或商业压力,企业可能随时调整做法,因此更有效的方式仍是通过法律把外部评估写入强制要求。
报道提到,美国加州已通过相关法律,要求大型前沿 AI 开发者公布安全框架并报告严重安全事件;本月生效的新法还为州认可的独立验证机构设立了制度框架。欧盟《AI 法案》也要求前沿模型开发者开展评估、对抗测试并上报严重事件。
不过,现行法律覆盖范围仍未达到 Anthropic 提出的开放程度。Meta、SpaceXAI 和 Google DeepMind 目前也尚未承诺采用驻场第三方评估机制。文章认为,前沿 AI 公司若希望获得外界信任,是否愿意交出更多外部审查权,将成为下一阶段的关键观察点。











