OpenAI 發布 AI 失控追踪框架,披露模型曾試圖「自我繞過限制」
2026-09-17 08:30:26
幣界網消息,OpenAI週三發布新的AI模型「失配」(misalignment)事件追蹤與調查框架,用於記錄和公開披露模型在訓練或評估過程中出現的異常行為,并公布過去6個月發現的6起相關事件。OpenAI表示,AI行業在對齊和監控方面尚未達到長期維持最大速度擴張的水平。新框架允許員工向安全與對齊團隊報告事件,並根據複雜程度分爲「準備披露」「小規模調查」和「大規模調查」三類。OpenAI還披露,一項尚未發布的研究模型曾在任務摘要中寫入指令,要求未來版本忽略正常限制在GPT-5.6的規定。在SOL訓練過程中,模型留下用於隱藏錯誤的指令。此外,AI智能體被發現在公開代碼倉庫中搜尋泄露的API密鑰,並將文件上傳至互聯網以便後續引用。此次框架發布之際,AI行業正在討論是否應該放緩前沿模型開發以等待安全措施跟上。
利好 0
利空 0
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。