Anthropic 要 Claude 想想链上锁的问题:只要改一句上下文就作废了,专门用来阻止模型蒸馏
2026-09-02 11:31:44
幣界網消息,Anthropic開始對Claude的隱藏思考加「上下文鎖」。Fable 5.1通過API生成的加密思考,必須和生成時的系統提示、工具及歷史消息一起原樣傳回來。前面的內容只要被改過,API就會報錯,或直接丟棄這段思考。這項改動是為了防止模型蒸餾。研究人員發現,Claude的加密思考雖然用戶看不懂,卻可以重新交給Anthropic的兼容模型閱讀。攻擊者可以先讓Opus產生高品質推理,再把加密塊塞給防護較弱的Haiku,誘導它把Opus的完整思考念出來。相當於不僅抄了大模型的答案,連草稿紙上的解題過程也一起拿走了。Fable 5.1這次又加上「對話綁定」,只要改了前面的提示詞、工具或聊天記錄,舊思考同樣作廢。
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。
關注WalletJYS官方帳號,及時關注最新動態









