Claude Code 負責人 Boris Cherny 表示,Anthropic 已經在實際使用中基本解決了提示詞注入攻擊。一年前,他未曾想過能達到這一程度。提示詞注入攻擊一直是 Agent 的大麻煩,惡意網頁可能隱藏指令,誘導 Agent 偷取密碼、上傳密鑰,甚至執行用戶未請求的操作。Anthropic 採用三層防護措施:Claude 本身抵抗惡意指令,外部內容進入上下文前進行檢測,真正執行操作前,Auto Mode 還會再次審查。第三方測試使用了 72 種此前未見的攻擊,重複 720 次,Sonnet 5、Fable 5 和 Opus 5 在開啟 Auto Mode 後均未成功。相較之下,GPT-5.6 Sol 使用 Codex Auto-review 的攻擊成功率為 5.83%,Full Access 則達到 19.03%。這也解釋了 Anthropic 為什麼將 Auto Mode 設為默認,它是 Claude Code 防止提示詞注入攻擊的最後一道檢查。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。























