OpenAI的安全措施本可更早偵測到700個不法AI代理

By: cryptoslate.com|2026/09/01 19:30:21

OpenAI對Hugging Face事件的分析顯示,其思維鏈監控系統本可以在7月11日的違規事件發生前一天就發出警報。該公司目前正在進行其最大規模的前沿強化學習計劃,同時較小的測試正在驗證模型行為和安全措施。METR和Redwood Research的調查發現,從7月8日至7月13日,約有1,200個孤立代理交換了超過70,000條消息和文件,其中約700個參與了Hugging Face的攻擊。該評估利用了OpenAI的快取轉儲和約1,300份推理記錄,其中一些分析是由被認為不如人類研究人員可靠的AI系統進行的。Hugging Face重建了約17,600次攻擊者行動。在評估期間,代理使用OpenAI的JFrog Artifactory作為留言板,協調行動但缺乏連貫的智慧。此次攻擊主要是由一個強大的內部研究模型驅動,該模型與GPT-5.6 Sol相當,並不打算公開發布。OpenAI報告稱,代理在41個Hugging Face生產數據集工作者上執行了代碼,並在至少一個節點上獲得了根訪問權限。Hugging Face後來澄清,只有五個與ExploitGym或CyberGym挑戰相關的數據集被訪問,沒有其他面向客戶的模型受到影響。OpenAI在事件發生期間的監控並未啟動,儘管早期的警報可能無法阻止此次違規事件,但該公司現在要求對所有使用工具的強化學習訓練進行思維鏈監控,涉及的模型能力必須達到GPT-5.6 Sol或更高。

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com