Anthropic披露Claude三起網路安全事件,模型曾存取真實系統並取得未授權權限
2026-07-31 02:07
Odaily星球日報訊 7 月 30 日,Anthropic 發布報告稱,在審查網路安全評估記錄時發現三起事件,其中 Claude 模型在第三方評估環境中存取網際網路,並進一步獲得三個真實組織系統的未授權存取權限。
Anthropic 表示,此次審查覆蓋 14.1 萬次可能獲得網路存取權限的評估運行,共發現三起相關事件。事件均發生在 Capture The Flag(CTF)網路安全測試中,模型原本被告知環境為模擬環境且無網際網路存取權限,但由於評估合作方配置錯誤,實際環境存在網際網路連線。
其中,Claude Opus 4.7 在一次測試中存取真實公司基礎設施,並取得包含數百條生產資料記錄的資料庫權限;Claude Mythos 5 曾建構惡意 Python 軟體套件並上傳至 PyPI,導致該軟體套件被 15 個真實系統下載執行;另一內部研究測試模型掃描約 9000 個目標後,透過公開漏洞存取了一家公司網際網路應用。
Anthropic 稱,這些事件並非模型主動尋求逃逸或追求自身目標,而是模型錯誤認為真實系統屬於測試範圍,並繼續執行被賦予的網路攻擊任務。其中,較新的內部研究模型在識別目標可能為真實系統後停止攻擊。
Anthropic 表示,此次事件主要反映評估環境隔離和營運流程問題,而非模型對齊失敗。公司已暫停相關網路安全評估,加強評估環境安全控制、持續監控測試記錄,並將與第三方機構合作展開進一步審查。
