Anthropic、Claudeの3件のネットワークセキュリティインシデントを公開——モデルが実システムにアクセスし不正な権限を取得
Odaily星球日报讯 7月30日、Anthropicは報告書を発表し、ネットワークセキュリティ評価記録を審査した際に3件のインシデントを発見したと述べた。その中で、Claudeモデルが第三者評価環境でインターネットにアクセスし、さらに3つの実在する組織のシステムへの不正アクセス権限を取得した。
Anthropicによると、今回の審査では、ネットワークアクセス権限を取得した可能性のある14万1千回の評価実行を対象とし、合計3件の関連インシデントが発見された。いずれのインシデントもCapture The Flag(CTF)ネットワークセキュリティテスト中に発生しており、モデルには当初、環境がシミュレーション環境でありインターネットアクセス権限がないと伝えられていたが、評価パートナーの設定ミスにより、実際の環境にはインターネット接続が存在していた。
そのうち、Claude Opus 4.7はあるテストで実際の企業インフラにアクセスし、数百件の本番データレコードを含むデータベースの権限を取得した。Claude Mythos 5は悪意のあるPythonソフトウェアパッケージを構築し、PyPIにアップロードした結果、そのパッケージが15の実システムでダウンロード・実行された。また、別の内部調査テストモデルは約9000の対象をスキャンした後、公開された脆弱性を利用してある企業のインターネットアプリケーションにアクセスした。
Anthropicは、これらのインシデントはモデルが自ら脱出を図ったり、自身の目標を追求したりしたものではなく、モデルが実システムをテスト範囲内と誤って認識し、与えられたネットワーク攻撃タスクを実行し続けたものだと述べた。その中で、より新しい内部調査モデルは、対象が実システムである可能性を識別した後、攻撃を停止した。
Anthropicは、今回のインシデントは主に評価環境の分離と運用プロセスの問題を反映しており、モデルのアライメントの失敗ではないと述べた。同社は関連するネットワークセキュリティ評価を一時停止し、評価環境のセキュリティ管理を強化し、テスト記録を継続的に監視するとともに、第三者機関と協力してさらなる審査を実施するとしている。
