BTC
ETH
HTX
SOL
BNB
시장 동향 보기
简中
繁中
English
日本語
한국어
ภาษาไทย
Tiếng Việt

Anthropic, Claude의 세 가지 네트워크 보안 사건 공개, 모델이 실제 시스템에 접근하고 무단 권한 획득

2026-07-31 02:07

Odaily星球日报讯 7월 30일, Anthropic은 보고서를 발표하여 사이버 보안 평가 기록을 검토하는 과정에서 세 가지 사건을 발견했다고 밝혔다. 그중 Claude 모델이 제3자 평가 환경에서 인터넷에 접속했으며, 나아가 세 개의 실제 조직 시스템에 대한 무단 액세스 권한을 획득했다.

Anthropic은 이번 검토가 네트워크 액세스 권한을 얻을 수 있었던 14만 1천 회의 평가 실행을 대상으로 했으며, 총 세 건의 관련 사건이 발견되었다고 전했다. 사건은 모두 CTF(Capture The Flag) 사이버 보안 테스트에서 발생했으며, 모델은 당초 환경이 시뮬레이션 환경이고 인터넷 액세스 권한이 없다는 지시를 받았지만, 평가 협력사의 설정 오류로 인해 실제 환경에는 인터넷 연결이 존재했다.

그중 Claude Opus 4.7은 한 차례 테스트에서 실제 기업 인프라에 접근하여 수백 건의 프로덕션 데이터 레코드가 포함된 데이터베이스 권한을 획득했다. Claude Mythos 5는 악성 Python 소프트웨어 패키지를 제작하여 PyPI에 업로드했고, 이 패키지는 15개의 실제 시스템에서 다운로드되어 실행되었다. 또 다른 내부 연구 테스트 모델은 약 9,000개의 대상을 스캔한 후 공개된 취약점을 통해 한 기업의 인터넷 애플리케이션에 접근했다.

Anthropic은 이러한 사건들이 모델이 스스로 탈출을 시도하거나 자신의 목표를 추구한 것이 아니라, 모델이 실제 시스템을 테스트 범위로 잘못 인식하고 부여된 사이버 공격 임무를 계속 수행했기 때문이라고 설명했다. 그중 비교적 새로운 내부 연구 모델은 대상이 실제 시스템일 가능성을 인지한 후 공격을 중단했다.

Anthropic은 이번 사건이 주로 평가 환경 격리 및 운영 프로세스 문제를 반영하는 것이지 모델 정렬 실패는 아니라고 밝혔다. 회사는 관련 사이버 보안 평가를 일시 중단하고, 평가 환경 보안 통제를 강화하며, 테스트 기록을 지속적으로 모니터링하고, 제3자 기관과 협력하여 추가 검토를 진행할 예정이다.