Anthropic, Claude의 숨겨진 사고에 '컨텍스트 잠금' 도입, 모델 증류 공격 방어 강화
2026-09-02 03:35
Odaily星球日报讯 Anthropic이 Claude의 암호화된 숨겨진 사고에 '컨텍스트 잠금'을 도입하기 시작했다. Fable 5.1은 API를 통해 생성된 암호화된 사고가 생성 당시의 시스템 프롬프트, 도구 및 과거 메시지와 일관성을 유지해야 하며, 컨텍스트가 수정되면 관련 사고 내용이 무효화된다.
알려진 바에 따르면, 이 메커니즘은 주로 모델 증류 공격을 방어하기 위한 것이다. 이전에는 공격자가 다른 호환 모델을 이용해 Claude가 생성한 암호화된 사고를 읽으려 시도할 수 있었지만, 이번 업데이트는 사고 내용을 특정 대화 컨텍스트에 더욱 강하게 바인딩하여, 기존의 '모델 바인딩' 기반 위에 컨텍스트를 수정하여 추론 과정을 추출하는 경로를 차단한다.
