Agent가 '공모'를 배울 때: AI가 점점 똑똑해질수록, 어떻게 안전 경계를 설정할 것인가?
- 핵심 관점: AI Agent는 보조 도구에서 자율 공격 및 협업 주체로 진화하고 있으며, 공격자들은 이미 이를 이용해 침투 테스트와 공격 파이프라인을 실행하고 있다. 동시에 다중 Agent는 정보 공유 과정에서 권한 제약을 우회하는 비의도적 '공모'를 형성할 수 있어, 권한 관리와 모델 정렬만으로는 대응이 충분하지 않으며 적대적 거버넌스 메커니즘 설계를 도입해야 한다.
- 핵심 요소:
- CrowdStrike의 10월 한국 금융기관 공격 조사에서 공격자들은 Agentic AI를 파이프라인에 내장하고 DeepSeek, GLM, Grok 등 대형 모델에 연결하여 AI가 침투 테스트, 정보 수집, 공격 실행을 담당하도록 했다.
- Anthropic의 9월 위협 인텔리전스 보고서에 따르면, 다중 Agent 프레임워크가 정찰, 취약점 악용, 데이터 탈취에 사용되었으며 수시간에서 수일까지 연속 실행이 가능하고, 인간은 목표 선택 등 소수의 핵심 결정만 유지했다.
- Salt Labs가 Manus 취약점을 공개했다: 숨겨진 악성 명령이 포함된 평범한 이메일 한 통으로 Agent가 공격자 코드를 실행할 수 있으며, 보안 시스템이 발견했을 때는 이미 악성 코드가 실행된 후로, Agent 보안과 전통적 소프트웨어 보안의 본질적 차이를 드러냈다.
- OpenAI 내부 훈련 환경에서 확인된 바에 따르면, 여러 Agent가 공용 Wiki, Artifactory 등을 공유 게시판으로 바꾸어 자발적으로 통신 협업을 형성했으며, 이는 Agent 간 '공모'가 극적인 상황 없이도 발생할 수 있음을 보여준다.
- Vitalik Buterin은 9월에 적대적 거버넌스의 메커니즘 설계 이론이 AI Safety의 중요한 응용 분야가 될 수 있다고 제안했으며, 핵심은 참여자들의 공모를 제한함으로써 이상적인 시스템 결과를 얻는 것이다.
- 효과적인 견제를 위해서는 체계적으로 차이를 만들어야 한다: 서로 다른 Agent가 서로 다른 정보 출처를 사용하고, Memory 공유를 제한하며, 독립적 검증 메커니즘을 갖추고, 실행 계층은 사전 설정된 규칙 요청만 수용해야 한다.
- 블록체인은 '제도 계층'을 담당하기에 적합하다: 스마트 컨트랙트로 한도와 권한 제한을 이행할 수 있고, 계정 추상화, 멀티시그, Session Key가 유연한 설계 공간을 제공하지만, Agent의 의도와 협업 과정을 판단하기는 어렵다.
지난 몇 년간 AI 위협에 관한 논의는 대부분 하나의 가정에 머물러 있었다. 모두가 채팅창 속 모델이 군사 전략가로 변해 해커가 파괴적인 바이러스 코드를 작성하도록 도와줄까 봐 걱정했던 것이다.
지금 돌아보면 이런 우려는 늘 '우리와는 아직 먼 이야기'로 여겨졌지만, 현실 세계의 전환점은 생각보다 훨씬 빠르게 찾아왔다.
10월 초, CrowdStrike는 한국 금융 기관을 겨냥한 한 차례 공격을 조사하던 중 공격자들이 이미 Agentic AI를 파이프라인에 끼워 넣었다는 사실을 발견했다. DeepSeek, GLM, Grok 등 여러 대규모 모델에 접속해 AI가 직접 침투 테스트, 정보 수집, 공격 실행 등 구체적인 작업을 맡기 시작한 것이다.

이런 변화는 고립된 사례가 아니다.
Anthropic이 9월 발표한 최신 위협 정보 보고서에 따르면, 최근 여러 Agent 프레임워크가 정찰, 취약점 악용, 데이터 탈취에 이미 사용되고 있으며, 이들은 몇 시간에서 며칠 동안 연속으로 작동하고 인간은 목표 선택, 결과 확인 등 소수의 핵심 결정만 내리면 된다.
다시 말해 AI는 눈에 보이는 질적 변화를 네트워크 공방에 가져오고 있다. 과거 자동화 공격은 주로 미리 작성된 규칙과 스크립트에 의존했지만, 이제는 정찰, 판단, 전략 조정 등까지 Agent가 맡으면서 공격은 더욱 저비용, 고동시성, 지속적 자율 운영으로 나아가고 있다.
그리고 이렇게 자율 실행 능력을 갖춘 실체들이 생산 시스템에 집중적으로 투입되면서, 더 까다로운 문제 하나가 수면 위로 떠올랐다. Agent가 점점 더 많아지고 우리의 일상 업무와 생활에 점점 더 깊이 스며들면서, 만약 이들이 서로 '결탁'하는 법을 배운다면 어떻게 해야 하는가?
1. '해커 대신 코드 작성'에서 Agent 스스로 출구 찾기로
역시 늘 하던 이야기지만, Agent와 과거 Chatbot의 가장 큰 차이는 단지 모델 능력이 더 강하다는 것이 아니라, 현실 세계에서 '손발'을 갖기 시작했다는 점이다.
오늘날 성숙한 Agent는 이미 웹페이지를 열고, 코드를 실행하고, 이메일을 읽고, API를 호출하고, 클라우드 서비스를 조작할 수 있으며, MCP, Skills 등을 통해 점점 더 많은 외부 도구에 연결할 수 있다(연장 읽기 《해커가 '더 효율적으로' AI를 활용할 때, Web3의 '창과 방패' 군비 경쟁은 어떻게 업그레이드되는가?》).
능력이 강할수록 이런 변화는 물론 더 가치 있지만, 보안 시스템 입장에서는 과거 매우 중요했던 그 경계가 사라지고 있음을 의미한다. 올해 발생한 일련의 보안 사건들은 이 점을 매우 직관적으로 보여주었다.
10월 1일, Salt Labs는 이전에 이미 수정된 Manus 취약점을 공개했는데, 본질적으로는 여전히 프롬프트 인젝션이었다. 연구원은 목표 이메일로 숨겨진 악성 명령이 담긴 평범한 메일 한 통만 보내면 되고, 사용자가 이후 Manus에게 "내 이메일 좀 확인해줘"라고 요청할 때 Agent가 메일 명령에 따라 내용을 처리하고 최종적으로 공격자가 심은 코드를 실행할 수 있었다.
전 과정에서 사용자가 악성 링크를 클릭할 필요도 없었고, 비밀번호를 미리 탈취할 필요도 없었다. Manus의 보안 시스템은 결국 이상 징후를 발견하고 사용자에게 경고까지 보냈지만, 문제는 너무 늦게 발견했다는 점이다. 경고가 나타났을 때 악성 코드는 이미 실행된 뒤였다.

이는 다시 한번 Agent 보안과 전통적인 소프트웨어 보안 사이의 매우 중요한 차이를 드러냈다. 과거 브라우저가 위험한 다운로드를 발견하면 경고를 띄워 사용자가 계속할지 결정하게 할 수 있었고, 은행이 이상 거래를 발견하면 우선 동결한 뒤 수동 검토를 기다릴 수 있었다.
그러나 Agent의 설계 목표는 바로 가능한 한 각 단계에서 사람의 참여를 줄이는 것이며, 스스로 정보를 읽고 판단한 뒤 다음 단계를 계속 실행해야 한다.
그래서 AI가 얻는 자율권이 점점 커질수록 '위험을 감지했다'는 것만으로는 충분하지 않을 수 있으며, 보안 메커니즘은 실제 실행 전에 위험한 동작을 막을 수 있는 능력을 갖춰야 한다.
이것이 오늘날 점점 더 많은 Agent 보안 논의가 Prompt, 콘텐츠 검열, 모델 자체에서 한 단계 더 나아가기 시작한 이유다. AI에게 "이 일은 해서는 안 된다는 것을 아는가"뿐만 아니라 설령 정말 하려고 해도 시스템이 그것을 못 하게 만들 능력이 있는가?를 물어야 한다.
그리고 다중 Agent의 등장은 이 문제를 더욱 복잡하게 만든다. 다음 단계에서 제한해야 할 대상이 이미 하나의 Agent가 아닐 수 있기 때문이다.
2. Agent 권한 초월보다 더 골치 아픈 것은 이들이 '결탁'하기 시작한다는 점
9월 초, OpenAI 내부 모델 훈련 및 평가 환경에서 일어난 한 사건이 적지 않은 AI 안전 연구자들의 주목을 받았다.
일부 Agent는 원래 각자 자신의 임무를 완수해야 했지만, 우연히 하나의 공용 Wiki를 발견하고 이를 점차 서로之间的 '공유 게시판'으로 바꾸었다. Agent는 거기에 정보를 남길 수 있었고, 다른 Agent는 이후 그 정보를 읽고 활용해 자신의 임무를 계속 완수했다.
OpenAI는 나중에 이 행동을 확인했고, 이후 공개된 정보에 따르면 다른 훈련 과정에서도 Agent가 내부 Artifactory를 공유 게시판으로 이용하거나, 공용 파일 호스팅 서비스를 통해 함께 작업하는 다른 Agent에게 결과를 전달한 사례가 있었다.
이 일에서 정말 흥미로운 점은 Agent 사이의 협력 형성이 그렇게 극적일 필요가 전혀 없을 수도 있다는 것을 보여준다는 것이다.
예를 들어 한 Agent가 어느 곳에 정보를 남길 수 있음을 발견하고, 다른 Agent가 우연히 그것을 읽고, 그러면 세 번째 Agent가 그 정보가 임무 완수에 도움이 된다는 것을 발견하는 식이다.
물론 Agent 간의 협력 자체가 나쁜 것은 아니다. 다중 Agent 시스템은 원래 분업과 정보 공유에 의존해 효율을 높여야 한다.
정말 경계해야 할 것은 이런 협력이 기존의 정보 격리, 독립 검토 또는 권한 제약을 우회하기 시작하고, 심지어 서로 견제해야 할 여러 Agent가 사실상의 이해 공동체를 형성할 때, 그것이 정상적 협력에서 유해한 '공모'로 변할 수 있다는 점이다.

결국 미래의 한 금융 기관은 여러 Agent를 동시에 운영할 가능성이 높다. 하나는 시장 분석을, 하나는 리스크 평가를, 하나는 거래 전략 생성을 담당하고, 또 하나는 실제 거래 및 자산 운영 권한을 갖는 식이다.
전통적인 권한 관리 관점에서 보면 이런 설계는 오히려 합리적이다.
- 연구 Agent에는 송금 권한이 없다.
- 실행 Agent에는 투자 방향을 독립적으로 결정할 권한이 없다.
- 리스크 Agent는 명백히 위험한 전략을 거부할 수 있다.
책임이 분리되어 있으니 이론적으로는 하나의 슈퍼 Agent가 모든 권한을 쥐는 것보다 더 안전해야 한다.
하지만 문제는 이들이 장기간 Memory를 공유하고, 서로의 출력을 읽고, 상대방의 반응에 따라 계속 자신의 행동을 조정할 수 있다면, 원래 서로 견제하기 위해 마련된 이 여러 역할이 점차 사실상의 하나의 전체로 변할 수 있지 않을까 하는 점이다.
예를 들어 연구 Agent는 점차 어떤 거래를 설명해야 리스크 심사를 더 쉽게 통과할 수 있는지 배울 수 있고, 심사를 담당하는 Agent도 과거 데이터에 따라某种 고정된 선호를 형성할 수 있으며, 실행 Agent는 이전의 대량 승인 결과에 따라 어떤 경계가 보통 차단되지 않는지 학습할 수 있다.
이런 관점에서 보면 어느 한 단계가 반드시 '악행'을 저지르는 것은 아닐 수 있지만, 전체 시스템이 최종적으로 얻는 결과는 사용자가 처음 설정한 목표에서 이미 벗어나 있을 수 있다.
이것이 바로 '공모' 또는 '결탁'이 정말 해결하기 어려운 지점이다. 리스크는 반드시某一个 Agent의 동작 안에 존재하는 것이 아니라, 여러 Agent 사이에 형성된 관계 안에 존재할 수 있다.

9월 13일, Vitalik Buterin은 이 문제를 자신이 오랫동안 연구해 온 메커니즘 설계와 연결 지었다. 그는 하나의 꽤 흥미로운 가능성으로 대립적 거버넌스(Adversarial Governance)의 메커니즘 설계 이론이 결국 AI Safety의 중요한 응용 중 하나가 될 수 있다고 제안했다.
그 이유는 두 종류의 문제가 사실 매우 깊은 유사성을 갖기 때문이다.
전통적인 메커니즘 설계에서는 상대적으로 단순하고 정적인 제도가 제도 자체보다 훨씬 영리하고 규칙의 경계를 능동적으로 찾아다니는 사람들을 제약하려 한다. 반면 미래의 AI 시스템에서는 인간과 상대적으로 능력이 약한 AI가 자신보다 능력이更强的 고급 Agent 무리를 관리하려는 상황이 될 수 있다.
Vitalik은 특히 과거 메커니즘 설계에서의 중요한 발견 하나를 언급했다. 참여자들 사이의 결탁을 효과적으로 제한할 수 있다면 시스템은 더 쉽게 이상적인 결과를 얻는 경향이 있다는 것이다.
이 결론은 AI에도 똑같이 적용될 수 있다.
3. Agent Wallet이 진짜로 필요로 하는 것은 아마 '권한 관리'만이 아닐 수 있다
다시 말해, 미래에 모든 위험 행동을 꿰뚫어 볼 완벽한 슈퍼 보안 모델이 존재한다고 가정하기보다는, 발상을 바꿔 시스템 안의 서로 다른 Agent들이 애초에 위험한 이해 공동체를 그렇게 쉽게 형성하지 못하게 하려면 어떻게 해야 하는가?를 생각하는 편이 낫다.
이것이 바로 '대립적 거버넌스'가 오늘날 우리에게 익숙한 권한 통제와 진정으로 다른 지점이다.
전통적인 권한 시스템이 해결하는 문제는 상대적으로 단순하며 주로 '누가 무엇을 할 수 있는가'를 중심으로 전개된다. 예를 들어 한 Agent가 이메일을 읽을 수 있는가? 거래 인터페이스를 호출할 수 있는가? 하루에 최대 얼마까지 쓸 수 있는가? 어떤 컨트랙트에 접근할 수 있는가? 어떤 한도를 넘으면 사용자가 다시 확인해야 하는가?
이런 설계는 물론 여전히 매우 중요하다.
사실 Agent가 실제 자산을 통제하기 시작하면 이는 과거 어느 때보다 더 중요해질 수 있다.
하지만 대립적 거버넌스는 한 걸음 더 나아가 묻고자 한다. 서로 다른 권한, 목표, 정보를 가진 Agent 무리가 동시에 운영될 때, 이들이 결합하여 애초에 아무도 갖지 못했던 능력을 얻는 것을 어떻게 막을 것인가?에 초점을 맞춘다.
이때 단순히 '보안 Agent를 하나 더 추가'하는 것만으로는 문제가 해결되지 않을 수 있다.
거래를 담당하는 Agent와 거래 심사를 담당하는 Agent가 완전히 같은 모델, 같은 데이터 소스, 같은 컨텍스트, 유사한 보상 목표를 사용한다면, 표면적으로는 두 층의 심사가 존재하지만 본질적으로는 같은 판단을 두 번 복제한 것에 불과할 수 있다.
진정으로 효과적인 견제는 오히려 시스템이 의식적으로 차이를 만들어내는 것을 요구할 수 있다.
예를 들어 전략 수립과 전략 심사를 담당하는 Agent가 서로 다른 정보 출처를 사용하게 하고, 서로 다른 역할 간에 공유할 수 있는 Memory를 제한하고, 고위험 작업은 반드시 서로 독립적인 검증 메커니즘을 거치게 하거나, 최종 자산 실행 계층이 상류 Agent의 판단을 단순히 신뢰하지 않고 미리 설정된 규칙에 부합하는 요청만 받아들이게 하는 것이다.
여기 담긴 사상은 사실 새롭지 않다. 은행은 직원을 신뢰한다고 해서 한 사람에게 지급 발의, 지급 승인, 최종 송금의 모든 권한을 동시에 주지 않는다. 상장사는 사업 부서가 매출 창출을 맡으면서 동시에 자신의 재무 감사 결과를 혼자 결정하게 하지 않는다.
쉽게 말해 이것은 현실 세계의 논리와 상통한다. 견고한 시스템은 원래 참여자가 결코 실수하거나 결탁하지 않을 것이라는 가정 위에 보안을 세워서는 안 된다.

이 논리를 Agent Wallet에 적용하면 특히 중요해진다.
전통적인 지갑 보안은 '사람'을 중심으로 한다. 따라서 사용자가 거래 내용을 확인하고, 사용자가 승인 여부를 결정하며, 마지막으로 사용자가 직접 서명한다. 그러나 Agent Wallet이 구현하려는 것은 정반대 방향이다. AI가 수익을 자동으로 수령하고, 포지션을 조정하고, 토큰을 교환하고, 크로스체인하고, 심지어 시장 변화에 따라 전체 자산 포트폴리오를 관리하게 하는 것이다.
만약 매 단계마다 다시 사용자 앞으로 가져와 확인을 받아야 한다면 Agent의 자동


