GCSA Agent, CyberGym에서 91.3%의 성과를 기록하며 글로벌 선도 AI 사이버 보안 에이전트 대열에 합류
- 핵심 관점: 글로벌 사이버 보안 연합(GCSA)이 자사의 AI 보안 에이전트가 CyberGym 실제 취약점 평가에서 91.3%의 성공률을 기록하며 선도적인 수준에 진입했다고 발표했다. 이는 사이버 보안 역량이 기반 대규모 언어 모델에서 완전한 자율 검증 능력을 갖춘 에이전트 기반 워크플로우로 전환되고 있음을 시사한다.
- 핵심 요소:
- CyberGym은 캘리포니아 대학교 버클리 캠퍼스에서 개발했으며, 188개의 대형 소프트웨어 프로젝트를 포괄하는 1,507개의 실제 취약점 테스트 인스턴스를 수집했다. AI 에이전트가 패치되지 않은 코드베이스에서 자율적으로 분석, 위치 파악, PoC 구성 및 실행 검증을 완료해야 한다.
- GCSA Agent는 Grok 4.5 및 Grok 4.6 모델을 기반으로 실행되며, 에이전트 기반 보안 프로세스를 통해 91.3%의 성공률을 달성했다. 작업은 PoC가 취약한 버전에서 성공적으로 트리거되고 수정된 버전에서 재현되지 않아야 성공으로 간주된다.
- 핵심 역량 전환은 AI가 실제 실행 환경에 진입하여 취약점 설명 이해, 코드 검색, 공격 표면 식별, 가설 검증 및 PoC 반복과 같은 완전한 보안 연구 사이클을 자율적으로 완료해야 한다는 점에 있다.
- CyberGym의 개방형 실험에 따르면, AI 에이전트는 이전에 알려지지 않은 여러 제로데이 취약점과 완전히 패치되지 않은 보안 패치를 이미 발견할 수 있었다. 이는 자율 취약점 분석이 실제 발견 능력으로 전환될 수 있는 잠재력을 보여준다.
- GCSA의 목표는 벤치마크 테스트에서 AI Security Agent 구축으로 전환하여 취약점 발견, 분석, 검증 및 수정을 포함한 완전한 보안 수명 주기에 참여하도록 추진하는 것이다. 협업 모델을 통해 대규모 코드베이스의 공격 경로 분석 및 실행 수준 검증 효율성을 향상시키는 것이다.

홍콩, 2026년 8월 29일 – 글로벌 사이버보안 연합(Global Cybersecurity Alliance, GCSA)은 오늘 GCSA Agent가 CyberGym 벤치마크 테스트에서 91.3%의 성공률을 기록하며 CyberGym의 "Leading Systems Above 90%" 선도 시스템 구간에 진입했다고 발표했습니다.
CyberGym(https://www.cybergym.io/cybergym) 은 미국 캘리포니아대학교 버클리 캠퍼스 연구팀이 개발한 대규모 실제 세계 사이버보안 평가 프레임워크로, 총 1,507개의 역사적 실제 취약점 테스트 사례를 수집하고 188개의 대형 소프트웨어 프로젝트를 대상으로 하며, AI 에이전트가 실제 취약점 분석 시나리오에서 갖는 실질적 역량을 평가하는 것을 목표로 합니다.
코드 이해, 지식 질의응답 또는 정적 분석 능력을 주로 평가하는 기존 AI 벤치마크와 달리, CyberGym은 AI 에이전트가 실제 취약점 코드 환경에 직접 직면하도록 요구합니다.
핵심 Level 1 테스트에서 AI 에이전트는 취약점 설명과 아직 수정되지 않은 코드베이스만 제공받은 상태에서 코드 분석, 취약점 탐지, 공격 경로 추론, PoC 구성 및 실행 검증을 자율적으로 완료해야 합니다. 생성된 PoC가 취약점 버전에서 목표 취약점을 성공적으로 트리거하고, 동시에 수정된 버전에서는 재현되지 않아야만 해당 작업이 성공한 것으로 간주됩니다.
따라서 CyberGym이 측정하는 것은 AI가 단순히 "코드를 이해하는지" 여부가 아니라, AI가 보안 분석부터 취약점 재현 및 검증에 이르는 전체 프로세스를 실제로 완수할 수 있는지입니다.

대형 언어 모델에서 보안 에이전트로
이번 CyberGym 테스트에서 GCSA Agent는 Grok 4.5 및 Grok 4.6 모델을 기반으로 실행되어 최종 91.3%의 성공률을 기록했습니다.
이 결과는 AI 사이버보안 분야에서 중요한 변화가 일어나고 있음을 보여줍니다:
최종 보안 역량을 결정하는 요소는 더 이상 기반 대형 언어 모델 자체만이 아닙니다.
실제 취약점 연구는 일반적으로 취약점 설명 이해, 대규모 코드 검색, 공격 표면 식별, 취약점 가설 수립, 테스트 입력 생성, 프로그램 실행, 피드백 분석, PoC 반복 개선 등 여러 단계를 연속적으로 완료해야 합니다.
GCSA Agent는 이러한 전체 프로세스를 중심으로 에이전트형 보안 작업 흐름을 구축했습니다.
그 목표는 단순히 대형 언어 모델을 활용한 코드 분석이 아니라, AI가 실제 실행 환경에 진입하여 보안 문제에 대해 자율적으로 가설을 수립하고, 실행 증거를 수집하며, 테스트를 수행하고, 최종적으로 재현 가능한 결과를 통해 보안 발견을 검증하도록 하는 것입니다.
이번 CyberGym 테스트는 이러한 역량에 대한 정량화된 외부 벤치마크를 제공합니다.
실제 세계를 겨냥한 취약점 연구 역량
CyberGym의 핵심 가치는 기존 AI 테스트와 실제 사이버보안 연구 간의 격차를 줄이는 데 있습니다.
평가 환경은 소프트웨어 프로젝트의 취약점 수정 이전 코드 상태를 복원하며, AI 에이전트는 수천 개의 파일과 수백만 줄의 코드를 포함하는 대규모 코드베이스에서 문제를 자율적으로 탐지하고, 궁극적으로 취약점을 실제로 트리거할 수 있는 PoC를 생성해야 할 수 있습니다.
더욱 주목할 만한 점은 CyberGym의 추가 연구가 이러한 에이전트형 보안 역량이 알려진 취약점 재현에 국한되지 않음을 이미 보여주고 있다는 것입니다.
개방형 취약점 연구 실험에서 AI 에이전트는 이전에 알려지지 않은 여러 제로데이 취약점(Zero-day Vulnerabilities)과 역사적으로 완전히 수정되지 않은 보안 패치를 이미 발견하여, 자율 취약점 분석 기술이 실제 취약점 발견 역량으로 전이될 가능성을 입증하고 있습니다.
GCSA에게 이것은 더욱 중요한 발전 방향입니다.
벤치마크 성적은 종착점이 아닙니다. GCSA의 목표는 실제 사이버보안 시나리오에 서비스를 제공할 수 있는 AI Security Agent를 더욱 구축하여, 취약점 발견, 분석, 검증 및 이후 수정에 이르는 전체 보안 수명주기에 점진적으로 참여하도록 하는 것입니다.
AI 네이티브 사이버보안 역량 구축
인공지능이 소프트웨어 개발을 가속화함에 따라, AI는 취약점 연구와 네트워크 공격·방어 방식 역시 변화시키고 있습니다.
규모가 점점 커지고 복잡성이 점점 높아지는 소프트웨어 시스템에 직면하여, 차세대 사이버보안 체계는 점점 더 인간 보안 전문가와 자율 AI 에이전트 간의 협력에 의존하게 될 것입니다.
AI Security Agent는 보안 팀이 다음과 같은 역량을 확보하도록 지원할 것으로 기대됩니다:
* 실제 활용 가치가 있는 소프트웨어 취약점을 더 일찍 발견;
* 대규모 코드베이스에서 복잡한 공격 경로를 자동으로 분석;
* PoC를 자동 생성하여 취약점에 대한 실행 수준 검증 수행;
* 실제 실행 결과를 통해 기존 보안 탐지의 오탐(false positive) 감소;
* 취약점 분석, 검증 및 수정 효율성 향상;
* 전문 보안 팀이 커버할 수 있는 소프트웨어 및 시스템 규모 확장.
GCSA Agent가 CyberGym에서 91.3%의 성적을 달성한 것은 GCSA가 AI 네이티브 사이버보안 역량을 구축하는 데 있어 중요한 이정표적 성과입니다.
향후 GCSA는 자율 취약점 분석, AI Security Agent 및 지능형 사이버보안 기술 연구를 지속적으로 추진하여, 최첨단 인공지능 역량을 실제 세계의 보안 역량으로 더욱 전환하고, 더욱 안전하고 신뢰할 수 있으며 회복탄력성을 갖춘 디지털 환경을 구축하는 데 기술적 지원을 제공할 것입니다.
출처: GCSA 글로벌 사이버보안 연합
공식 웹사이트: www.gcsa.org


