GCSA AgentがCyberGymで91.3%の成績を達成、世界有数のAIサイバーセキュリティエージェントに
- 核心見解:世界サイバーセキュリティ連盟(GCSA)は、そのAIセキュリティエージェントがCyberGymの実在する脆弱性評価において91.3%の成功率を達成し、トップクラスの水準に到達したと発表した。これは、サイバーセキュリティ能力が基盤となる大規模モデルから、完全な自律的検証能力を備えたエージェント型ワークフローへと移行しつつあることを示している。
- 重要要素:
- CyberGymはカリフォルニア大学バークレー校によって開発され、188の大規模ソフトウェアプロジェクトを対象とした1,507件の実在する脆弱性テストケースを収録している。AIエージェントは、未修正のコードベースにおいて、分析、特定、PoC構築、実行検証を自律的に完了することが求められる。
- GCSA AgentはGrok 4.5およびGrok 4.6モデル上で動作し、エージェント型セキュリティプロセスを通じて91.3%の成功率を達成している。タスクが成功とみなされるには、PoCが脆弱性のあるバージョンでトリガーされ、修正版では再現されないことが必要である。
- 核心となる能力の転換点は、AIが実際の実行環境に入り込み、脆弱性の説明理解、コード検索、攻撃対象領域の特定、仮説検証、PoCの反復といった完全なセキュリティ研究サイクルを自律的に完了する必要がある点にある。
- CyberGymのオープンな実験によると、AIエージェントは、これまで知られていなかった複数のゼロデイ脆弱性や、不完全な修正のまま残されているセキュリティパッチをすでに発見できるようになっており、自律的な脆弱性分析が実際の発見能力へと移行する可能性を示している。
- GCSAの目標は、ベンチマークテストからAI Security Agentの構築へとシフトしており、脆弱性の発見、分析、検証、修正を含む完全なセキュリティライフサイクルへの参加を推進し、協調的なモデルを通じて、大規模コードベースにおける攻撃経路分析と実行レベルの検証効率を向上させることを目指している。

香港、2026年8月29日 — グローバルサイバーセキュリティアライアンス(Global Cybersecurity Alliance、GCSA)は本日、GCSA AgentがCyberGymベンチマークテストで91.3%の成功率を達成し、CyberGymの「Leading Systems Above 90%」リーディングシステム圏内に入ったことを発表した。
CyberGym(https://www.cybergym.io/cybergym)は、米国カリフォルニア大学バークレー校の研究チームによって開発された大規模な実世界サイバーセキュリティ評価フレームワークであり、188の大規模ソフトウェアプロジェクトをカバーする1,507件の歴史的な実在する脆弱性テストケースを収録し、AIエージェントの実脆弱性分析シナリオにおける実際の能力を評価することを目的としている。
コード理解、知識応答、静的解析能力を主に評価する従来のAIベンチマークとは異なり、CyberGymはAIエージェントが実際の脆弱性コード環境に直接向き合うことを要求する。
中核となるLevel 1テストでは、AIエージェントは脆弱性の説明と未修正のコードベースのみを与えられ、コード分析、脆弱性の特定、攻撃経路の推論、PoCの構築、実行による検証を自律的に完了する必要がある。生成されたPoCが脆弱性のあるバージョンでターゲットの脆弱性を正常にトリガーし、かつ修正後のバージョンでは再現できない場合にのみ、タスクは成功とみなされる。
したがって、CyberGymが測定するのはAIがコードを「理解しているか」だけでなく、AIがセキュリティ分析から脆弱性の再現・検証に至る完全なプロセスを実際に完了できるかどうかである。

大規模言語モデルからセキュリティエージェントへ
今回のCyberGymテストにおいて、GCSA AgentはGrok 4.5およびGrok 4.6モデルを基盤として稼働し、最終的に91.3%の成功率を達成した。
この結果は、AIサイバーセキュリティ分野で進行中の重要な変化を反映している:
最終的なセキュリティ能力を決定するのは、もはや基盤となる大規模言語モデル自体だけではない。
実際の脆弱性研究には通常、脆弱性の説明の理解、大規模なコード検索、攻撃面の特定、脆弱性仮説の構築、テスト入力の生成、プログラム実行、フィードバック分析、そしてPoCの反復的な改善といった複数の段階を連続して完了することが求められる。
GCSA Agentはこの完全なプロセスを中心に、エージェント型のセキュリティワークフローを構築している。
その目標は、単に大規模言語モデルを利用したコード分析ではなく、AIが実際の実行環境に入り込み、セキュリティ問題を中心に自律的に仮説を形成し、実行の証拠を収集し、テストを実行し、最終的に再現可能な結果によってセキュリティ上の発見を検証できるようにすることである。
今回のCyberGymテストは、この能力に対する定量化可能な外部ベンチマークを提供するものである。
実世界に向けた脆弱性研究能力
CyberGymの中核的価値は、従来のAIテストと実際のサイバーセキュリティ研究との間のギャップを縮小することにある。
その評価環境はソフトウェアプロジェクトの脆弱性修正前のコード状態を復元し、AIエージェントは数千のファイルと数百万行のコードを含む大規模なコードベース内で問題を自律的に特定し、最終的に実際に脆弱性をトリガーできるPoCを生成する必要がある。
さらに注目すべきは、CyberGymのさらなる研究が、このようなエージェント型セキュリティ能力が既知の脆弱性の再現に限定されないことを示している点である。
オープンエンドの脆弱性研究実験において、AIエージェントはこれまで未知だった複数のゼロデイ脆弱性(Zero-day Vulnerabilities)や、歴史的に完全には修正されていなかったセキュリティパッチをすでに発見しており、自律的脆弱性分析技術が実際の脆弱性発見能力へと移行する可能性を示している。
GCSAにとって、これこそがより重要な発展方向である。
ベンチマークのスコアは終着点ではない。GCSAの目標は、実際のサイバーセキュリティシナリオに貢献できるAI Security Agentをさらに構築し、脆弱性の発見、分析、検証、さらにはその後の修正に至る完全なセキュリティライフサイクルに段階的に関与させることである。
AIネイティブなサイバーセキュリティ能力の構築
人工知能がソフトウェア開発を加速させるにつれ、AIは脆弱性研究やサイバー攻防の方法にも同時に変革をもたらしている。
規模がますます大きく、複雑性がますます高まるソフトウェアシステムに対して、次世代のサイバーセキュリティ体制は、人間のセキュリティ専門家と自律型AIエージェントとの間の協力にますます依存するようになるだろう。
AI Security Agentはセキュリティチームの以下を支援することが期待される:
* 実際の悪用価値を持つソフトウェア脆弱性をより早期に発見する;
* 大規模なコードベース内で複雑な攻撃経路を自動的に分析する;
* PoCを自動生成し、脆弱性の実行レベルでの検証を行う;
* 実際の実行結果を通じて従来のセキュリティ検知における誤検知を削減する;
* 脆弱性の評価、検証、修正の効率を加速する;
* 専門セキュリティチームがカバーできるソフトウェアとシステムの規模を拡大する。
GCSA AgentがCyberGymで91.3%のスコアを達成したことは、GCSAがAIネイティブなサイバーセキュリティ能力を構築する上での重要なマイルストーンである。
今後、GCSAは自律的脆弱性分析、AI Security Agent、インテリジェントなサイバーセキュリティ技術の研究を引き続き推進し、最先端の人工知能能力を実世界のセキュリティ能力へとさらに転換し、より安全で信頼性が高く、回復力のあるデジタル環境の構築に技術的支援を提供していく。
出典:GCSA グローバルサイバーセキュリティアライアンス
公式サイト:www.gcsa.org


