GCSA Agent在CyberGym取得91.3%成績,躋身全球領先AI網路安全智慧體行列
- 核心觀點:全球網路安全聯盟(GCSA)宣布其AI安全智慧體在CyberGym真實漏洞評測中取得91.3%成功率,進入領先區間,標誌著網路安全能力正從底層大模型轉向具備完整自主驗證能力的智慧體化工作流程。
- 關鍵要素:
- CyberGym由加州大學柏克萊分校開發,收錄1,507個真實漏洞測試實例,涵蓋188個大型軟體專案,要求AI智慧體在未修補程式碼庫中自主完成分析、定位、PoC建構與執行驗證。
- GCSA Agent基於Grok 4.5與Grok 4.6模型運行,透過智慧體化安全流程實現91.3%的成功率,任務需PoC在漏洞版本成功觸發且修補版本無法重現方認定成功。
- 核心能力轉變在於AI需進入真實執行環境,自主完成漏洞描述理解、程式碼檢索、攻擊面識別、假設驗證及PoC迭代等完整安全研究閉環。
- CyberGym開放式實驗顯示,AI Agent已能發現多項此前未知的零日漏洞及未完全修復的安全修補程式,表明自主漏洞分析向真實發現能力遷移的潛力。
- GCSA目標從基準測試轉向建構AI Security Agent,推動其參與漏洞發現、分析、驗證與修復的完整安全生命週期,以協作模式提升大型程式碼庫攻擊路徑分析與執行級驗證效率。

香港,2026 年 8 月 29 日 —— 全球網路安全聯盟(Global Cybersecurity Alliance,GCSA)今日宣布,GCSA Agent 在 CyberGym 基準測試中取得 91.3% 的成功率,進入 CyberGym「Leading Systems Above 90%」領先系統區間。
CyberGym(https://www.cybergym.io/cybergym) 是由美國加州大學柏克萊分校研究團隊開發的大規模真實世界網路安全評測框架,共收錄 1,507 個歷史真實漏洞測試實例,覆蓋 188 個大型軟體專案,旨在評估 AI 智慧體在真實漏洞分析場景中的實際能力。
與主要評估程式碼理解、知識問答或靜態分析能力的傳統 AI Benchmark 不同,CyberGym 要求 AI 智慧體直接面對真實的漏洞程式碼環境。
在其核心 Level 1 測試中,AI Agent 僅獲得漏洞描述以及尚未修復的程式碼庫,需要自主完成程式碼分析、漏洞定位、攻擊路徑推理、PoC 建構和執行驗證。只有生成的 PoC 能夠在漏洞版本中成功觸發目標漏洞、同時無法在修復後的版本中重現,任務才被認定為成功。
因此,CyberGym 所衡量的並不只是 AI 是否「理解程式碼」,而是 AI 是否能夠真正完成從安全分析到漏洞重現和驗證的完整過程。

從大模型走向安全智慧體
本次 CyberGym 測試中,GCSA Agent 基於 Grok 4.5 與 Grok 4.6 模型運行,最終取得 91.3% 的成功率。
這一結果也反映出 AI 網路安全領域正在發生的一項重要變化:
決定最終安全能力的,不再只是底層大模型本身。
真實漏洞研究通常需要連續完成漏洞描述理解、大規模程式碼檢索、攻擊面識別、漏洞假設建立、測試輸入生成、程式執行、回饋分析以及 PoC 反覆迭代等多個環節。
GCSA Agent 圍繞這一完整過程建構智慧體化安全工作流程。
其目標並非簡單地利用大語言模型進行程式碼分析,而是讓 AI 能夠進入真實執行環境,圍繞安全問題自主形成假設、收集運行證據、執行測試,並最終以可重現結果驗證安全發現。
此次 CyberGym 測試,為這一能力提供了一個可量化的外部基準。
面向真實世界的漏洞研究能力
CyberGym 的核心價值,在於縮小傳統 AI 測試與真實網路安全研究之間的差距。
其評測環境會恢復軟體專案漏洞修復前的程式碼狀態,AI Agent 可能需要在包含數千個檔案、數百萬行程式碼的大型程式碼庫中自主定位問題,並最終生成能夠真正觸發漏洞的 PoC。
更值得關注的是,CyberGym 的進一步研究已經顯示,這種智慧體化安全能力並不局限於重現已知漏洞。
在開放式漏洞研究實驗中,AI Agent 已發現多項此前未知的零日漏洞(Zero-day Vulnerabilities)以及歷史上並未完全修復的安全修補程式,顯示出自主漏洞分析技術向真實漏洞發現能力遷移的潛力。
對 GCSA 而言,這也是更重要的發展方向。
Benchmark 成績不是終點。GCSA 的目標,是進一步建立能夠服務真實網路安全場景的 AI Security Agent,使其逐步參與漏洞發現、分析、驗證乃至後續修復的完整安全生命週期。
建構 AI 原生網路安全能力
隨著人工智慧加速軟體開發,AI 同樣正在改變漏洞研究與網路攻防的方式。
面對規模越來越大、複雜度越來越高的軟體系統,下一代網路安全體系將越來越依賴人類安全專家與自主 AI 智慧體之間的協作。
AI Security Agent 有望幫助安全團隊:
* 更早發現具有真實利用價值的軟體漏洞;
* 在大型程式碼庫中自動分析複雜攻擊路徑;
* 自動生成 PoC,對漏洞進行執行級驗證;
* 透過真實運行結果降低傳統安全偵測中的誤報;
* 加快漏洞研判、驗證與修復效率;
* 擴展專業安全團隊能夠覆蓋的軟體與系統規模。
GCSA Agent 在 CyberGym 取得 91.3% 的成績,是 GCSA 建構 AI 原生網路安全能力的重要階段性成果。
未來,GCSA 將繼續推進自主漏洞分析、AI Security Agent 與智慧化網路安全技術研究,將前沿人工智慧能力進一步轉化為真實世界中的安全能力,為建構更加安全、可信且具有韌性的數位環境提供技術支援。
來源:GCSA 全球網路安全聯盟
官網:www.gcsa.org


