GCSA Agent đạt 91,3% điểm số trên CyberGym, lọt vào nhóm các tác nhân AI an ninh mạng hàng đầu thế giới
- Quan điểm cốt lõi: Liên minh An ninh Mạng Toàn cầu (GCSA) công bố tác nhân an ninh AI của mình đạt tỷ lệ thành công 91,3% trong bài đánh giá lỗ hổng thực tế CyberGym, bước vào nhóm dẫn đầu, đánh dấu năng lực an ninh mạng đang chuyển dịch từ các mô hình nền tảng sang quy trình làm việc dạng tác nhân với khả năng xác minh tự động hoàn chỉnh.
- Yếu tố then chốt:
- CyberGym được phát triển bởi Đại học California, Berkeley, bao gồm 1.507 trường hợp kiểm thử lỗ hổng thực tế, phủ 188 dự án phần mềm quy mô lớn, yêu cầu tác nhân AI tự động hoàn thành phân tích, định vị, xây dựng PoC và xác minh thực thi trong kho mã chưa được vá.
- GCSA Agent chạy trên nền tảng mô hình Grok 4.5 và Grok 4.6, đạt tỷ lệ thành công 91,3% thông qua quy trình bảo mật dạng tác nhân. Nhiệm vụ chỉ được công nhận thành công khi PoC kích hoạt lỗ hổng trên phiên bản có lỗi và không thể tái hiện trên phiên bản đã vá.
- Sự thay đổi năng lực cốt lõi nằm ở việc AI cần bước vào môi trường thực thi thực tế, tự động hoàn thành vòng khép kín nghiên cứu bảo mật bao gồm hiểu mô tả lỗ hổng, tìm kiếm mã, xác định bề mặt tấn công, xác minh giả thuyết và lặp lại PoC.
- Thí nghiệm mở CyberGym cho thấy các tác nhân AI đã có thể phát hiện nhiều lỗ hổng zero-day chưa từng được biết đến cũng như các bản vá bảo mật chưa hoàn thiện, cho thấy tiềm năng dịch chuyển từ phân tích lỗ hổng tự động sang khả năng phát hiện thực tế.
- Mục tiêu của GCSA là chuyển từ kiểm tra chuẩn sang xây dựng AI Security Agent, thúc đẩy sự tham gia vào vòng đời bảo mật hoàn chỉnh bao gồm phát hiện, phân tích, xác minh và vá lỗ hổng, nâng cao hiệu quả phân tích đường tấn công trên kho mã quy mô lớn và xác minh cấp độ thực thi thông qua mô hình cộng tác.

Hồng Kông, ngày 29 tháng 8 năm 2026 — Liên minh An ninh mạng Toàn cầu (Global Cybersecurity Alliance, GCSA) hôm nay công bố, GCSA Agent đã đạt tỷ lệ thành công 91,3% trong bài kiểm tra chuẩn CyberGym, lọt vào nhóm "Leading Systems Above 90%" (Các hệ thống dẫn đầu trên 90%) của CyberGym.
CyberGym (https://www.cybergym.io/cybergym) là khung đánh giá an ninh mạng quy mô lớn trong thế giới thực do nhóm nghiên cứu của Đại học California, Berkeley phát triển, bao gồm 1.507 trường hợp kiểm thử lỗ hổng thực tế trong lịch sử, phủ 188 dự án phần mềm lớn, nhằm đánh giá khả năng thực tế của các tác nhân AI trong các tình huống phân tích lỗ hổng thực tế.
Khác với các bài kiểm tra chuẩn AI truyền thống chủ yếu đánh giá khả năng hiểu mã, trả lời kiến thức hoặc phân tích tĩnh, CyberGym yêu cầu các tác nhân AI phải trực tiếp đối mặt với môi trường mã lỗ hổng thực tế.
Trong bài kiểm tra Level 1 cốt lõi, tác nhân AI chỉ nhận được mô tả lỗ hổng và mã nguồn chưa được sửa, cần tự hoàn thành phân tích mã, xác định vị trí lỗ hổng, suy luận đường tấn công, xây dựng PoC và xác minh thực thi. Chỉ khi PoC được tạo ra có thể kích hoạt thành công lỗ hổng mục tiêu trong phiên bản có lỗ hổng, đồng thời không thể tái hiện trong phiên bản đã được sửa, nhiệm vụ mới được coi là thành công.
Do đó, CyberGym không chỉ đo lường liệu AI có "hiểu mã" hay không, mà còn đo lường liệu AI có thực sự hoàn thành toàn bộ quy trình từ phân tích bảo mật đến tái hiện và xác minh lỗ hổng hay không.

Từ mô hình lớn đến tác nhân bảo mật thông minh
Trong bài kiểm tra CyberGym lần này, GCSA Agent chạy trên các mô hình Grok 4.5 và Grok 4.6, cuối cùng đạt tỷ lệ thành công 91,3%.
Kết quả này cũng phản ánh một thay đổi quan trọng đang diễn ra trong lĩnh vực an ninh mạng AI:
Điều quyết định khả năng bảo mật cuối cùng không còn chỉ là bản thân mô hình nền tảng.
Nghiên cứu lỗ hổng thực tế thường yêu cầu liên tục hoàn thành nhiều giai đoạn bao gồm hiểu mô tả lỗ hổng, tìm kiếm mã quy mô lớn, xác định bề mặt tấn công, thiết lập giả thuyết lỗ hổng, tạo đầu vào kiểm thử, thực thi chương trình, phân tích phản hồi và lặp lại PoC nhiều lần.
GCSA Agent xây dựng quy trình làm việc bảo mật dựa trên tác nhân xoay quanh toàn bộ quy trình này.
Mục tiêu của nó không chỉ đơn giản là sử dụng mô hình ngôn ngữ lớn để phân tích mã, mà là cho phép AI bước vào môi trường thực thi thực tế, tự hình thành giả thuyết xung quanh các vấn đề bảo mật, thu thập bằng chứng vận hành, thực hiện kiểm thử, và cuối cùng xác minh các phát hiện bảo mật bằng kết quả có thể tái hiện.
Bài kiểm tra CyberGym lần này cung cấp một chuẩn mực bên ngoài có thể định lượng cho khả năng này.
Khả năng nghiên cứu lỗ hổng hướng đến thế giới thực
Giá trị cốt lõi của CyberGym nằm ở việc thu hẹp khoảng cách giữa kiểm thử AI truyền thống và nghiên cứu an ninh mạng thực tế.
Môi trường đánh giá của nó khôi phục trạng thái mã trước khi sửa lỗ hổng của các dự án phần mềm, tác nhân AI có thể cần tự xác định vấn đề trong các kho mã lớn chứa hàng nghìn tệp, hàng triệu dòng mã, và cuối cùng tạo ra PoC có thể thực sự kích hoạt lỗ hổng.
Đáng chú ý hơn, các nghiên cứu sâu hơn của CyberGym đã chỉ ra rằng khả năng bảo mật dựa trên tác nhân này không chỉ giới hạn ở việc tái hiện các lỗ hổng đã biết.
Trong các thí nghiệm nghiên cứu lỗ hổng mở, các tác nhân AI đã phát hiện nhiều lỗ hổng zero-day chưa từng được biết đến trước đây cũng như các bản vá bảo mật chưa được khắc phục hoàn toàn trong lịch sử, cho thấy tiềm năng chuyển dịch của công nghệ phân tích lỗ hổng tự động sang khả năng phát hiện lỗ hổng thực tế.
Đối với GCSA, đây cũng là hướng phát triển quan trọng hơn.
Điểm số Benchmark không phải là đích đến. Mục tiêu của GCSA là tiếp tục xây dựng AI Security Agent có thể phục vụ các tình huống an ninh mạng thực tế, để nó dần tham gia vào toàn bộ vòng đời bảo mật bao gồm phát hiện, phân tích, xác minh và thậm chí khắc phục lỗ hổng.
Xây dựng năng lực an ninh mạng bản địa AI
Khi trí tuệ nhân tạo thúc đẩy phát triển phần mềm, AI cũng đang thay đổi cách thức nghiên cứu lỗ hổng cũng như tấn công và phòng thủ mạng.
Đối mặt với các hệ thống phần mềm ngày càng lớn và phức tạp hơn, thế hệ hệ thống an ninh mạng tiếp theo sẽ ngày càng phụ thuộc vào sự cộng tác giữa các chuyên gia bảo mật con người và các tác nhân AI tự động.
AI Security Agent được kỳ vọng sẽ giúp các đội ngũ bảo mật:
* Phát hiện sớm hơn các lỗ hổng phần mềm có giá trị khai thác thực tế;
* Tự động phân tích các đường tấn công phức tạp trong các kho mã lớn;
* Tự động tạo PoC để xác minh lỗ hổng ở cấp độ thực thi;
* Giảm tỷ lệ báo động giả trong các hoạt động phát hiện bảo mật truyền thống thông qua kết quả vận hành thực tế;
* Tăng tốc hiệu quả phân tích, xác minh và khắc phục lỗ hổng;
* Mở rộng quy mô phần mềm và hệ thống mà các đội ngũ bảo mật chuyên nghiệp có thể bao phủ.
Việc GCSA Agent đạt 91,3% trong CyberGym là một cột mốc quan trọng trong quá trình GCSA xây dựng năng lực an ninh mạng bản địa AI.
Trong tương lai, GCSA sẽ tiếp tục thúc đẩy phân tích lỗ hổng tự động, AI Security Agent và nghiên cứu công nghệ an ninh mạng thông minh, chuyển đổi các khả năng AI tiên tiến thành năng lực bảo mật trong thế giới thực, cung cấp hỗ trợ kỹ thuật để xây dựng một môi trường kỹ thuật số an toàn hơn, đáng tin cậy hơn và có khả năng chống chịu tốt hơn.
Nguồn: Liên minh An ninh mạng Toàn cầu GCSA
Trang web chính thức: www.gcsa.org


