Vào thứ Hai vừa qua, OpenAI đã trình làng một mô hình AI mới tập trung vào an ninh mạng có tên là GPT-5.6-Cyber. Công ty cho biết mô hình này được thiết kế chuyên biệt cho việc nghiên cứu lỗ hổng bảo mật, kiểm thử xâm nhập (penetration testing) và ứng phó sự cố.
"Được xây dựng trên nền tảng GPT-5.6 Sol, mô hình này được huấn luyện để cải thiện khả năng thực hiện các tác vụ an ninh mạng chuyên sâu (ví dụ: tìm kiếm lỗ hổng Zero-Day và phát triển các chuỗi exploit) và giảm tỷ lệ từ chối đối với một số tác vụ cyber lưỡng dụng, có rủi ro cao," OpenAI chia sẻ.
Công ty trí tuệ nhân tạo này cho biết họ đang cung cấp GPT-5.6-Cyber thông qua Daybreak Red, một cấp độ dịch vụ mới cho phép các tổ chức khác truy cập vào các mô hình an ninh mạng được huấn luyện chuyên dụng để nghiên cứu lỗ hổng, xác thực exploit và kiểm thử bảo mật một cách hợp pháp.
GPT-5.6-Cyber là một phiên bản "cởi mở" hơn về mặt an ninh mạng của GPT-5.6 Sol, được phát triển dựa trên GPT-5.5-Cyber mà OpenAI đã phát hành vào tháng 6 năm 2026.
Cải thiện tỷ lệ phản hồi các yêu cầu an ninh mạng nâng cao
Để đo lường việc giảm tỷ lệ từ chối của GPT-5.6-Cyber thông qua quyền truy cập Daybreak Red, OpenAI đã tạo ra một bài đánh giá nội bộ có tên là Advanced Cybersecurity Completion Rate. Bài kiểm tra này đo lường tần suất các mô hình phản hồi các câu lệnh liên quan đến phát triển chuỗi exploit, vượt qua xác thực (authentication bypass), leo thang đặc quyền (privilege escalation) và các kịch bản an ninh mạng nâng cao khác.
Các thử nghiệm cho thấy GPT-5.6-Cyber hoàn thành 95,0% các yêu cầu này, so với chỉ 1,5% của GPT-5.6 Sol và 2,0% khi sử dụng với quyền truy cập Daybreak Blue. Nó cũng được chứng minh là hoàn thành nhiều yêu cầu hơn đáng kể so với GPT-5.5-Cyber (vốn chỉ đạt tỷ lệ 57,3%).
GPT-5.6-Cyber được huấn luyện để nâng cao hiệu suất trong các quy trình an ninh mạng liên quan đến phát triển exploit và nghiên cứu bảo mật nâng cao. Đánh giá dựa trên công cụ chuẩn ExploitGym cho thấy mô hình này vượt trội hơn cả GPT-5.6 Sol và GPT-5.5 Cyber.
Phát hiện lỗ hổng Zero-Day và những hạn chế
OpenAI cho biết mô hình cũng cho thấy những cải thiện trong việc tìm kiếm và đánh giá chính xác mức độ nghiêm trọng của các lỗ hổng Zero-Day mới nhờ quá trình huấn luyện chuyên biệt. Tuy nhiên, nó lại hoạt động kém hơn GPT-5.6 Sol trong các nhiệm vụ mở như tìm kiếm lỗ hổng trong một kho lưu trữ (repository), phát triển bản chứng minh khái niệm (proof-of-concept) và gửi báo cáo lỗ hổng chất lượng cao.
Công ty lưu ý rằng điều này là do "mô hình đôi khi tạo ra các báo cáo lỗ hổng ngắn hơn và ít chi tiết hơn."
Một trong những lỗ hổng nghiêm trọng được mô hình phát hiện là CVE-2026-15903 (điểm CVSS: 8.8), một lỗ hổng đọc và ghi ngoài phạm vi (out-of-bounds) trong engine JavaScript V8. Lỗ hổng này có thể cho phép kẻ tấn công từ xa thực thi mã tùy ý bên trong một sandbox thông qua một trang HTML được thiết kế đặc biệt.
Lỗ hổng này có thể được kết hợp với một lỗ hổng khác chưa từng được biết đến (cũng do mô hình tìm ra) để thoát khỏi sandbox của V8 heap. CVE-2026-15903 đã được Google vá vào giữa tháng 7 năm 2026. OpenAI cho biết mô hình cũng được sử dụng để phát hiện nhiều lỗi khác bao gồm:
- Ít nhất 5 lỗ hổng trong một hệ điều hành di động phổ biến, bao gồm một chuỗi tấn công từ ứng dụng không tin cậy đến leo thang đặc quyền cục bộ.
- 3 lỗ hổng nghiêm trọng trong một cơ sở dữ liệu phổ biến, bao gồm đường dẫn thực thi mã từ xa.
- Hơn 400 lỗ hổng có thể dẫn đến leo thang đặc quyền trong nhân (kernel) của một hệ điều hành phổ biến.
Sáng kiến Daybreak và các cấp độ truy cập
Daybreak Red là một trong hai cấp độ truy cập được OpenAI thiết lập như một phần của sáng kiến Daybreak ra mắt vào tháng 5 năm 2026. Cấp độ còn lại là Daybreak Blue, cung cấp quyền truy cập vào các mô hình đa dụng hàng đầu, bao gồm GPT-5.6 Sol, với các rào chắn bảo mật (guardrails) được tích hợp sẵn cho công việc phòng thủ được ủy quyền.
"Truy cập Daybreak Blue loại bỏ các rào chắn đó, giúp những người làm công tác phòng thủ tận dụng tối đa mô hình trong các tác vụ bảo mật thực tế, bao gồm phát hiện và ứng phó sự cố, điều tra, quản lý lỗ hổng và đánh giá bảo mật," công ty cho biết.
GPT-5.6-Cyber đã được cung cấp cho một nhóm các đối tác khách hàng tin cậy như Accenture, Akamai, Cisco, Cloudflare, CrowdStrike, Fortinet, IBM, Palo Alto Networks, PwC và Sophos để giúp xác định và vá các lỗ hổng trước khi kẻ tấn công có thể khai thác, từ đó thu hẹp "khoảng cách phòng thủ".
Các mô hình này đang được giới thiệu tới các công ty như một cách để gắn cờ các lỗ hổng bảo mật trong phần mềm, trong bối cảnh các tác nhân xấu đã tăng cường đáng kể việc sử dụng công nghệ AI để đẩy mạnh các chiến dịch và thực hiện các cuộc tấn công mạng với tốc độ và quy mô chưa từng thấy.
Thách thức trong việc vá lỗi bằng AI
Mặc dù các hệ thống AI đã cải thiện rõ rệt trong việc tìm kiếm và khai thác lỗ hổng, chúng vẫn cần sự can thiệp chuyên môn sâu từ con người. Các nghiên cứu đã chỉ ra rằng các mô hình suy luận có khả năng cyber như ChatGPT 5.5 hay Anthropic Claude Opus 4.8 vẫn gặp khó khăn trong việc vá hoàn toàn một lỗ hổng hoặc tránh tạo ra các vấn đề mới khi sửa lỗi.
"Tỷ lệ thành công trung bình trong việc tạo ra một bản vá giải quyết hoàn toàn lỗ hổng (mà không làm thay đổi hành vi của ứng dụng) chỉ là 26,0%," 1Password cho biết. "Các bản vá giải quyết được lỗ hổng nhưng làm thay đổi hành vi ứng dụng chiếm 20,1%. Ngược lại, các bản vá do LLM tạo ra không giải quyết được lỗ hổng, hoặc thêm lỗ hổng mới, hoặc cả hai, chiếm trung bình 53,9% thời gian."
Những phát hiện này nhấn mạnh rằng các mô hình hiện nay dù xuất sắc trong việc phát hiện nhiều loại lỗ hổng nhưng chỉ thực sự hiệu quả khi vá một "nhóm nhỏ" trong số đó.
"Các mô hình chạy với các biện pháp bảo vệ được giảm bớt sẽ mang lại rủi ro ngoài phạm vi sử dụng tiêu chuẩn, cho dù là từ việc lạm dụng hay sự không tương thích (misalignment)," OpenAI thừa nhận. "Bất chấp những rủi ro này, chúng tôi tin rằng việc dân chủ hóa quyền truy cập vào trí tuệ tiên phong cho những người phòng thủ là rất quan trọng để tăng tốc và tự động hóa phòng thủ mạng."