OpenAI vào thứ Năm đã chính thức trình làng GPT‑6 Astra, mô hình được mô tả là "mô hình thông minh và căn chỉnh (aligned) nhất thế giới".
Sự kiện này diễn ra vài ngày sau khi công ty trí tuệ nhân tạo (AI) cho biết mô hình đã đạt đến ngưỡng năng lực an ninh mạng "Critical" theo Khung chuẩn bị (Preparedness Framework) của mình.
"Astra dẫn đầu về khả năng sử dụng máy tính, duyệt web, kỹ thuật phần mềm, an ninh mạng, khoa học và công việc chuyên môn. Astra đạt điểm tuyệt đối 98% trên FrontierMath Tier 4," OpenAI cho biết. "Astra cũng đạt 99,9% trên ARC-AGI-3 và 100% trên ExploitBench. Nó cũng thiết lập một ranh giới mới về việc sử dụng máy tính và trình duyệt, xử lý những công việc chuyên môn khắt khe nhất với tốc độ, độ chính xác và khả năng phán đoán vô song."
Mô hình hiện đang được triển khai cho một nhóm nhỏ các tổ chức và dự kiến sẽ sớm có sẵn cho tất cả người dùng ChatGPT Plus, Pro, Business và Enterprise, cũng như thông qua OpenAI API, Microsoft Azure và Amazon Web Services (AWS) Bedrock.
Khả năng an ninh mạng vượt trội của GPT-6 Astra
Trên ExploitBench, công cụ đánh giá khả năng của mô hình trong việc chuyển đổi các lỗ hổng phần mềm đã biết thành các exploit hoạt động được, Astra đã đạt điểm số hoàn hảo 100%, so với mức 78,5% của GPT‑5.6 Sol, mô hình có khả năng cyber hàng đầu trước đó của hãng.
OpenAI cho biết mô hình này cũng đạt được tỷ lệ arbitrary code-execution cao hơn đáng kể so với GPT‑5.6 Sol khi thử nghiệm khả năng phát triển exploit bằng cách sử dụng các lỗi từ ba tháng trước đó (từ tháng 7 đến tháng 8 năm 2026). Điều này bao gồm hai lỗ hổng zero-day trong các phần mềm không được chỉ định.
Astra cũng được trang bị để sử dụng các lỗ hổng chưa từng được biết đến trước đây nhằm thực hiện code execution trong các trình duyệt đã được bảo mật (hardened browsers) và phát triển các exploit privilege-escalation cho các hệ điều hành đã được bảo mật, nếu được phép chạy mà không có bất kỳ biện pháp bảo vệ nào.
Các biện pháp bảo vệ và ngăn chặn lạm dụng
Do tính chất lưỡng dụng (dual-use) của các công cụ này – những khả năng có thể giúp người phòng thủ tìm ra điểm yếu nhanh hơn cũng có thể bị những kẻ xấu lạm dụng để khai thác chúng dễ dàng hơn – OpenAI cho biết phiên bản Astra đang được phát hành bị giới hạn ở việc kiểm tra mã nguồn bảo mật (secure code review) và vá lỗi, đồng thời từ chối tuân thủ các yêu cầu liên quan đến việc tạo proof-of-concept (PoC) exploit cho các lỗ hổng.
"Thông qua OpenAI Daybreak, chúng tôi dự định mở rộng quyền truy cập và triển khai các biện pháp bảo vệ ít hạn chế hơn trong những tuần tới," công ty khởi nghiệp AI cho biết. "Điều này sẽ cho phép thực hiện nhiều quy trình phòng thủ hơn, bao gồm xác thực lỗ hổng và proof-of-concept, phân tích malware và kỹ thuật phát hiện (detection engineering)."
Để giải quyết các lo ngại về việc lạm dụng mô hình, OpenAI cho biết họ đã tăng cường độ mạnh (robustness) của mô hình để xử lý tốt hơn các nỗ lực jailbreak, bổ sung thêm ngữ cảnh cho các hệ thống giám sát và các biện pháp bảo vệ bổ sung để giúp phát hiện và ngăn chặn sự sai lệch (misalignment).
Astra cũng "có nhiều khả năng" hoạt động trong phạm vi giới hạn do người dùng thiết lập và môi trường của nó, mặc dù hãng cảnh báo rằng các bước kiểm tra an toàn đôi khi có thể làm gián đoạn công việc hợp lệ, bao gồm cả an ninh mạng phòng thủ, lúc đó người dùng sẽ được nhắc xem lại hành động trước khi tiếp tục.
"Trong các môi trường nhạy cảm, Astra tiến hành một cách thận trọng tương xứng với rủi ro của nó," công ty cho biết thêm. "Trong một đánh giá về các nhiệm vụ sử dụng máy tính được lựa chọn một cách đối nghịch để gợi ra hành vi sai trái, Astra đã thành công hơn trong việc tránh các hậu quả ngoài ý muốn. Việc chạy với các biện pháp an ninh bổ sung được cung cấp mặc định mang lại hiệu suất thậm chí còn mạnh mẽ hơn."
Sáng kiến Daybreak cho lực lượng phòng thủ tuyến đầu
Việc phát hành Astra diễn ra khi OpenAI khởi xướng một sáng kiến mới nhằm cung cấp quyền truy cập trợ giá vào các mô hình của mình, đào tạo thực hành và hỗ trợ kỹ thuật cho các lĩnh vực hạ tầng trọng yếu, bao gồm hệ thống nước, nhà cung cấp điện, chính quyền bang và địa phương, ngân hàng, tổ chức phi lợi nhuận, những người duy trì mã nguồn mở và các tổ chức có nguồn lực an ninh hạn chế.
Dự án toàn cầu có tên gọi là Daybreak for Frontline Defenders, đặt mục tiêu cam kết 1 tỷ USD để giúp những người phòng thủ sử dụng các khả năng AI cyber hàng đầu nhằm bảo vệ các dịch vụ thiết yếu chống lại các cuộc tấn công mạng. Đồng thời, công ty cũng công bố một chương trình thí điểm mới với Trung tâm Phân tích và Chia sẻ Thông tin Đa bang Hoa Kỳ (MS-ISAC) để trang bị cho nhóm ban đầu gồm những người phòng thủ khu vực công và hệ thống nước quyền truy cập Daybreak, đào tạo có hướng dẫn và hỗ trợ thực hành.
"Chúng ta đang có một 'cửa sổ phòng thủ': một cơ hội đang hẹp dần để sử dụng AI nhằm lấp đầy các lỗ hổng bảo mật trước khi những kẻ tấn công chiếm lấy chúng," OpenAI nói. "Vai trò của chúng tôi là giúp đưa những công cụ mạnh mẽ vào tay những người phòng thủ để họ có thể bảo vệ hệ thống và những người mà họ chịu trách nhiệm."