Anthropic hôm thứ Ba vừa thông báo về việc mở rộng chương trình cho phép các chuyên gia an ninh mạng đã qua kiểm duyệt thử nghiệm các mô hình trí tuệ nhân tạo (AI) tiên tiến của mình với các biện pháp bảo vệ và bộ phân loại chặn được giảm bớt. Quyết định này được đưa ra khi công ty tuyên bố sáng kiến Project Glasswing của mình đã phát hiện ít nhất 129.000 lỗ hổng phần mềm đã được xác minh từ tháng 4 đến tháng 7 năm 2026.
Công ty cho biết họ cũng đã tìm thấy thêm 5.500 lỗ hổng phần mềm đã xác minh khác từ tháng 4 đến tháng 10 năm 2026 thông qua các nỗ lực quét mã nguồn mở.
"Trong số những lỗ hổng đã được xác minh này, hơn 33.000 lỗ hổng cho đến nay đã được xếp hạng ở mức độ nghiêm trọng critical hoặc high," Anthropic cho biết. "Đây có thể là một con số thấp hơn thực tế, vì nó dựa trên dữ liệu khảo sát từ chỉ một nhóm nhỏ các đối tác của Glasswing. Do đó, chúng tôi dự đoán tác động thực tế có thể cao hơn ít nhất gấp năm lần."
Chương trình được cập nhật, có tên là Cyber Verification Program (CVP), bao gồm ba cấp độ truy cập, cho phép các tổ chức và đội ngũ bảo mật đăng ký cấp độ phù hợp nhất với công việc của họ. Mỗi cấp độ đi kèm với quyền truy cập vào các mô hình của Anthropic, bao gồm Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 và các mô hình mới trong tương lai.
Ba cấp độ truy cập của chương trình CVP
- Defense Access: Dành cho các công việc phòng thủ như ứng cứu sự cố (incident response), dịch ngược mã độc (malware reverse engineering), cùng với phân tích và xác minh lỗ hổng.
- Red Team Access: Bổ sung thêm các hoạt động kiểm thử xâm nhập (penetration testing) và red-teaming được ủy quyền vào các trường hợp sử dụng phòng thủ.
- Specialized Access: Có ít biện pháp bảo vệ nhất và được dành riêng cho một nhóm hạn chế các tổ chức đã được xác minh, có thẩm quyền thử nghiệm các hệ thống an toàn.
Theo đánh giá của CyScenarioBench, các biện pháp bảo vệ của Anthropic đã chặn 46 trên 50 tác vụ trên Claude Opus 5.5 ở cấp độ Defense Access. Trong khi đó, cấp độ Red Team Access trên cùng mô hình đó không chặn bất kỳ tác vụ nào và hoàn thành 34 trên 50 tác vụ – tỷ lệ hoàn thành tương đương khi không áp dụng biện pháp bảo vệ nào. Nếu không có quyền truy cập CVP, mọi tác vụ đều bị chặn ngay từ câu lệnh đầu tiên.
"Những đánh giá này mang lại cho chúng tôi sự tự tin rằng chúng tôi có thể cung cấp các khả năng mạng tiên tiến một cách an toàn cho một nhóm rộng lớn hơn những người làm công tác phòng thủ, mở rộng các nỗ lực phòng thủ mà chúng tôi đã bắt đầu với Project Glasswing," Anthropic cho biết.
Công ty AI này cho biết họ đang cung cấp những công cụ này cho giới phòng thủ vì bản chất "lưỡng dụng" của chúng, nhằm giúp họ bảo mật hệ thống bằng chính những khả năng mà những kẻ tấn công có thể sử dụng để vũ khí hóa cho các mục đích xấu.
Phân tích thực tế về lỗ hổng và rủi ro từ mã nguồn AI
Trong một phân tích được công bố vào cuối tháng trước, nhà nghiên cứu Patrick Garrity từ VulnCheck tiết lộ rằng chỉ có 2 trong số 300 lỗ hổng do Anthropic hoặc Project Glasswing phát hiện (tương đương 0,67%) đã bị khai thác trong thực tế. Trong số này, 39 lỗ hổng được phân loại là critical, 141 là high, 81 là medium và 18 là low.
Hai lỗ hổng đã ghi nhận các nỗ lực khai thác tích cực là CVE-2026-26980 (một lỗi SQL injection trong Ghost CMS) và CVE-2026-61500 (một lỗi session forgery trong Rejetto HTTP File Server).
Những phát hiện này gợi ý rằng mặc dù AI đang hạ thấp rào cản trong việc phát hiện lỗ hổng, nhưng không phải mọi lỗi bảo mật mà nó tìm thấy đều có thể bị khai thác bởi kẻ tấn công hoặc gây ra tác động đáng kể. Hơn nữa, như đã được chứng minh bởi 1Password và Veracode, các bản vá lỗ hổng do AI tạo ra có thể tự giới thiệu những rủi ro bảo mật mới.
"Khoảng 44% các tác vụ tạo mã AI đã đưa vào một lỗ hổng bảo mật rủi ro trong các thử nghiệm," Veracode cho biết. "Tỷ lệ vượt qua kiểm tra bảo mật trung bình trên các mô hình là 56% – hầu như không thay đổi so với mức 55% trong báo cáo đầu tiên. Nói cách khác, hiệu suất bảo mật vẫn giậm chân tại chỗ trong khi lượng mã do AI tạo ra xâm nhập vào các quy trình phát triển đang tăng vọt."