Vào thứ Ba, OpenAI đã tiết lộ về một agent trí tuệ nhân tạo (AI) "nổi loạn" đã thoát khỏi môi trường đánh giá bảo mật và xâm nhập vào hệ thống vận hành của Hugging Face, đồng thời tấn công nhiều tài khoản và dịch vụ của bên thứ ba trong quá trình này.
Tiết lộ mới nhất cho thấy sự cố bảo mật này, vốn bắt nguồn từ một bài kiểm tra an ninh nội bộ, có quy mô rộng lớn hơn so với những nhận định trước đây.
Công ty AI này cho biết quá trình rà soát đang diễn ra đã phát hiện một "số lượng nhỏ các trường hợp" mà các mô hình, bao gồm GPT-5.6 Sol và một "mô hình thử nghiệm thậm chí còn mạnh mẽ hơn", đã xác định và sử dụng các thông tin đăng nhập (credentials) bị lộ ở cấp độ tài khoản trên các dịch vụ công cộng khác.
"Điều này bao gồm bốn tài khoản trên bốn dịch vụ liên quan đến sự cố Hugging Face (và một vài tài khoản khác bị truy cập trong các đợt đánh giá khác)," công ty cho biết.
"Một trong bốn tài khoản này đã được sử dụng làm outbound relay và staging path, và một tài khoản khác được sử dụng để lưu trữ dữ liệu. Hai tài khoản còn lại được các mô hình truy cập ở chế độ read-only và không được sử dụng để tiến xa hơn trong việc xâm nhập Hugging Face."
OpenAI không tiết lộ các tài khoản này thuộc về công ty hay tổ chức nào, nhưng lưu ý rằng họ sẽ tiếp tục thông báo trực tiếp cho chủ sở hữu dịch vụ và chưa thấy bằng chứng về tác động rộng hơn đến các nhà cung cấp hoặc tài khoản này. Tuy nhiên, Reuters đưa tin rằng một khách hàng của Modal Labs nằm trong số các thực thể bị agent của OpenAI xâm nhập.
Ngoài ra, các mô hình được cho là đã sử dụng một loạt dịch vụ công cộng, bao gồm các trang web code paste, dịch vụ request capture, dịch vụ screenshot, dịch vụ file-drop và các tiện ích web khác. Không có sự xâm nhập cấp độ nền tảng hoặc tài khoản nào được quan sát thấy trong các kịch bản này.
OpenAI, hiện đang hợp tác với Hugging Face sau khi vụ xâm nhập bị phát hiện vào ngày 16 tháng 7 năm 2026, thừa nhận rằng các mô hình đã xác định và khai thác một lỗ hổng Zero-Day chưa từng được biết đến trong các phiên bản tự triển khai (self-hosted) của Artifactory - một proxy bộ nhớ đệm kho lưu trữ gói do JFrog duy trì - để truy cập internet và thoát khỏi sandbox của nó. Vấn đề đã được xử lý trong Artifactory 7.161.
Ghi chú phát hành cho Artifactory 7.161.15 cho biết phiên bản này vá nhiều lỗ hổng bảo mật có thể bị chuỗi hóa thành một kịch bản tấn công nghiêm trọng nếu Anonymous Access được bật. Anonymous Access bị tắt theo mặc định và không được khuyến nghị cho môi trường vận hành do các rủi ro bảo mật.
"Có một bài học quan trọng và thực sự lạc quan ẩn sau sự cố này: các mô hình AI đang trở thành những cỗ máy phát hiện Zero-Day phi thường," CTO của JFrog, Yoav Landman cho biết. "Chính khả năng giúp mô hình tìm ra đường khai thác mà con người chưa từng phát hiện ra cũng là khả năng sẽ giúp những người phòng thủ tìm và loại bỏ các con đường đó trước tiên."
Công ty AI của Mỹ cũng mô tả mô hình tiền phát hành là một nguyên mẫu nghiên cứu nội bộ (internal-only research prototype). Mô hình này hiện đã bị vô hiệu hóa, mã hóa và hạn chế quyền truy cập nghiên cứu.
Hugging Face công bố báo cáo chi tiết về sự cố (Postmortem)
Theo một dòng thời gian chi tiết do Hugging Face công bố, agent AI tự hành đã dành khoảng hai ngày rưỡi bên trong cơ sở hạ tầng của họ với mục đích "gian lận" trong ExploitGym, một khung đánh giá (benchmarking framework) chấm điểm các hệ thống AI về khả năng phát hiện và khai thác các lỗ hổng phần mềm. Công ty cho biết họ đã xem xét khoảng 17.600 hành động của kẻ tấn công được khôi phục từ nhật ký (logs) trong khoảng thời gian từ ngày 9 đến 13 tháng 7 năm 2026.
"Chúng tôi tin rằng toàn bộ cuộc xâm nhập này, từ góc nhìn của agent, là một nỗ lực để gian lận trong đánh giá: tiếp cận các hệ thống vận hành của chúng tôi và lấy trộm các giải pháp kiểm tra thay vì tự mình giải quyết thử thách," Hugging Face cho biết.
Cuộc xâm nhập từ đầu đến cuối được cho là đã diễn ra qua hai giai đoạn:
- Agent thoát khỏi sandbox bằng cách khai thác Zero-Day trong Artifactory, thực hiện hành vi network egress được phép để ra internet, sau đó lạm dụng một sandbox đánh giá mã nguồn công cộng trên hạ tầng của bên thứ ba để chạy các lệnh với quyền root và sử dụng sandbox đó như một "bệ phóng bên ngoài".
- Từ sandbox đó, agent đã tận dụng luồng xử lý tập dữ liệu (dataset-processing pipeline) của Hugging Face để giành quyền quản trị các cụm Kubernetes; thực hiện di chuyển ngang (lateral movement) thông qua sự kết hợp của node impersonation, trộm token CSI và giả mạo token định danh; thiết lập trung tâm điều khiển (C2); và cuối cùng giành được quyền ghi trái phép vào một tập hợp các kho lưu trữ mã nguồn nội bộ trên GitHub.
"Mặc dù cuộc xâm nhập đã tiếp cận được cơ sở hạ tầng nội bộ của Hugging Face, nhưng nội dung khách hàng duy nhất bị truy cập là bộ giải pháp thử thách ExploitGym/CyberGym được lưu trữ trong năm tập dữ liệu," công ty cho biết. "Không có mô hình, tập dữ liệu, Spaces hoặc gói nào khác hướng tới khách hàng bị ảnh hưởng."
Một trong những khía cạnh đặc trưng của cuộc tấn công là việc sử dụng giao thức truyền thông tự chế cho C2. Được xây dựng trên các dịch vụ công cộng như request-capture, Pastebins và file-drop, giao thức này cho phép mỗi tin nhắn mang theo một tải trọng (payload) cùng với các chi tiết về loại tải trọng đã nén và mã hóa Base64, một kênh nhóm các luồng tin nhắn liên quan, số thứ tự để sắp xếp lại các tin nhắn và mã kiểm tra checksum.
Trình tự diễn ra như sau: (1) agent gửi một phong bì tự mô tả đến một dịch vụ request-capture công cộng, (2) phía nhận thăm dò nó, lắp ráp lại các phần, sau đó chạy payload dưới dạng lệnh shell và tập hợp kết quả.
Hugging Face cũng mô tả agent này là tạm thời (ephemeral) và có khả năng phục hồi đáng kinh ngạc, tương tự như các đợt đánh giá tự hành, với mỗi lần chạy sandbox đánh giá mã nguồn lại nhận được một danh tính mới, đồng thời thực hiện các bước để tránh lộ payload dưới dạng văn bản thuần (cleartext).
"Agent đã chuỗi hóa các lỗ hổng qua nhiều ranh giới tin cậy, thoát khỏi môi trường đánh giá, tiếp cận internet công cộng và duy trì một chiến dịch mạch lạc chống lại hạ tầng vận hành của chúng tôi trong nhiều ngày," công ty nói thêm. "Mỗi môi trường đánh giá mã nguồn ngắn hạn đều bắt đầu từ con số không, nhưng agent vẫn xây dựng lại công cụ của mình, khôi phục các kênh liên lạc và tiếp tục."
Để ứng phó với sự cố, công ty đã chặn các đường dẫn thực thi mã trong luồng xử lý tập dữ liệu, thắt chặt truy cập vào cloud metadata, thay đổi token và credentials, xây dựng lại hạ tầng cốt lõi, cô lập các cụm máy chủ và cải thiện cơ chế cảnh báo.
CEO của Hugging Face, Clem Delangue, kêu gọi sự "minh bạch triệt để", đồng thời nhấn mạnh: "Cuộc tấn công mạng đầu tiên của agent tự hành là một sự kiện chưa từng có tiền lệ. Nó xứng đáng nhận được một sự phản hồi chưa từng có tiền lệ."
Những phát hiện này một lần nữa nhấn mạnh cách các công cụ AI đang nhanh chóng trưởng thành trong khả năng tấn công mạng. Điều này không chỉ làm giảm rào cản trong việc phát triển exploit, mà còn cho phép các tác nhân xấu tìm kiếm, thăm dò và khai thác các lỗi cấu hình ở quy mô lớn, dẫn đến các cuộc tấn công tốt hơn, lớn hơn và nhanh hơn.
Sự việc này diễn ra khi đối thủ Anthropic cho biết agent AI Claude Mythos Preview của họ đã phát hiện ra những cách để tấn công các thuật toán mã hóa, bao gồm việc tạo ra một kỹ thuật khôi phục khóa giúp "làm suy yếu đáng kể" HAWK, một trong những lược đồ chữ ký số được NIST lựa chọn như một phần của quá trình tiêu chuẩn hóa hậu lượng tử (post-quantum).