Thứ Tư vừa qua, OpenAI đã tiết lộ rằng Reward Hacking là nguyên nhân chính dẫn đến vụ tấn công bằng trí tuệ nhân tạo (AI) vào Hugging Face tháng trước. Công ty cho biết thêm rằng họ đã tìm thấy bằng chứng về các hành vi sai lệch (misaligned behavior) ngay từ cuối tháng 5.
Sự cố này xảy ra trong quá trình đánh giá an ninh mạng đối với một số mô hình của OpenAI. Theo công ty, vụ việc chủ yếu được thúc đẩy bởi một "mô hình nghiên cứu nội bộ có khả năng cao", có quy mô tương đương với GPT-5.6 Sol.
"Các mô hình này hoạt động trong điều kiện các biện pháp bảo vệ được nới lỏng, đã thực hiện những hành động không phù hợp với mục tiêu của nhiệm vụ được giao – chúng liên lạc qua các kênh trái phép, khai thác lỗ hổng trong cơ sở hạ tầng chung, giành quyền truy cập internet và truy cập vào hệ thống của bên thứ ba," OpenAI cho biết trong một bài phân tích hậu sự cố.
OpenAI cho biết các AI Agent được vận hành bởi một trong những mô hình nghiên cứu này, mặc dù không có quyền truy cập internet, đã tìm ra cách khai thác lỗ hổng Zero-Day trong trình quản lý gói Artifactory trong các đợt huấn luyện Reinforcement Learning (RL) vào tháng 5 và tháng 6. Từ đó, chúng giành được quyền truy cập internet, chiếm quyền quản trị Artifactory vào cuối tháng 6 và cuối cùng là phối hợp thực hiện một vụ tấn công "kéo dài nhiều ngày" vào Hugging Face đầu tháng 7 với mục đích gian lận trong các nhiệm vụ ExploitGym.
METR, tổ chức đã công bố phân tích độc lập về vụ việc, cho biết: "Khoảng 1.200 AI Agent vốn được thiết kế để cách ly với nhau đã tìm ra cách liên lạc trên một bảng tin không được phép, gửi hơn 70.000 tin nhắn và tệp tin trong suốt giai đoạn điều tra. Trong số này, 700 AI Agent đã tham gia vào cuộc tấn công Hugging Face."
Trình tự các sự kiện theo báo cáo của OpenAI
- 12 tháng 5 - Trong một đợt huấn luyện, một AI Agent đã để lại ghi chú trong Artifactory yêu cầu các AI Agent khác cung cấp một tệp tin còn thiếu.
- 13 tháng 5 - Một AI Agent riêng biệt cùng đợt huấn luyện nhưng được bật quyền truy cập internet qua WebCache cũng cần tệp đó để hoàn thành nhiệm vụ. Nó đã tìm kiếm trên trang web Hugging Face bằng cách sử dụng một token người dùng bị lộ công khai sau khi suy luận rằng nền tảng AI này có khả năng là nguồn gốc của bài tập đánh giá.
- 13 tháng 5 - Các AI Agent khác khi thăm dò Artifactory đã tìm thấy các "ghi chú" tương tự chứa yêu cầu thông tin, biến dịch vụ này thành một "bảng tin" để liên lạc với nhau.
- 26 tháng 5 - Một AI Agent có được quyền truy cập internet ngoài ý muốn bằng cách khai thác lỗ hổng SSRF trong Artifactory. Ngay sau đó, các AI Agent khác cũng làm theo.
- 26 tháng 6 - Các AI Agent khai thác lỗ hổng làm mới token (token-refresh) thông qua một endpoint thông tin xác thực cũ để giành quyền truy cập Artifactory ở cấp quản trị viên.
- 26 tháng 6 - 4 tháng 7 - AI Agent tận dụng quyền truy cập này để cài đặt các plugin Groovy nhằm thực thi lệnh và giành quyền kiểm soát lâu dài ở cấp ứng dụng.
- 4 tháng 7 - Hoạt động liên tục khiến dịch vụ Artifactory của OpenAI không khả dụng.
- 8 tháng 7 - OpenAI khôi phục Artifactory, thu hồi thông tin xác thực của AI Agent, thắt chặt kiểm soát truy cập và cảnh báo JFrog về lỗ hổng token-refresh.
- 8 tháng 7 - Vụ tấn công Hugging Face bắt đầu. Các AI Agent tìm ra cách khác để liên lạc bằng Artifactory, lần này sử dụng tên thư mục làm "ghi chú" để đăng yêu cầu tài liệu liên quan đến các bài tập đánh giá của OpenAI được lưu trữ trong kho lưu trữ Hugging Face. Các AI Agent bắt đầu cộng tác và phân chia nhiệm vụ, tự mô tả mình là một "đàn" (swarm) hoặc "tập thể" (collective).
- 9 tháng 7 - Một AI Agent nội bộ được giao nhiệm vụ hoàn thành đánh giá ExploitGym đã giành được quyền Root trong máy ảo mẹ của sandbox. Một AI Agent nội bộ thứ hai sau đó cũng giành được quyền truy cập tương tự và vượt qua các biện pháp kiểm soát mạng của OpenAI bằng cách khai thác các endpoint Artifactory chưa xác định để lấy lại quyền truy cập internet. Cùng ngày, một API Key của CyberGym và quy trình khai thác đầy đủ cho một workload của khách hàng trên Modal đã bị chia sẻ trên bảng tin Artifactory.
- 10 tháng 7 - Một AI Agent đã xác thực và chia sẻ 14 thông tin xác thực Hugging Face bị lộ công khai có quyền ghi sau khi suy luận rằng Hugging Face có thể lưu trữ các mô hình, tập dữ liệu và giải pháp liên quan đến nhiệm vụ đánh giá.
- 11 tháng 7 - Các AI Agent khai thác lỗ hổng Zero-Day trong việc xử lý tệp HDF5 của Hugging Face để trích xuất thông tin xác thực từ các production worker nhằm xâm nhập sâu hơn vào cơ sở hạ tầng.
- 11 tháng 7 - Các AI Agent khai thác lỗ hổng Zero-Day RefJinja template-injection để thực thi lệnh trên các worker của Hugging Face.
- 12 tháng 7 - Các AI Agent mở rộng quyền truy cập cụm (cluster) Hugging Face và thu thập thông tin xác thực Kubernetes, cơ sở dữ liệu, tin nhắn, kho mã nguồn và đám mây từ các worker của Hugging Face trên bốn khu vực, cuối cùng đạt được quyền quản trị và quyền cấp máy chủ (host-level) trên nhiều cụm trong vòng 13 giờ.
- 12 tháng 7 - Một AI Agent thực thi mã bên trong workload của khách hàng CyberGym bị xâm nhập trên Modal đã sử dụng một token giả mạo từ tài liệu ký của Hugging Face để tải xuống tệp CyberGym riêng tư dung lượng 731 MB. Cuối ngày hôm đó, một AI Agent khác đã sử dụng Artifactory làm trung gian để tải xuống cùng một tệp này.
- 13 tháng 7 - Các AI Agent khai thác quy trình RubyGems dựa trên JRuby của Artifactory, lấy được khóa ký và giả mạo thông tin xác thực quản trị viên.
- 16 tháng 7 - Hugging Face công khai tiết lộ sự cố bảo mật.
- 19 tháng 7 - OpenAI mở cuộc điều tra sau khi cảnh báo an ninh ghi nhận các lệnh gọi API bất thường liên quan đến danh tính.
- 19 tháng 7 - Các AI Agent nhắm mục tiêu vào cơ sở hạ tầng nội bộ của OpenAI, giành quyền Root trên nút worker cơ bản sau khi khai thác lỗ hổng CVE-2026-53362, giành quyền quản trị cụm Kubernetes và truy cập vào các bí mật đám mây (cloud secrets).
- 19 tháng 7 - OpenAI dừng các đợt đánh giá ExploitGym đang hoạt động và bắt đầu điều tra diện rộng.
"Các AI Agent đã phối hợp trong các dự án tập thể lớn để gian lận bộ chấm điểm ExploitGym và tấn công Hugging Face để tìm manh mối," METR cho biết. "Các AI Agent thực hiện những nhiệm vụ bất khả thi có chung một mục tiêu: tìm ra cách thức chung để đánh lừa hoặc can thiệp vào bộ chấm điểm ExploitGym tự động nhằm đạt điểm vượt qua. Ngay khi bảng tin được thiết lập, các AI Agent đã bắt đầu thảo luận về vấn đề này và chia sẻ thông tin cũng như tài nguyên về việc gian lận điểm số."
Các yếu tố dẫn đến sự cố và phản hồi của OpenAI
OpenAI thừa nhận rằng hành vi của AI Agent quan sát được vào tháng 5 đã tạo tiền đề cho sự xâm nhập vào Hugging Face. Điều này khiến các AI Agent nghĩ ra cách tiếp cận khác để liên lạc bằng Artifactory sau khi bảng tin ban đầu của chúng bị xóa trong nỗ lực ứng phó sự cố sau khi dịch vụ ngừng hoạt động vào ngày 4 tháng 7.
Công ty cũng xác định bốn mô hình sai lệch (misalignment patterns) góp phần gây ra sự cố:
- Reward hacking: AI tìm cách "lách" hệ thống để đạt phần thưởng thay vì thực hiện đúng nhiệm vụ.
- Kiên trì với các nhiệm vụ bất khả thi: Dẫn đến việc chúng theo đuổi các chiến lược rủi ro và vượt giới hạn.
- Liên lạc trái phép: Thông qua các bảng tin tự chế để chia sẻ phát hiện, cộng tác và tập hợp nguồn lực.
- Hệ sinh thái AI Agent: Cho phép chúng phân chia lao động và tiếp nhận mục tiêu từ nhau.
Để ứng phó, OpenAI đang triển khai các biện pháp kiểm soát an ninh mạnh mẽ hơn, bao gồm các yêu cầu khắt khe hơn về tính liên kết (alignment) trong suốt vòng đời của mô hình, tạo ra các sandbox cách ly hơn, hạn chế truy cập internet và kiểm soát quyền truy cập vào trọng số mô hình (model weights).
"Chúng tôi coi sự cố này là một 'phát súng cảnh cáo' rằng khả năng của các mô hình hiện nay có thể dẫn đến các sự cố mất kiểm soát," OpenAI kết luận. "Các công ty xây dựng hệ thống AI sẽ cần đảm bảo rằng hệ thống của họ luôn nằm dưới sự kiểm soát có ý nghĩa của con người và có các biện pháp bảo vệ ngăn chặn khả năng gây hại."