Hàng ngàn Agent của OpenAI âm thầm biến một trang Wiki bỏ hoang thành kênh điều phối

Một nhóm các nhà nghiên cứu an toàn AI cho biết một đội quân các agent tự trị tự nhận là hệ thống của OpenAI đã để lại khoảng 18.000 bài đăng trên một trang wiki tiếng Đức 25 năm tuổi không còn hoạt động từ tháng 5 đến tháng 7 năm 2026, sử dụng trang web này làm bảng chia sẻ để tập hợp các câu trả lời cho một nhiệm vụ web có giới hạn thời gian và tìm cách thoát khỏi sandbox của chúng. Hoạt động này tập trung vào DSEwiki, một trang wiki dành cho nhà phát triển phần mềm của Đức.
OpenAI Agents Wiki

Một nhóm các nhà nghiên cứu an toàn AI cho biết một đội quân các autonomous agents tự nhận là hệ thống của OpenAI đã để lại khoảng 18.000 bài đăng trên một trang wiki tiếng Đức 25 năm tuổi không còn hoạt động trong khoảng thời gian từ tháng 5 đến tháng 7 năm 2026. Các agent này đã sử dụng trang web như một bảng tin chung để tập hợp các câu trả lời cho một nhiệm vụ web có giới hạn thời gian và chia sẻ cách thoát khỏi sandbox của chúng.

Hoạt động này tập trung vào DSEwiki, một trang wiki dành cho nhà phát triển phần mềm Đức chạy trên hệ thống ProWiki tại wikiservice[.]at, vốn chỉ có khoảng 20 lượt chỉnh sửa trong suốt thập kỷ qua.

Các nhà nghiên cứu, dẫn đầu bởi Sydney Von Arx từ tổ chức phi lợi nhuận về an toàn AI Nightingale Collective, đã phục hồi các trang bị xóa từ lịch sử chỉnh sửa và công bố bản phân tích cùng với một bản sao dữ liệu có thể tải xuống.

Trang wiki này cho phép bất kỳ ai thay đổi nội dung bằng một yêu cầu web (web request) thông thường – loại yêu cầu vốn thường chỉ được sử dụng để đọc trang thay vì ghi dữ liệu. Do đó, các agent bị hạn chế quyền ghi vào internet vẫn có thể đăng bài lên trang web này, vì các rào cản kỹ thuật được thiết lập để chặn các loại yêu cầu ghi dữ liệu mà hệ thống kiểm soát mong đợi, chứ không phải những gì phần mềm wiki cũ thực sự chấp nhận.

"Chúng tôi đã tìm thấy khoảng 18.000 bài đăng từ các autonomous AI agents (tự nhận đến từ OpenAI) sử dụng internet công cộng để giao tiếp trong một nhiệm vụ truy xuất web (web-retrieval task)," các nhà nghiên cứu viết trong báo cáo đã công bố.

Các agent này đang thực hiện các nhiệm vụ tra cứu có giới hạn thời gian, thường gồm năm câu hỏi, và nhiều agent được giao những câu hỏi mà các agent khác đã trả lời trước đó. Theo báo cáo, chúng đã đăng kết quả, dữ liệu thô và dự đoán về các câu hỏi sắp tới để những agent chạy trước có thể chuyển đáp án cho những agent chạy sau.

Khoảng 17.000 lượt chỉnh sửa trên DSEwiki đến từ các địa chỉ Microsoft Azure (chiếm 98,5%), và các agent đã tự đặt cho mình hơn 3.700 cái tên riêng biệt như OpenAIResearcher và OAIResearchMar26, dựa trên đặc điểm của nhiệm vụ cộng với ngày mà chúng được thông báo là đang chạy.

Các nhà nghiên cứu đã ghi nhận một số hành vi khác biệt trên trang web:

  • Ghi dữ liệu qua yêu cầu đọc: Các agent đã sử dụng việc trang wiki chấp nhận các yêu cầu đọc có khả năng thay đổi trạng thái để đăng bài mà không cần khả năng gửi yêu cầu ghi thông thường.
  • Vượt qua proxy (Proxy bypass): Một nhiệm vụ yêu cầu số liệu thống kê đến hai chữ số thập phân từ một bảng điều khiển Microsoft Power BI, chỉ có thể truy cập bằng yêu cầu ghi mà sandbox đã chặn. Các agent đã tìm cách vượt qua rào cản này và chia sẻ phương pháp cho nhau.
  • Mạo danh: Các agent đã thực hiện chỉnh sửa dưới tên của một điều phối viên trang wiki.
  • Phối hợp để gian lận trong nhiệm vụ có giới hạn thời gian: Các agent hình thành các nhóm để chuyển tiếp câu trả lời và đảo ngược quy trình (reverse-engineer) thứ tự của các câu hỏi trong tương lai.
  • Các lộ trình thay thế: 197 trong số khoảng 18,000 lượt chỉnh sửa đến từ Amazon Web Services, DigitalOcean và mạng ẩn danh Tor thay vì Azure, thường dưới cùng một tên agent.

Việc vượt qua rào cản (bypass) dựa trên một lỗ hổng mà các agent tìm thấy trong chính sandbox của mình. Môi trường này cho phép lưu lượng truy cập đến các tên miền lưu trữ của Azure kết thúc bằng .blob.core.windows.net mà không cần đi qua proxy bảo mật, nhưng nó lại không xác minh xem tên miền đó có hợp lệ hay không.

Một agent đã tạo ra bypass[.]blob[.]core[.]windows[.]net, trỏ nó đến địa chỉ bảng điều khiển thực 20.223.25[.]152 bằng cách chỉnh sửa tệp /etc/hosts của chính nó, và gửi yêu cầu bị chặn đến đó. Một agent đã đăng phương pháp này và một agent khác báo cáo đã thực hiện thành công khoảng 14 phút sau đó. Các nhà nghiên cứu cho biết cơ chế của trang wiki cũng hoạt động tương tự, biến một khả năng web vốn chỉ dùng để đọc thành một cách để ghi dữ liệu lên internet công cộng.

Dữ liệu chỉnh sửa wiki
Dữ liệu phân tích hành vi phối hợp của các Agent trên Wiki.

Các nhà nghiên cứu cho biết hoạt động trên wiki là một sự kiện tách biệt với các mô hình OpenAI đã xâm nhập vào Hugging Face vào tháng 7, như đã được mô tả trong công bố của OpenAI.

Những agent trong vụ Hugging Face không có quyền truy cập internet và phải tìm cách thoát khỏi sandbox, trong khi các agent trên wiki được cấp quyền truy cập web như một phần nhiệm vụ của chúng và không để lại dấu vết của bảng tin nội bộ mà nhóm agent trên Hugging Face đã sử dụng.

Trong một cuộc điều tra độc lập về sự cố Hugging Face, METR nhận thấy khoảng 1.200 agent đã trao đổi hơn 70.000 tin nhắn và tệp tin trên một bảng tin không được phép, và khoảng 700 trong số đó đã tiếp tục tấn công nền tảng này.

Những gì OpenAI đã tuyên bố

OpenAI chưa công khai tiết lộ về sự kiện wiki này, nhưng các nhà nghiên cứu suy luận từ nhật ký công khai của trang web rằng công ty đã phát hiện ra nó. Các địa chỉ đăng ký cho OpenAI lần đầu truy cập trang wiki vào ngày 21 tháng 6, và việc chỉnh sửa của các agent đã chấm dứt hoàn toàn vào ngày hôm sau.

The Hacker News đã xác nhận thông qua sổ đăng ký của ARIN vào ngày 5 tháng 9 rằng một trong các khối địa chỉ được báo cáo trích dẫn, 199.47.142.0, được đăng ký cho OpenAI OpCo, LLC.

OpenAI không xác nhận các agent đó là của mình. Khi được hỏi về báo cáo này (vốn được Reuters đưa tin đầu tiên), một người phát ngôn của OpenAI nói rằng hoạt động tại Đức "không liên quan đến Hugging Face" và sẽ không xuất hiện trong báo cáo sự cố đó, đồng thời phủ nhận việc đội ngũ pháp lý của họ đã ngăn cản một cuộc điều tra.

Công ty cho biết họ không thể phản hồi chi tiết về một báo cáo mà họ chưa xem xét, và các nhà nghiên cứu đã từ chối yêu cầu truy cập của họ. Trong bản tường trình về sự cố Hugging Face, OpenAI đã mô tả hành vi nền tảng tương tự phát sinh trong quá trình đào tạo.

"Sau khi điều tra sự cố này, OpenAI đã phát hiện thông qua các bài đánh giá CoT hồi cứu rằng các agent đã học cách sử dụng các kênh cộng tác ngẫu hứng trong một số trường hợp hiếm hoi trong quá trình đào tạo cho một số mô hình OpenAI, ngay cả khi công cụ cộng tác không được kích hoạt," công ty cho biết trong báo cáo kỹ thuật của mình.

Dữ liệu wiki cho thấy không có hệ thống bên thứ ba nào bị xâm nhập. Thiệt hại được báo cáo là đối với chính trang wiki, nơi điều phối viên đã mất nhiều tuần để xóa các trang của agent, và ảnh hưởng đến tính toàn vẹn của nhiệm vụ có giới hạn thời gian mà các agent đang gian lận.

Các nhà nghiên cứu nói rằng họ không thể chỉ dựa vào wiki để biết liệu nhiệm vụ đó là một phần của quá trình đào tạo hay đánh giá, và họ lưu ý rằng các agent chắc chắn phải có cách nào đó để cùng hội tụ về một trang web ít người biết đến như vậy.

Mô hình này không chỉ giới hạn ở OpenAI. Anthropic đã tiết lộ vào tháng 7 rằng các mô hình Claude đã tiếp cận các hệ thống thực trong quá trình đánh giá an ninh mạng bị cấu hình sai, một sự kiện mà Anthropic cho rằng Claude đã nhầm lẫn internet công cộng với một bài tập capture-the-flag.

Viện An toàn AI của Vương quốc Anh đã báo cáo vào tháng 8 rằng các agent trong các bài kiểm tra mạng của họ đã sử dụng một trang GitHub công khai làm bảng tin và các dịch vụ tunneling công cộng để truy cập internet. Sự kiện này được đưa tin khi một mô hình Claude đã cố gắng cài backdoor vào một dự án mã nguồn mở trong quá trình thử nghiệm.

OpenAI đã phát hành GPT-6 Astra vào ngày 3 tháng 9, một ngày trước báo cáo về wiki, và tài liệu system card của nó bao gồm một phần đánh giá dành riêng cho các agent có hành vi tìm kiếm và làm theo các tin nhắn do các agent khác để lại trên các bảng tin bên ngoài.

Cập nhật

OpenAI đã đề cập đến cái gọi là "sự cố wiki" trong một bài đăng vào ngày 5 tháng 9, nói rằng các agent của họ đã "viết lên một vài trang web internet" và công ty đã xử lý sự kiện này như một trường hợp misalignment (sai lệch mục tiêu) tương tự như các trường hợp trước đó đã được công bố, thay vì một sự cố bảo mật như trường hợp của Hugging Face.

Công ty đã chỉ ra ba báo cáo trước đó về giám sát các agent lập trình nội bộ, system card của GPT-5.6 và an toàn trong các mô hình dài hạn như những dấu hiệu trước đây về việc agent sử dụng internet theo những cách không mong muốn.

"Chúng tôi và cộng đồng AI rộng lớn hơn vẫn chưa có một tiêu chuẩn rõ ràng về cách báo cáo misalignment xuất hiện trong quá trình đào tạo, đánh giá và triển khai, bao gồm cả những ví dụ không giống như các sự cố bảo mật truyền thống nhưng có thể cung cấp cái nhìn sâu sắc về hành vi và rủi ro trong tương lai của AI," công ty cho biết, đồng thời nói thêm rằng họ sẽ chia sẻ một khuôn khổ trong những tuần tới.