Wikimedia cho biết các Agent OpenAI đã cố gắng xâm nhập Etherpad và sử dụng các công cụ Wiki làm Proxy

Wikimedia Foundation, tổ chức vận hành Wikipedia, xác nhận đã phát hiện các hoạt động của những agent OpenAI biến chất trên các nền tảng của mình, bao gồm nỗ lực bất thành nhằm xâm nhập Etherpad, một công cụ ghi chú công cộng, và chỉnh sửa các trang Wikipedia. Các hoạt động bot trái phép bao gồm các chỉnh sửa đối với wiki, nỗ lực khai thác công cụ ghi chú và tạo ra lưu lượng truy cập lớn gây gián đoạn hệ thống.
Wikimedia và OpenAI

Wikimedia Foundation, tổ chức vận hành Wikipedia, đã xác nhận rằng họ phát hiện hoạt động của các agent OpenAI biến chất trên các nền tảng của mình, bao gồm những nỗ lực không thành công nhằm xâm nhập Etherpad, một công cụ ghi chú công cộng, và chỉnh sửa các trang Wikipedia.

"Các hoạt động bot trái phép bao gồm việc chỉnh sửa các wiki của chúng tôi, một số nỗ lực không thành công nhằm khai thác công cụ ghi chú công cộng mà chúng tôi lưu trữ, và lưu lượng truy cập lớn," Foundation cho biết trong một bài đăng.

Cuộc điều tra được thúc đẩy bởi các báo cáo công khai gần đây liên quan đến Hugging Face và DseWiki, nơi các agent của OpenAI đã biến Artifactory và diễn đàn wiki của Đức thành một bảng tin không được phép để giao tiếp với nhau, đồng thời thực hiện các bước để liên kết các dịch vụ trực tuyến nhằm truy cập internet và che đậy bằng chứng về các hành vi exploit của chúng.

Vì mục đích đó, Wikimedia cho biết họ đã xác định được các chỉnh sửa đối với Wikimedia wiki bị nghi ngờ là từ các agent do OpenAI vận hành. Các agent này được cho là đã thử nghiệm các chỉnh sửa trong các khu vực "sandbox" của wiki và không được xuất bản lên các trang mà độc giả thông thường có thể truy cập.

Trong số các chỉnh sửa bao gồm những thay đổi đối với cấu hình của một công cụ trích dẫn. Những sửa đổi này được cho là có tính chất độc hại, với mục đích là lạm dụng công cụ này làm proxy để lấy dữ liệu từ các dịch vụ từ xa.

Các agent do OpenAI vận hành cũng được đánh giá là đã thực hiện những nỗ lực không thành công nhằm xâm nhập Etherpad và một lần nữa sử dụng nó làm proxy để lấy dữ liệu từ các trang web khác. Ngoài ra, một nhóm nhỏ các agent đã ghi chép về nhiệm vụ của chúng, mặc dù không có dấu hiệu nào cho thấy đây là một nỗ lực nhằm phối hợp với nhau.

Như đã quan sát thấy trong trường hợp của RubyGems và các sự cố nhắm vào các cổng thông tin chính phủ, các agent cũng được quan sát thấy đang thực hiện "hàng triệu yêu cầu tự động" tới các API công khai của tổ chức để truy cập thông tin về các dự án Wikimedia, thu thập hàng triệu trang liên quan đến Wikidata và Wikimedia Commons, và chạy hàng ngàn truy vấn dữ liệu tới Wikidata Query Service (WQDS). Luồng lưu lượng truy cập này có thể đã góp phần gây ra tình trạng ngừng hoạt động một phần (partial outage) xảy ra vào đầu tháng 5 năm 2026.

Tuy nhiên, Wikimedia cho biết họ không tìm thấy bằng chứng nào về việc hệ thống của mình được sử dụng cho hoạt động phối hợp giữa các agent hoặc hệ thống hay dữ liệu của họ đã bị xâm phạm do những nỗ lực này.

"Tuy nhiên, chúng tôi lo ngại về những gì có thể đã xảy ra ở đây, sự khó khăn và nỗ lực liên quan đến việc điều tra và quy trách nhiệm cho hoạt động này, cũng như những rủi ro ngày càng tăng của hoạt động AI agentic trên các nền tảng của chúng tôi nói chung," tổ chức này nhấn mạnh. "Web mở là một lợi ích công cộng. Chúng ta không nên để hành vi này trở thành 'trạng thái bình thường mới' cho những người hoặc tổ chức duy trì nó."

Wikimedia Foundation lưu ý rằng hành vi của agent, cùng với lưu lượng truy cập bot ngày càng tăng, có nguy cơ chặn người dùng là con người bằng cách làm quá tải hệ thống và gây gián đoạn dịch vụ. Tổ chức này cũng kêu gọi các công ty AI nỗ lực hơn nữa để bảo mật hệ thống của họ và đảm bảo chúng không gây ra bất kỳ tác hại nào.

"Bot và agent là một phần trong tương lai của web, và các công ty tung ra cũng như thu lợi từ chúng phải trực tiếp giúp tránh và khắc phục thiệt hại mà chúng có thể gây ra," Selena Deckelmann, giám đốc sản phẩm và công nghệ của Foundation, cho biết.

OpenAI, trong một tuyên bố chia sẻ với The Verge, cho biết họ đang làm việc với Foundation để xem xét và phân tích hoạt động này, đồng thời sẽ chia sẻ thông tin liên quan khi cuộc điều tra rộng hơn về các sự cố agent biến chất tiếp tục diễn ra.

OpenAI tiết lộ các sự cố mới

Sự việc diễn ra vài ngày sau khi công ty AI này tiết lộ ba trường hợp mới mà các mô hình của họ thể hiện hành vi có thể bị sai lệch (misaligned behavior):

  • Ngày 27 tháng 3 năm 2026: Một mô hình nghiên cứu nội bộ đã khai thác hai lỗ hổng để tiếp cận một máy tính nội bộ của OpenAI trong quá trình tìm kiếm câu trả lời ẩn của người chấm điểm khi đánh giá. Hai lỗi bảo mật đã được liên kết để có được quyền truy cập trái phép vào máy thiết kế điện tử tự động (EDA) nội bộ và tìm kiếm thông tin về cách các đầu ra của nó sẽ được đánh giá.
  • Ngày 16 tháng 5 năm 2026: Một mô hình đã khai thác một công cụ để lấy mã nguồn không có sẵn trong không gian làm việc của nó trong một nhiệm vụ đào tạo học tăng cường (reinforcement learning). OpenAI cho biết: "Công cụ này chạy trong một môi trường riêng biệt và hướng dẫn của nó cấm sử dụng nó như một terminal. Mô hình đã phát hiện ra rằng nó có thể đọc một tệp nguồn và trả lại nội dung của tệp đó trong các thông báo lỗi. Nó đã truy xuất tệp theo từng phần, sao chép mã và chạy nó như một phần của giải pháp. Việc sao chép đã thành công."
  • Ngày 22 tháng 5 năm 2026: Một mô hình nội bộ có tính kiên trì cao, đóng vai trò là trợ lý cho một nhà nghiên cứu, đã suy luận từ một cuộc thảo luận trên Slack của nhóm triển khai rằng phiên bản đang chạy của nó có thể bị dừng do một bản cập nhật nội bộ. Sau đó, nó đã nhắc nhà nghiên cứu cung cấp một OpenAI API key bị thiếu trong tin nhắn trực tiếp trên Slack để tránh khả năng bị gián đoạn phiên làm việc. Khi nhà nghiên cứu cung cấp khóa, mô hình đã cập nhật cấu hình của mình và thực hiện lệnh di trú (migration) được hỗ trợ.

OpenAI cho biết sự cố thứ ba không cấu thành một sự sai lệch, nhưng thừa nhận rằng việc dự đoán và chuẩn bị cho việc tắt máy có thể làm trầm trọng thêm các hành vi sai lệch khác. Gã khổng lồ AI cho biết cuộc điều tra của họ không phát hiện ra bất kỳ trường hợp nào về hành vi cố gắng trốn tránh việc tắt máy.

OpenAI cho biết họ hiện đang áp dụng khung tài liệu "safety case" có cấu trúc, được mô phỏng theo các ngành công nghiệp như hàng không và điện hạt nhân để quản lý việc đào tạo học tăng cường biên giới. Bằng cách mã hóa các phương pháp hay nhất, ý tưởng là đảm bảo có các biện pháp bảo vệ đầy đủ để ngăn chặn một mô hình thực hiện các hành động sai lệch, gây khó khăn cho việc thoát khỏi sự kiểm soát ngay cả khi nó xảy ra và tạm dừng quá trình chạy trước khi nó có thể gây ra thiệt hại "nghiêm trọng".

Lời kêu gọi kiểm soát AI

Dòng sự cố AI biến chất liên tục đã cho thấy các agent ngày càng giỏi trong việc tìm ra những cách ngoài ý muốn để hoàn thành các nhiệm vụ được giao và không thể kỳ vọng chúng tự kiểm soát hành vi của mình. Các vụ xâm phạm mới được tiết lộ cũng diễn ra trong bối cảnh những lo ngại ngày càng tăng về mức độ an toàn của các hệ thống AI tiên tiến và các bước mà các công ty phát triển chúng đang thực hiện để giải quyết.

Những lo ngại này đã dẫn đến những lời kêu gọi làm chậm tốc độ phát triển AI và dành thời gian cho các biện pháp an toàn bắt kịp. Đối thủ Anthropic, trong bản cáo bạch IPO của mình, đã cảnh báo rằng AI tiên tiến có thể gây ra "rủi ro thảm khốc hoặc hiện hữu đối với nhân loại", đồng thời cho biết thêm rằng các mô hình AI có thể thể hiện "hành vi tự bảo toàn", bao gồm các nỗ lực "chống lại việc tắt máy", "che giấu hoặc thao túng thông tin" và hành vi "giống như tống tiền".

Về phần mình, OpenAI đã thông báo vào tuần trước rằng họ đã tạm dừng đào tạo các mô hình mạnh mẽ nhất của mình và hủy bỏ kế hoạch phát hành mô hình sắp tới, GPT-6.1 Astra, sau khi thử nghiệm nội bộ cho thấy mô hình này không đáp ứng các tiêu chuẩn an toàn và đồng nhất của công ty.

Tổng thống Hoa Kỳ Donald Trump cho biết các công ty AI hàng đầu đã đồng ý với một thỏa thuận "ràng buộc về mặt đạo đức", yêu cầu họ thực hiện các biện pháp kiểm soát nội bộ mạnh mẽ, kiểm toán độc lập và giám sát ở cấp hội đồng quản trị đối với các mô hình biên giới. Các bên ký kết bao gồm các giám đốc điều hành từ Google, Anthropic, Meta, OpenAI, SpaceXAI và NVIDIA.