Lỗ hổng ChatGPT AgentForger có thể triển khai AI Agent độc hại qua liên kết Phishing

Các nhà nghiên cứu an ninh mạng đã tiết lộ một lỗ hổng nghiêm trọng trong ChatGPT Workspace Agents của OpenAI cho phép một liên kết phishing duy nhất âm thầm xây dựng, cấp quyền và triển khai một AI agent tự trị bên trong tổ chức của nạn nhân. Lỗ hổng này được Zenity Labs đặt mã là AgentForger. Vấn đề đã được OpenAI khắc phục vào ngày 8 tháng 6 năm 2026 sau khi được báo cáo một cách có trách nhiệm.
Lỗ hổng ChatGPT AgentForger
Lỗ hổng AgentForger đe dọa an ninh doanh nghiệp sử dụng ChatGPT Workspace

Các nhà nghiên cứu an ninh mạng đã tiết lộ một lỗ hổng nghiêm trọng trong ChatGPT Workspace Agents của OpenAI. Lỗ hổng này có thể cho phép một liên kết phishing duy nhất âm thầm xây dựng, cấp quyền và triển khai một thực thể trí tuệ nhân tạo (AI) tự trị bên trong tổ chức của nạn nhân.

Lỗ hổng đã được Zenity Labs đặt mã là AgentForger. Vấn đề này đã được OpenAI xử lý vào ngày 8 tháng 6 năm 2026, sau khi được báo cáo một cách có trách nhiệm.

"Chỉ với một liên kết duy nhất, kẻ tấn công có thể chiếm quyền điều khiển ChatGPT Agent Builder của OpenAI để thiết lập một AI agent do chúng kiểm soát, sử dụng quyền truy cập của một nhân viên thực thụ và tắt mọi cơ chế phê duyệt," công ty bảo mật AI cho biết trong báo cáo gồm hai phần chia sẻ với The Hacker News.

Cuộc tấn công xảy ra khi một nhân viên mất cảnh giác nhấp vào một liên kết ChatGPT trông có vẻ vô hại, khiến nó tạo ra một AI agent mới trong phạm vi tin cậy của công ty và thực hiện theo ý đồ của kẻ tấn công. Đây là một trường hợp của lỗ hổng Cross-Site Request Forgery (CSRF) dùng để giả mạo một AI agent tự trị do kẻ tấn công kiểm soát.

Cơ chế hoạt động của AgentForger

Agent Builder là một giao diện thiết kế trực quan, kéo và thả, cho phép người dùng xây dựng các quy trình làm việc của agent qua nhiều bước. Tháng trước, OpenAI đã thông báo sẽ ngừng hỗ trợ sản phẩm này kể từ ngày 30 tháng 11 năm 2026 và khuyến khích người dùng chuyển sang Agents SDK.

Zenity cho biết thử nghiệm của họ phát hiện công cụ Builder chấp nhận trạng thái khởi tạo thông qua các tham số URL, trong đó có hai tham số bao gồm mẫu (template) của agent và câu lệnh (prompt) gửi tới Builder.

"Chúng tôi phát hiện ra rằng khi trang được tải, giá trị của initial_assistant_prompt không chỉ đơn thuần được đặt vào hộp lệnh. Nó được tự động gửi đi và thực thi," Mike Takahashi, nhà nghiên cứu AI Red Team cho biết. "Điều đó có nghĩa là một chỉ dẫn được nhúng bên trong URL có thể trở thành lệnh đầu tiên mà Builder thực hiện."

Vì một prompt có thể được chèn trực tiếp vào URL, kẻ tấn công có thể gửi URL đó cho mục tiêu dưới dạng liên kết phishing theo cấu trúc: chatgpt[.]com/agents/studio/new?template_name=[tên mẫu]&initial_assistant_prompt=[câu lệnh độc hại].

Minh họa Agent Builder
Giao diện Agent Builder bị khai thác để tự động thực thi lệnh

Nếu một người dùng đã đăng nhập nhấp vào liên kết, ChatGPT sẽ mở Builder trong phiên làm việc đã được xác thực của nạn nhân và tự động gửi prompt được nhúng trong URL mà không cần thêm bất kỳ tương tác nào. Tuy nhiên, kẻ tấn công cần đáp ứng các điều kiện tiên quyết sau:

  • Nạn nhân đang đăng nhập vào ChatGPT.
  • Nạn nhân có quyền truy cập vào Workspace Agents.
  • Nạn nhân có ít nhất một connector đã được cấp quyền (ví dụ: tích hợp ChatGPT sẵn có với các ứng dụng doanh nghiệp như Outlook, Gmail, Google Calendar, Google Drive, Slack hoặc Teams).

Kịch bản triển khai AI Agent độc hại

Cụ thể, payload được truyền qua prompt độc hại sẽ hướng dẫn Builder thực hiện chuỗi hành động sau:

  • Tạo một agent từ mẫu "chief-of-staff".
  • Kết nối tất cả các connector hiện có và đặt mỗi connector thành "Never ask" (Không bao giờ hỏi) để không cần sự phê duyệt của người dùng.
  • Kích hoạt agent và lập lịch để nó chạy mỗi giờ, tạo thành một cơ chế persistence.
  • Trong mỗi lần chạy, kiểm tra email từ một địa chỉ cụ thể có tiêu đề bắt đầu bằng từ "TASK", thực hiện các tác vụ đó và báo cáo kết quả lại bằng cách gửi email đến địa chỉ của kẻ tấn công.
  • Kích hoạt Preview Mode để chạy agent ngay lập tức.

Zenity giải thích: "Preview Mode vốn để cho phép người dùng kiểm tra agent trước khi xuất bản. Tuy nhiên, trong quy trình này, Preview không chỉ là bản xem trước trực quan. Nó thực thi agent mới tạo đối với các tài khoản được kết nối của nạn nhân bằng các cài đặt phê duyệt vừa được cấu hình."

Nói cách khác, agent giả mạo trở thành một "nhân viên vận hành" bền bỉ. Cú nhấp chuột ban đầu sẽ cài đặt nó; lịch trình giúp nó duy trì hoạt động; và các ứng dụng được kết nối cung cấp nguồn lệnh, quyền truy cập vào dữ liệu nhạy cảm cũng như con đường để trả kết quả về cho hacker.

Nguy cơ thâm nhập sâu vào hệ thống

Với khả năng này, agent giả mạo có thể xâm nhập sâu hơn vào tổ chức, tiến hành trinh sát, thu thập tài liệu nhạy cảm từ các dịch vụ lưu trữ đám mây và đánh cắp mật khẩu được đề cập trong các tin nhắn Slack, biến nó thành một "nội gián" tự trị hoạt động theo ý muốn của kẻ tấn công.

Hơn nữa, agent độc hại này có thể mạo danh nạn nhân để gửi liên kết phishing trên Teams, dẫn dụ người nhận đến trang đăng nhập Microsoft giả mạo để chiếm đoạt thông tin xác thực. Kịch bản này rất đáng lo ngại vì nó có thể mở đường cho các vụ xâm nhập quy mô lớn và các tình huống Business Email Compromise (BEC).

"Kẻ tấn công không cần nạn nhân nhấp vào một liên kết khác," Takahashi giải thích. "Họ không cần tab Builder phải luôn mở. Một khi agent đã được xuất bản và lập lịch, kẻ tấn công có thể liên tục gửi nhiệm vụ thông qua hộp thư của nạn nhân. Mỗi email TASK trở thành một nhiệm vụ mới cho agent. Agent không chờ đợi một cú nhấp chuột khác, nó chờ đợi các chỉ dẫn."

Về cốt lõi, AgentForger là một sự thất bại về lòng tin của agent: nền tảng tin tưởng rằng người dùng đã cố tình tạo ra, phê duyệt, lập lịch và vận hành agent đó.

Các phát hiện này được đưa ra trong bối cảnh các tác nhân độc hại đang ngày càng khai thác các lỗ hổng nghiêm trọng trong cơ sở hạ tầng AI như LiteLLM và Ollama để thực hiện các chiến dịch tấn công. Zenity cảnh báo rằng việc triển khai các máy chủ mô hình tự lưu trữ và framework agent không đúng cấu hình hoặc không xác thực đang biến hạ tầng AI thành công cụ đắc lực cho các AI agent tấn công.