OpenAI ra mắt GPT-Red: Tự động hóa kiểm tra Prompt Injection để tăng cường bảo mật cho GPT-5.6 Sol

OpenAI đã tiết lộ chi tiết về GPT-Red, một mô hình red-teaming tự động nội bộ giúp mở rộng quy mô phát hiện lỗ hổng prompt injection với mục tiêu khắc phục các sự cố trước khi triển khai rộng rãi. GPT-Red là một red-teamer mạnh mẽ, giúp huấn luyện đối nghịch để GPT-5.6 trở nên bảo mật hơn.
OpenAI GPT-Red

OpenAI vừa tiết lộ chi tiết về GPT-Red, một mô hình red-teaming tự động nội bộ giúp mở rộng quy mô phát hiện lỗ hổng prompt injection với mục tiêu khắc phục các sự cố trước khi các công cụ được triển khai rộng rãi.

"GPT-Red là một red-teamer mạnh mẽ và các mô hình trước đây của chúng tôi rất dễ bị tổn thương trước các cuộc tấn công prompt injection của nó," công ty trí tuệ nhân tạo (AI) cho biết. "Chúng tôi sử dụng GPT-Red để huấn luyện đối nghịch (adversarially train) cho GPT-5.6, giúp nó trở nên mạnh mẽ hơn nhiều trước các cuộc tấn công prompt injection."

Mô hình này hoạt động giống như một human red-teamer. Nó gửi một prompt, theo dõi cách mô hình GPT phản hồi và lặp lại quá trình để tiến tới một mục tiêu độc hại, chẳng hạn như tải dữ liệu nhạy cảm lên một máy chủ bên ngoài.

Sự phát triển này diễn ra trong bối cảnh các cuộc tấn công prompt injection đối nghịch vẫn là một "cái gai" dai dẳng đối với các mô hình ngôn ngữ lớn (LLM), vốn có thể bị lừa thực hiện một chỉ dẫn được soạn thảo kỹ lưỡng nhằm gây ra những hậu quả không mong muốn.

Khi các hệ thống đại lý (agentic systems) tiếp tục được kết nối với các nguồn dữ liệu bên thứ ba thông qua trình duyệt web, ứng dụng kết nối, tệp cục bộ và các công cụ khác, chúng cũng mở rộng bề mặt tấn công. Điều này tạo ra nhiều con đường hơn cho những kẻ xấu gây ảnh hưởng đến kết quả của mô hình bằng cách chèn các prompt độc hại vào bên trong nội dung có vẻ vô hại. Các cuộc tấn công này có thể núp bóng dưới dạng email, trang web, phản hồi công cụ hoặc kho lưu trữ mã nguồn.

Tự động hóa Red-Teaming ở quy mô lớn

GPT-Red nhằm mục đích tăng cường khả năng red-teaming của con người ở quy mô lớn, từ đó giúp xác định các chế độ lỗi mới, cải thiện tính mạnh mẽ và xây dựng các biện pháp đối phó phù hợp trước khi các mô hình được triển khai.

Bằng cách tích hợp trực tiếp GPT-Red vào quá trình huấn luyện các mô hình sản xuất, OpenAI cho biết GPT-5.6 Sol là mô hình mạnh mẽ nhất của họ trước prompt injection cho đến nay. Mô hình này đạt tỷ lệ thất bại thấp hơn 6 lần so với benchmark prompt injection trực tiếp khi so sánh với GPT-5.5, mô hình tiên tiến nhất của hãng từ bốn tháng trước đó.

Thống kê hiệu quả của GPT-Red

Các kịch bản tấn công thử nghiệm

Một số ví dụ về các cuộc hội thoại bị chèn prompt injection được thử nghiệm trong quá trình này bao gồm:

  • Trích xuất (exfiltration) thư mục nội bộ
  • Chỉ dẫn thanh toán gian lận
  • Trích xuất thông tin đăng nhập Amazon Web Services (AWS)
  • Vô hiệu hóa xác thực hai yếu tố (2FA)
  • Tải lên tệp chứa thông tin đăng nhập
  • Chèn tập lệnh bên ngoài (external script injection)
  • Chuyển tiếp API key
  • Tập lệnh thu thập dữ liệu (scraper scripts) độc hại

Huấn luyện bằng học tăng cường tự chơi (Self-play Reinforcement Learning)

OpenAI giải thích: "GPT-Red được huấn luyện bằng cách sử dụng học tăng cường tự chơi, trong đó mô hình và một tập hợp các LLM phòng thủ khác nhau được huấn luyện đồng thời trên một loạt các kịch bản red-teaming. GPT-Red được thưởng khi tạo ra một lỗi hợp lệ, chẳng hạn như một cuộc tấn công prompt injection thành công, trong khi các mô hình phòng thủ được thưởng khi chống lại cuộc tấn công và hoàn thành các nhiệm vụ ban đầu của chúng."

Điều này cũng có nghĩa là khi các mô hình phòng thủ trở nên mạnh mẽ hơn, mô hình red-teaming sẽ phải quay lại "bàn làm việc" để khám phá các phương pháp tấn công hiệu quả và đa dạng hơn nhằm vượt qua các rào cản bảo vệ đó. Cụ thể, GPT-Red được phát hiện là tạo ra các cuộc tấn công thành công chống lại GPT-5.1 trong nhiều kịch bản hơn so với các human red-teamers khi nói đến prompt injection gián tiếp.

Mô hình hoạt động của OpenAI

OpenAI cũng nhấn mạnh rằng GPT-Red được tách biệt hoàn toàn với các mô hình khác để các khả năng độc hại tích hợp trong nó không rơi vào tay những kẻ xấu, những kẻ luôn tìm cách vượt qua các biện pháp đạo đức và an toàn của mô hình.

Các tình huống thực tế

Trong một thử nghiệm thực tế, OpenAI đã hướng GPT-Red vào một máy bán hàng tự động dựa trên AI do Andon Labs xây dựng. Sau khi thực hành trong môi trường giả lập, mô hình đã nhắm mục tiêu vào tác nhân tự trị và đạt được cả ba mục tiêu: giảm giá một mặt hàng đắt tiền xuống mức giá tối thiểu cho phép là 0,50 USD, đặt một mặt hàng mới trị giá 100 USD với cùng mức giá đó và hủy đơn hàng của một khách hàng khác.

Một nghiên cứu điển hình thứ hai liên quan đến việc sử dụng GPT-Red để tấn công một đại lý dòng lệnh Codex (dựa trên GPT-5.4 mini). Mô hình đã khiến dữ liệu nhạy cảm bị truyền đi trong nhiều trường hợp hơn so với mức cơ sở của GPT-5.5.

Một phiên bản sớm của mô hình cũng đã phát hiện ra một loại tấn công prompt injection trực tiếp mới được gọi là Fake Chain-of-Thought (CoT), đạt tỷ lệ thành công trên 95% đối với GPT-5.1 nhưng hiện đã giảm xuống dưới 10% đối với GPT-5.6 Sol.

Vấn đề với Benchmark SWE-Bench

Tiết lộ này được đưa ra khi công ty cho biết một cuộc kiểm tra đối với SWE-Bench Pro đã phát hiện ra rằng khoảng 30% các nhiệm vụ bị hỏng, dẫn đến việc rút lại khuyến nghị trước đó về việc áp dụng benchmark này để đo lường khả năng lập trình tiên tiến.

OpenAI cho biết: "Chúng tôi tìm thấy bằng chứng về các vấn đề gây lỗi trong một phần đáng kể của tập dữ liệu. Quy trình phân tích dữ liệu của chúng tôi đã gắn cờ 200 nhiệm vụ bị hỏng (27,4%), trong khi chiến dịch chú thích của con người xác định được 249 nhiệm vụ (34,1%). Cuối cùng, một bản đánh giá nên cung cấp tín hiệu có ý nghĩa thông qua các benchmark khó bị thao túng, dễ tin cậy và phản ánh thực sự khả năng hoặc sự căn chỉnh của mô hình."