OpenAI ngăn chặn chiến dịch trích xuất dữ liệu tư duy liên quan đến Moonshot AI

OpenAI cho biết họ đã phát hiện và ngăn chặn một chiến dịch distillation phối hợp nhằm trích xuất trái phép các dữ liệu tư duy (reasoning) được bảo vệ từ các mô hình trí tuệ nhân tạo (AI) của mình. Một nhóm hoạt động cốt lõi được quy trách nhiệm cho các cá nhân liên quan đến Moonshot AI, một công ty AI của Trung Quốc.
Chiến dịch trích xuất dữ liệu từ OpenAI

OpenAI vào thứ Tư vừa qua cho biết họ đã xác định và ngăn chặn một chiến dịch distillation phối hợp được thiết kế để trích xuất trái phép các dữ liệu tư duy (reasoning) được bảo vệ từ các mô hình trí tuệ nhân tạo (AI) của mình.

Một "nhóm hoạt động cốt lõi", bắt đầu từ tuần đầu tiên của tháng 7, đã được quy trách nhiệm cho các cá nhân liên quan đến Moonshot AI, một công ty AI của Trung Quốc có trụ sở tại Bắc Kinh. OpenAI không đưa ra bất kỳ bằng chứng kỹ thuật nào để chứng minh cho đánh giá này, có thể là vì lý do an ninh.

"Các thực thể vận hành không phá vỡ mã hóa của chúng tôi, không xâm nhập cơ sở dữ liệu hoặc có quyền truy cập trực tiếp vào các cuộc hội thoại đã lưu trữ của người dùng," OpenAI cho biết. "Thay vào đó, họ đã thao túng các tương tác của mô hình để dữ liệu tư duy được bảo vệ có thể được tái tạo dưới các hình thức mà người yêu cầu có thể nhìn thấy theo cách có phối hợp và quy mô lớn, vi phạm điều khoản dịch vụ của chúng tôi."

Hoạt động này được cho là đã bắt đầu vào ngày 1 tháng 7 năm 2026, ban đầu ở khối lượng thấp trước khi tăng vọt vào ngày 24 và 25 tháng 7 năm 2026, với 16.000 yêu cầu thử nghiệm sử dụng một mẫu trích xuất liên quan từ hơn 4.000 người dùng. Sau khi điều tra thêm, công ty cho biết họ đã xác định được "hoạt động prompt-pattern" liên quan trên hơn 15.000 người dùng. Chiến dịch đã bị triệt phá hoàn toàn vào ngày 28 tháng 7 năm 2026.

Adversarial Distillation: Nguy cơ bảo mật và an ninh quốc gia

Công ty AI mới nổi này mô tả hoạt động này là adversarial distillation, một quá trình bao gồm việc sử dụng có hệ thống và trái phép đầu ra của một mô hình để giúp đào tạo, tái tạo hoặc cải thiện một mô hình khác. OpenAI cho biết họ đã triển khai các biện pháp giảm thiểu bổ sung để chống lại cuộc tấn công này và cấm các tài khoản gian lận tham gia vào hoạt động này.

Ngoài ra, OpenAI cho biết họ đã đóng một "con đường" cho phép một số người đã sở hữu dữ liệu tư duy được mã hóa của người dùng khác có thể phát lại (replay) và khôi phục nội dung của nó, đồng thời bổ sung các biện pháp kiểm tra để phát hiện và ngăn chặn đầu ra dạng luồng (streamed output) có thể làm lộ dữ liệu tư duy.

Lỗ hổng kiến trúc và khả năng giải mã trên quy mô lớn

Trong một nghiên cứu được công bố vào tháng 8 năm 2026, một nhóm nghiên cứu đã tìm thấy một lỗ hổng kiến trúc khiến các vết tư duy (reasoning traces) được mã hóa trở nên "hoàn toàn tương thích và có thể hoán đổi cho nhau giữa các phiên, người dùng và mô hình khác nhau trong hệ sinh thái của một nhà cung cấp". Một kẻ tấn công có thể khai thác điều này để phát triển một bản giải mã jailbreak có khả năng mở rộng và lách qua các cơ chế chống distillation.

"Bằng cách đưa một vết tư duy được mã hóa từ một mô hình nhất định vào một mô hình yếu hơn và ít được bảo vệ hơn từ cùng một nhà cung cấp, chúng tôi buộc nó phải giải mã và xuất ra dấu vết đó nguyên văn dưới dạng văn bản thuần túy (plaintext), mà không bao giờ cần jailbreak trực tiếp mô hình có khả năng cao hơn," các nhà nghiên cứu từ MATS Research, ELLIS Institute Tübingen, và Synk nhận định.

Hơn nữa, nó cho phép trích xuất dữ liệu riêng tư quy mô lớn, mở đường cho các cuộc tấn công prompt injection vô hình bằng cách nhúng các payload độc hại hoàn toàn bên trong các khối được mã hóa và vô tình tiết lộ thông tin nguy hiểm ẩn trong quá trình tư duy, ngay cả khi đầu ra cuối cùng hiển thị của mô hình từ chối một yêu cầu có hại.

Vì dữ liệu tư duy được bảo vệ cung cấp thông tin chi tiết về cách một mô hình thực hiện nhiệm vụ, việc trích xuất thông tin này có thể tiết lộ dữ liệu nhạy cảm và giúp những thực thể khác tái tạo khả năng của mô hình, OpenAI nói thêm.

"Adversarial distillation gây ra các rủi ro về an toàn và an ninh quốc gia," công ty cho biết. "Dữ liệu tư duy được trích xuất có thể được sử dụng để đào tạo một mô hình khác mà không giữ lại các biện pháp bảo vệ được áp dụng cho các đầu ra hướng tới người dùng của mô hình gốc."

"Ở quy mô lớn, distillation cũng có thể đẩy nhanh việc chuyển giao các khả năng tiên tiến mà không đòi hỏi sự đầu tư tương tự vào an toàn. Những lo ngại này trở nên trầm trọng hơn khi các mô hình đạt được các khả năng trong các lĩnh vực lưỡng dụng (dual-use)."

Tiền lệ cáo buộc đối với Moonshot AI

Đây không phải là lần đầu tiên Moonshot AI đối mặt với các cáo buộc về distillation. Tháng trước, đối thủ Anthropic đã cáo buộc Moonshot AI lén lút chuyển các yêu cầu của khách hàng sang Claude thay vì xử lý chúng bằng Kimi, sau đó hiển thị các phản hồi từ Claude cho người dùng.

Công ty này cũng bị cáo buộc đã giữ lại một tập hợp con của các trao đổi này để đào tạo mô hình chain-of-thought (CoT) của mình. Hoạt động này đã được theo dõi dưới biệt danh GTG-16002.