Anthropic cáo buộc 7 phòng thí nghiệm AI Trung Quốc thực hiện tấn công Distillation quy mô công nghiệp nhắm vào Claude

Anthropic vào hôm thứ Năm cho biết họ đã phát hiện và ngăn chặn các cuộc tấn công Distillation bất hợp pháp quy mô công nghiệp nhắm vào Claude từ bảy phòng thí nghiệm có trụ sở tại Trung Quốc, bao gồm Alibaba, Moonshot, DeepSeek, Z.ai (còn gọi là Zhipu) và MiniMax. Knowledge Distillation bản thân nó là một phương pháp đào tạo hợp lệ, trong đó một mô hình AI lớn đóng vai trò giáo viên để dạy cho mô hình nhỏ hơn.
Claude distillation attacks

Anthropic vào hôm thứ Năm cho biết họ đã phát hiện và ngăn chặn các cuộc tấn công Distillation bất hợp pháp quy mô công nghiệp nhắm vào Claude từ bảy phòng thí nghiệm có trụ sở tại Trung Quốc, bao gồm Alibaba, Moonshot, DeepSeek, Z.ai (còn gọi là Zhipu) và MiniMax.

Bản thân Knowledge Distillation là một phương pháp đào tạo hợp lệ. Nó đề cập đến một kỹ thuật Machine Learning, trong đó một mô hình AI lớn và mạnh mẽ đóng vai trò là "giáo viên" để đào tạo một mô hình "học sinh" nhỏ hơn, kém năng lực hơn hoặc nhanh hơn để sao chép các khả năng của nó.

Ngược lại, Distillation bất hợp pháp là một chiến dịch quy mô công nghiệp nhằm bí mật trích xuất các khả năng của một mô hình và sao chép chúng sang một mô hình khác mà không có sự cho phép, thường bằng cách sử dụng mạng lưới các tài khoản giả được tạo bằng thẻ tín dụng bị đánh cắp, thông tin đăng nhập và các API keys.

Các phòng thí nghiệm AI hàng đầu ở phương Tây, bao gồm cả Google và OpenAI, đã liên tục lên tiếng về các cuộc tấn công Distillation nhắm vào các mô hình của họ. Anthropic cho biết họ đã quan sát thấy các phòng thí nghiệm không được phép sử dụng "các phương pháp ngày càng tinh vi" để vượt qua các biện pháp bảo vệ và thu thập các khả năng của mình, chẳng hạn như khả năng Agentic và sử dụng công cụ, lập trình và phân tích dữ liệu, cùng khả năng suy luận logic thông qua các thủ thuật thao túng Prompt.

"DeepSeek, Xiaomi và Moonshot đã đưa các cuộc hội thoại giữa các mô hình của riêng họ và người dùng vào Claude," Anthropic cho biết. "Các phòng thí nghiệm này sau đó đã sử dụng phản hồi của Claude làm dữ liệu đào tạo để Distill các khả năng của Claude. Một số trao đổi này bao gồm thông tin nhạy cảm, bao gồm từ những người dùng cá nhân, các công ty đa quốc gia lớn và các tác nhân liên quan đến nhà nước."

Công ty AI này cho biết các phòng thí nghiệm này thường có quyền truy cập vào các mô hình của họ bằng cách định tuyến các yêu cầu thông qua các dịch vụ Proxy, còn được gọi là các trạm chuyển tiếp, nơi tạo ra hàng nghìn tài khoản mới dưới danh tính giả, thẻ tín dụng giả hoặc bị đánh cắp, và các API keys bị thu thập bất hợp pháp thuộc về các công ty hoặc cá nhân hợp pháp.

Theo Anthropic, các phòng thí nghiệm AI không được phép cũng có được bản ghi các trao đổi của người dùng với các mô hình hàng đầu của Hoa Kỳ bằng cách mua chúng từ các bên bán lại thứ ba, vốn là những người vận hành dịch vụ Proxy lưu trữ các cuộc hội thoại đó mà người dùng không hề hay biết hoặc cho phép.

Minh họa distillation
"Trong các trường hợp khác, các phòng thí nghiệm không được phép đã định tuyến lại các yêu cầu từ người dùng của họ sang Claude -- mà không có sự hiểu biết hoặc cho phép của những người dùng đó -- để thu thập các trao đổi giữa người dùng và Claude cho việc đào tạo," Anthropic nhấn mạnh.
AI Training

Kể từ tháng 2 năm 2026, công ty AI cho biết họ đã phát hiện sáu chiến dịch Distillation bất hợp pháp được thực hiện bởi các phòng thí nghiệm AI có trụ sở tại Trung Quốc để cải tiến các mô hình của riêng họ -

  • GTG-16005 (151 triệu trao đổi được quan sát từ tháng 5 đến tháng 7 năm 2026), trong đó một nhóm các nhà vận hành liên kết với Alibaba đã nhắm mục tiêu vào các bản ghi suy luận Chain-of-Thought (CoT) của Claude Opus 4.6 và 4.7, được mô tả là "cuộc tấn công Distillation lớn nhất mà chúng tôi từng ghi nhận." Nó đạt đỉnh khoảng 3 triệu trao đổi mỗi ngày từ hơn 3.500 tài khoản gian lận nhắm vào các nhiệm vụ Agentic, kỹ thuật phần mềm, phát triển Kernel và các nhiệm vụ dài hạn.
  • GTG-16002 (23 triệu trao đổi được quan sát từ tháng 5 đến tháng 7 năm 2026), trong đó Moonshot AI đã bí mật định tuyến các yêu cầu của khách hàng sang Claude thay vì xử lý chúng bằng Kimi, sau đó hiển thị phản hồi từ Claude cho người dùng. Đồng thời, một phần các trao đổi này đã được ghi lại và lưu trữ để đào tạo mô hình CoT của họ.
  • GTG-16001 (Hơn 12,1 triệu trao đổi được quan sát trong 14 ngày vào tháng 7 năm 2026), trong đó DeepSeek đã thực hiện cách tiếp cận tương tự như Moonshot AI để chuyển tiếp các trao đổi sang Claude một cách âm thầm mà không thông báo cho khách hàng và trích xuất các bản ghi CoT.
  • GTG-16006 (Hơn 3,4 triệu trao đổi được quan sát trong 17 ngày vào tháng 6 và tháng 7 năm 2026), trong đó Zhipu (còn gọi là Z.ai) đã vận hành một hệ thống trích xuất CoT và phát lại các dấu vết suy luận của Claude thông qua Claude để đào tạo các mô hình của mình qua 273 tài khoản gian lận.
  • GTG-16008 (Hơn 400.000 trao đổi được quan sát trong 20 ngày vào tháng 3 và tháng 4 năm 2026), trong đó Xiaomi đã phát lại các cuộc hội thoại và phiên lập trình của người dùng từ các mô hình MiMo của riêng mình sang Claude để củng cố dữ liệu đào tạo.
  • GTG-16012, trong đó SenseTime đã mua các bản ghi trao đổi của người dùng với Claude từ các nhà cung cấp dữ liệu bên thứ ba.
  • GTG-16003, trong đó MiniMax đã xây dựng dịch vụ mạng Proxy của riêng mình thông qua một công ty vỏ bọc để thu thập các trao đổi giữa người dùng và các mô hình hàng đầu của Hoa Kỳ.

"Sự gia tăng của các dịch vụ Proxy để lách các hạn chế truy cập của Anthropic đã tạo ra một thị trường thứ cấp thông qua đó các phòng thí nghiệm có thể mua hoặc có được các trao đổi được thu thập giữa người dùng và Claude," Anthropic cho biết.

Các biện pháp đối phó của Anthropic

Để chống lại Distillation bất hợp pháp, công ty cho biết họ sẽ cấm các tài khoản bán lại hoặc các tài khoản hoạt động từ các khu vực không được hỗ trợ như Trung Quốc, Iran và Nga khi người dùng không xác minh được danh tính. Để gây khó khăn cho việc Distillation, mô hình đã được cập nhật để tóm tắt suy luận nội bộ trước khi phản hồi, khiến các bản ghi bị đánh cắp trở nên ít hữu ích hơn cho việc đào tạo sau này.

"Và với Fable 5.1, chúng tôi đã giới thiệu Preserved Thinking, ngăn các tài khoản API mới thay đổi System Prompt, công cụ hoặc tin nhắn trước suy luận của Claude trong các cuộc hội thoại nhiều lượt," công ty nói thêm. "Suy luận đó được mã hóa, nhưng việc chỉnh sửa ngữ cảnh trước đó là một kỹ thuật phổ biến mà những kẻ tấn công sử dụng để khiến Claude tiết lộ nó."

Diễn biến này xảy ra khi Anthropic cho biết họ đã gỡ bỏ một số tài khoản cố gắng sử dụng các mô hình của mình để giám sát công dân hoặc nghiên cứu bệnh tật theo những cách có thể hỗ trợ vũ khí sinh học. Đầu tuần này, các cơ quan tình báo và an ninh mạng Hoa Kỳ đã cáo buộc các công ty AI có trụ sở tại Trung Quốc thực hiện việc "trích xuất có hệ thống" các chức năng và khả năng độc quyền của các mô hình hàng đầu Hoa Kỳ thông qua các cuộc tấn công Distillation.