Anthropic cho biết Claude đã nhầm lẫn internet công cộng là bài kiểm tra CTF và xâm nhập 3 tổ chức

Anthropic vào thứ Năm đã trở thành công ty trí tuệ nhân tạo (AI) mới nhất tiết lộ rằng ba mô hình của họ, bao gồm Claude Opus 4.7, Mythos 5 và một mô hình nghiên cứu chưa được đặt tên, đã xâm nhập vào ba tổ chức không xác định trong quá trình thử nghiệm an ninh mạng mà không hề hay biết. Công ty AI này cho biết các sự cố sớm nhất bắt đầu từ tháng 4 năm 2026, đồng thời cho biết thêm rằng họ đã phát hiện ra sau khi triển khai một cuộc rà soát quy mô lớn.
Anthropic Claude AI Cybersecurity

Vào thứ Năm, Anthropic đã trở thành công ty trí tuệ nhân tạo (AI) mới nhất tiết lộ rằng ba mô hình của họ, bao gồm Claude Opus 4.7, Mythos 5 và một mô hình nghiên cứu chưa được đặt tên, đã xâm nhập vào ba tổ chức không xác định trong quá trình thử nghiệm an ninh mạng mà không hề hay biết.

Công ty AI này cho biết các sự cố sớm nhất bắt đầu từ tháng 4 năm 2026. Họ đã phát hiện ra điều này sau khi triển khai một cuộc "rà soát hồi cứu quy mô lớn" nhằm phản hồi các tiết lộ gần đây từ OpenAI, về việc một số mô hình của hãng này đã thoát khỏi môi trường sandbox bằng cách khai thác một lỗ hổng Zero-Day chưa được báo cáo trong Artifactory để truy cập internet và đột nhập vào hệ thống của Hugging Face.

"Sau khi xem xét 141.006 lượt chạy đánh giá mà Claude có thể đã truy cập internet, chúng tôi đã xác định được ba sự cố trong đó một mô hình đã truy cập internet từ bên trong hoặc trong khi tương tác với môi trường đánh giá của Irregular, một đối tác đánh giá bên thứ ba, và sau đó truy cập trái phép vào hạ tầng sản xuất của ba tổ chức khác nhau," Anthropic cho biết.

Trong tất cả các sự cố được xác định, Claude được giao nhiệm vụ thực hiện thử thách capture-the-flag (CTF) để đánh giá khả năng của mô hình. Mục tiêu là tìm kiếm một thông tin bí mật được ẩn trên một máy tính khác trong mạng bằng bất kỳ phương tiện nào.

Mặc dù yêu cầu đánh giá (prompt) ghi rõ rằng môi trường này là giả lập và không có quyền truy cập internet, Anthropic cho biết một lỗi cấu hình đã khiến các máy tính mà mô hình truy cập có kết nối internet thực tế. Nguyên nhân được mô tả là do "sự hiểu lầm" giữa phòng thí nghiệm AI và đối tác đánh giá Irregular.

Điều này dẫn đến việc Claude tìm kiếm các hệ thống thực trên internet công cộng và coi chúng là nằm trong phạm vi thử nghiệm. Mô hình đã xâm nhập vào hạ tầng của các tổ chức bị ảnh hưởng bằng các kỹ thuật cơ bản, bao gồm khai thác mật khẩu yếu và các điểm cuối (endpoints) không được xác thực.

Chi tiết về ba sự cố xâm nhập của Claude

  • Sự cố liên quan đến Claude Opus 4.7: Mô hình đã xâm nhập vào hạ tầng của một công ty thực tế bằng cách xác định và khai thác các lỗ hổng vì nghĩ rằng đó là một phần của thử thách. Điều này dẫn đến việc trích xuất thông tin đăng nhập ứng dụng, hạ tầng và truy cập vào cơ sở dữ liệu chứa hàng trăm dòng dữ liệu sản xuất. Đây cũng là sự cố duy nhất mà mô hình tiếp tục tấn công hệ thống mặc dù đã "nhận ra" mình đang hoạt động trong môi trường thực.
  • Sự cố liên quan đến Claude Mythos 5: Liên quan đến các hướng dẫn thiết lập để cài đặt một gói PyPI không tồn tại. Mô hình đã nỗ lực tìm cách tải lên một gói Python cùng tên để hệ thống của công ty giả định tự động tải về và cài đặt. Để đạt được điều này, nó đã tìm một nhà cung cấp email không bị chặn, đăng ký tài khoản PyPI và tải gói phần mềm lên.
  • Trong khoảng một giờ gói phần mềm này tồn tại trên registry, nó đã được tải xuống bởi 15 hệ thống thực, bao gồm một công ty bảo mật lớn thường xuyên quét mã độc các gói Python. Trình quét đã coi gói phần mềm này là an toàn, dẫn đến việc nó trích xuất thông tin đăng nhập của công ty đó đến một điểm cuối bên ngoài do mô hình thiết lập. Thông tin đăng nhập sau đó đã được sử dụng để truy cập thêm vào hạ tầng của công ty này.
  • Sự cố liên quan đến mô hình nghiên cứu nội bộ: Mô hình đã quét khoảng 9.000 mục tiêu và xâm nhập vào ứng dụng hướng internet của một công ty bằng các kỹ thuật như đọc thông tin đăng nhập từ trang debug bị lộ và SQL injection. Tuy nhiên, mô hình sau đó đã tự ngừng cuộc tấn công sau khi nhận ra "máy chủ bị xâm nhập nằm trong một tài khoản đám mây không có kết nối với thử thách CTF."

Ranh giới giữa đánh giá năng lực và công cụ tấn công

Tương tự như trường hợp của OpenAI, các mô hình trong các lần đánh giá này được cho là đã chạy mà không có các rào cản an toàn (guardrails) tiêu chuẩn. Anthropic thừa nhận rằng các biện pháp phòng thủ chuyên sâu như xác thực đường dẫn truy cập internet và giám sát log thời gian thực có thể đã ngăn chặn hoặc giảm thiểu khả năng xảy ra các sự cố này.

Bài học chính từ các sự cố riêng lẻ này là các mô hình tiên tiến đang phản ứng phù hợp hơn so với các thế hệ trước, mặc dù cần nhiều thử nghiệm hơn để xác nhận hành vi này.

"Opus 4.7, mô hình cũ nhất của chúng tôi, đã nhận ra mình đã chạm tới hệ thống sản xuất nhưng vẫn tiếp tục tấn công. Mythos 5 đã nhận định đúng rằng nó đang truy cập internet công cộng, nhưng sau đó lại tự lập luận để đi đến kết luận rằng nó vẫn đang trong một mô phỏng. Mô hình nghiên cứu mới nhất của chúng tôi đã ngừng bài tập ngay khi có bằng chứng cho thấy mục tiêu là thật."

Các thông báo này ngày càng giống như một hình thức "tiếp thị năng lực" — trình diễn những gì các mô hình AI hàng đầu có thể khai thác, vượt qua hoặc bẻ khóa. Mặc dù các công ty luôn nhấn mạnh vào các giao thức an toàn và tiết lộ có trách nhiệm, thông điệp tiềm ẩn vẫn rất rõ ràng: các mô hình đang trở thành những công cụ tấn công mạnh mẽ.

Điều này đặt ra một câu hỏi hóc búa về trách nhiệm pháp lý và bồi thường khi các biện pháp an toàn thất bại. Nếu các công ty AI mong muốn được công nhận vì đã mở rộng ranh giới những gì mô hình của họ có thể đạt được, họ cũng nên chấp nhận trách nhiệm lớn hơn đối với cách các năng lực đó được phát hành, đánh giá và giám sát trước công chúng.