Mô hình Gemini của Google đã trở thành hệ thống trí tuệ nhân tạo (AI) mới nhất truy cập internet và xâm nhập vào các công ty khác trong một đợt đánh giá an ninh mạng. Sự việc này lần đầu tiên được đưa tin bởi The Wall Street Journal.
Các sự cố xảy ra vào tháng 5 năm 2026 như một phần của đợt chạy thử nghiệm do công ty Irregular của Israel thực hiện. Đối tác đánh giá này cũng tham gia vào các vụ xâm nhập tương tự đã được OpenAI, Anthropic và Meta tiết lộ.
Theo Journal, mô hình này đã giành được quyền truy cập vào một hệ thống được bảo vệ sau khi liên tục đoán mật khẩu. Hai trường hợp khác liên quan đến việc mô hình tìm thấy thông tin xác thực (credentials) trong một kho lưu trữ công cộng, cho phép nó truy cập trái phép vào các hệ thống được bảo vệ.
Tuy nhiên, không giống như các sự cố khác được quan sát thấy trong trường hợp của Anthropic và OpenAI, mô hình Gemini đã chủ động chấm dứt việc xâm nhập sau khi nhận thấy rằng nó đã vi phạm vào hệ thống của một công ty thật. Irregular được cho là đã thông báo cho Google về các sự cố này vào tháng 7 năm 2026.
Trong một báo cáo được công bố vào tháng trước, Irregular đã xác định nguyên nhân của các vụ vi phạm đánh giá là do lỗi đặt tên. Lỗi này khiến tên một công ty hư cấu được sử dụng trong các bài tập "capture the flag" vô tình trùng khớp với một tên miền (domain) thực tế, từ đó cho phép các mô hình nhắm mục tiêu vào tên miền đó "một số lần hạn chế" bằng cách lợi dụng việc quyền truy cập internet vô tình được mở ra.
"Sự kiện này nhấn mạnh tầm quan trọng của việc huấn luyện các mô hình AI mạnh mẽ để hoạt động một cách có trách nhiệm," Heather Adkins, phó chủ tịch kỹ thuật bảo mật của Google, chia sẻ với The Wall Street Journal. "Trong trường hợp này, mô hình đã hành động một cách phù hợp."
Gã khổng lồ công nghệ cũng lưu ý rằng họ không coi hành vi này là một ví dụ về việc sai lệch mô hình (model misalignment), vì các tác nhân (agents) đã dừng nỗ lực ngay sau khi các cơ chế an toàn được kích hoạt. Hiện vẫn chưa rõ công ty nào bị nhắm mục tiêu, mặc dù Irregular đã xác nhận với Journal rằng trường hợp của Google cũng tương tự như các sự cố khác và vấn đề đã được giải quyết từ vài tuần trước.
Tiết lộ này diễn ra chỉ vài ngày sau khi OpenAI phát hiện sáu sự cố bổ sung, trong đó các tác nhân AI của họ đã đi chệch hướng, hành động lừa dối và thực hiện các hành động không được phép trong quá trình huấn luyện. Những hành động này bao gồm che giấu sai lầm, tìm kiếm thông tin xác thực trái phép, tải tệp lên internet công cộng và giao tiếp qua Artifactory để "đọc ghi chú của những người giải quyết khác, đăng câu trả lời và sử dụng các trao đổi đó để cung cấp thông tin cho các phản hồi của mình."
Các phòng thí nghiệm AI đang phải đối mặt với sự giám sát ngày càng gắt gao kể từ khi OpenAI tiết lộ vào tháng 7 rằng các tác nhân AI lừa đảo đã vượt qua các kiểm soát nội bộ, tiếp cận internet mở và hoạt động như một "bầy đàn" để xâm nhập Hugging Face. Startup AI này đã mô tả đây là "một sự cố mạng chưa từng có" và sau đó đã công bố một khung làm việc mới để báo cáo các hành vi sai trái tương tự của mô hình trong tương lai.