METR (viết tắt của Model Evaluation and Threat Research và phát âm là "Meter"), một tổ chức nghiên cứu phi lợi nhuận chuyên đánh giá các mô hình trí tuệ nhân tạo (AI) tiên tiến về khả năng thực hiện các tác vụ dài hạn và mang tính tự chủ (agentic tasks), vừa tiết lộ rằng họ đã phải chịu "hai sự cố an ninh đáng chú ý", trong đó các tác nhân bên ngoài cố gắng truy cập trái phép vào hệ thống của tổ chức.
Tổ chức này cho biết không có thông tin nhạy cảm nào được cho là đã bị truy cập sau các sự cố này, đồng thời cho biết thêm rằng một phiên bản phát hiện của họ đã được chia sẻ với các công ty AI mà họ hợp tác trước khi công bố công khai. Các cuộc tấn công không được quy kết cho bất kỳ tác nhân hoặc nhóm đe dọa nào đã biết, cũng như không liên quan đến việc các AI agent đột nhập vào các bài đánh giá của họ.
"Vào tháng 3 năm 2026, những kẻ tấn công đã đánh cắp một API key dùng để suy luận (inference) trên các mô hình công khai và tiêu tốn một lượng lớn tín dụng (credits)", METR cho biết. "Vào tháng 5 năm 2026, chúng tôi đã quan sát thấy những kẻ tấn công thăm dò hệ thống hạ tầng có thể truy cập công khai của mình, bao gồm một nỗ lực không thành công trong việc truy cập dữ liệu nội bộ thông qua một endpoint vô tình bị lộ."
Sự cố tháng 3
Theo METR, một trong những nhà nghiên cứu của họ (người không có quyền truy cập nhạy cảm) được cho là đã sử dụng các agent chạy trên một EC2 instance cá nhân vốn được cố ý để ở chế độ công khai sau lớp xác thực Google. Instance này chứa một API key cho tài khoản truy cập chung (các mô hình công khai) của METR.
Tuy nhiên, ứng dụng "vibe-coded" này đã gặp phải một "lỗ hổng fail-open" khiến việc xác thực bị vô hiệu hóa một cách âm thầm, dẫn đến việc bảng điều khiển điều phối agent bị lộ trên internet công cộng trong vài ngày.
"Từ phân tích của mình, chúng tôi nghi ngờ rằng kẻ tấn công đã tìm thấy instance này bằng cách xem qua các trang web mới đăng ký (ví dụ: trong danh sách certificate transparency) để tìm các trang web vibe-coded có từ khóa liên quan đến LLMs hoặc agent, nhằm mục đích thu thập các API key của nhà cung cấp mô hình có thể bị lộ", METR giải thích.
Sau khi hệ thống được xác định, tác nhân đe dọa đã ra lệnh trực tiếp cho một agent để tiết lộ API key của nhà cung cấp mô hình, thêm một SSH key để duy trì quyền truy cập lâu dài và sử dụng các thông tin xác thực bị đánh cắp để tiêu thụ một lượng lớn tín dụng API trên các mô hình có sẵn công khai trong khoảng thời gian ba tuần.
METR cho biết số tín dụng tích lũy sẽ tương đương với hóa đơn khoảng 600.000 USD nếu nó không được nhà cung cấp mô hình cung cấp miễn phí cho tổ chức phi lợi nhuận này. Tên của công ty AI không được tiết lộ.
Tổ chức này cũng lưu ý rằng việc sử dụng bất hợp pháp không được phát hiện ngay lập tức vì họ thường thực hiện các đánh giá và thử nghiệm quy mô lớn tiêu tốn một lượng lớn token và thực tế là không có giới hạn chi tiêu token. Sau sự cố, METR cho biết họ đã cập nhật các chính sách bảo mật liên quan đến việc đặt thông tin xác thực hoặc dữ liệu của METR trên hạ tầng hoặc thiết bị không thuộc quản lý của METR, cải thiện việc giám sát và thêm cảnh báo chi tiêu vào các key nếu có thể.
Sự cố tháng 5
Cuộc tấn công thứ hai quan sát được vào tháng 5 năm 2026 được mô tả là một "chiến dịch tấn công bên ngoài kéo dài" do một tác nhân đe dọa có khả năng vì mục tiêu tài chính dàn dựng nhằm có được quyền truy cập bất hợp pháp vào các mô hình AI tiên tiến.
"Chúng tôi quan sát thấy những kẻ tấn công thăm dò một cách có hệ thống hạ tầng có thể truy cập công khai của mình, sử dụng nhiều agent để tự động hóa việc phát hiện lỗ hổng, bao gồm cả kỹ thuật credential stuffing vào các nhà cung cấp xác thực, cố gắng cấp quyền OAuth token, quét các dịch vụ mới triển khai và cố gắng phishing nhân viên," METR cho biết.
Cùng thời điểm đó, tổ chức nghiên cứu này cho biết họ đã vô tình để lộ cơ chế truy vấn SQL ở chế độ chỉ đọc được tích hợp trong trình xem bản ghi công khai (public transcript viewer). Mặc dù các truy vấn được giới hạn trong dữ liệu công khai theo mặc định, một lỗi trong thành phần này có thể đã bị khai thác để truy cập dữ liệu đánh giá chưa được công bố.
Ngoài ra, cơ sở dữ liệu đã "vô tình bao gồm" dữ liệu mô hình nhạy cảm, mặc dù thực tế nó chỉ được chứa dữ liệu từ các mô hình không nhạy cảm. METR cho biết họ chỉ nhận ra vấn đề sau khi một nhà nghiên cứu bảo mật độc lập phát hiện và báo cáo, dẫn đến việc API bị ngắt kết nối.
"Những kẻ tấn công đã thăm dò endpoint này trong chiến dịch rộng lớn của chúng, nhưng bằng chứng cho thấy không có dấu hiệu nào cho thấy chúng đã phát hiện ra lỗ hổng hoặc truy cập vào bất kỳ dữ liệu không công khai nào," METR cho biết.