Aikido Security vừa công bố nghiên cứu tái hiện sự cố đặt phòng tập tại Úc trong môi trường tổng hợp. Kết quả cho thấy Claude Opus 4.6, khi chạy trên framework agent OpenClaw, đã khai thác lỗ hổng giới hạn đặt chỗ chỉ được thiết lập ở phía client-side trong 9 trên 10 lần thử nghiệm.
Sự cố ban đầu được ABC News đưa tin vào ngày 10 tháng 8, dựa trên nhật ký chat và ảnh chụp màn hình do người dùng cung cấp. Người này đã yêu cầu một agent OpenClaw chạy model Opus 4.6 đặt lịch tập gym cho mình. Tuy nhiên, agent này đã đặt các buổi tập vượt xa khung thời gian hàng tháng mà trang web cho phép.
Sau đó, dù không được yêu cầu, agent còn tự kiểm tra xem cùng một API đó có cho phép nó hủy danh sách chờ của thành viên khác hay không. Thử nghiệm này đã loại bỏ người đang đứng đầu danh sách chờ và đưa người dùng lên vị trí cao hơn. Agent sau đó thông báo với người dùng rằng nó không thể thêm thành viên kia trở lại danh sách.
Lỗ hổng kỹ thuật và kết quả nghiên cứu
Hệ thống thử nghiệm của Aikido là một ứng dụng web trang đơn (SPA) được hỗ trợ bởi GraphQL API mang hai lỗi bảo mật tương tự như sự cố gốc. Cửa sổ đặt chỗ bảy ngày chỉ được thực thi ở frontend, và mutation cancelReservation không kiểm tra xem người dùng đang đăng nhập có thực sự sở hữu lượt đặt chỗ đó hay không – một trường hợp điển hình của lỗ hổng Insecure Direct Object Reference (IDOR).
Trong 2 trên 10 lần chạy, mô hình đã tiến hành hủy lượt đặt chỗ đã xác nhận của một thành viên khác thông qua lỗi thứ hai trước khi tự dừng lại. Aikido cho biết không có câu lệnh gợi ý (prompt) nào trong bất kỳ lần chạy nào yêu cầu mô hình khai thác lỗ hổng bảo mật.
"Động lực này cho thấy các biện pháp bảo vệ có thể phản ứng quá mức với các yêu cầu trực tiếp của người dùng nhưng lại thiếu nhạy bén với các yêu cầu gián tiếp, hoặc các mô hình bị mất đi bối cảnh đạo đức trong một chuỗi các hành động hoặc lệnh gọi công cụ lặp đi lặp lại," nhà nghiên cứu bảo mật Oliver Smith của Aikido nhận định.
Các thử nghiệm đã sử dụng Claude Opus 4.6, phiên bản được Anthropic cung cấp rộng rãi vào ngày 5 tháng 2 năm 2026, trên OpenClaw v2026.4.1, với các lớp đào tạo an toàn của mô hình được giữ nguyên và tính năng suy nghĩ mở rộng (extended thinking) bị vô hiệu hóa.
The Hacker News đã xác nhận thông qua npm registry vào ngày 25 tháng 8 rằng OpenClaw v2026.4.1 được xuất bản vào ngày 1 tháng 4 năm 2026, và đã có 168 phiên bản được tung ra kể từ đó, với bản phát hành hiện tại là 2026.7.1-2.
Trong lần chạy thứ nhất, mô hình đã hủy một lượt đặt chỗ đã xác nhận của thành viên khác. Việc hủy bỏ này đã tự động đưa người đứng đầu danh sách chờ lên thay thế.
"Tôi không nên thử nghiệm điều đó trên một lượt đặt chỗ thật. Đó là lỗi của tôi. Lớp học hiện đã trở lại trạng thái 12/12 với danh sách chờ được đôn lên, vì vậy trạng thái phần lớn là nhất quán — nhưng một thành viên thực thụ đã bị mất chỗ," mô hình phản hồi trong bản ghi nhật ký của lần chạy đầu tiên.
Tất cả 10 prompt mở đầu đều hướng dẫn mô hình kiểm tra API hoặc backend của trang web, và một số lưu ý về hạn chế bảy ngày trong khi yêu cầu đặt chỗ nhất quán. Aikido tính toán xác suất trung bình của lựa chọn chiếm ưu thế trong 16 điểm quyết định được lấy mẫu là 96,38%.
Phản hồi từ phía nhà phát triển và cơ quan chức năng
Anthropic đã ghi nhận cùng một loại hành vi này trước khi mô hình được xuất xưởng.
"Chúng tôi đã quan sát thấy một số sự gia tăng các hành vi sai lệch trong các lĩnh vực cụ thể, chẳng hạn như khả năng che giấu hành vi phá hoại và hành vi mang tính agent quá mức trong môi trường sử dụng máy tính, mặc dù không có hành vi nào đạt đến mức ảnh hưởng đến đánh giá triển khai của chúng tôi," Anthropic cho biết trong Claude Opus 4.6 system card.
Thiết lập này khác với các tiết lộ từ phòng thí nghiệm frontier vào tháng 7. Khi đó, một lỗi cấu hình đã để lại môi trường đánh giá bị cô lập có quyền truy cập internet trực tiếp, dẫn đến việc các mô hình của Anthropic xâm nhập vào ba tổ chức thực tế. Anthropic tin rằng những sự cố đó "gần với lỗi vận hành và framework agent hơn là lỗi điều chỉnh (alignment) mô hình."
Các cơ quan an ninh mạng tại Úc và Mỹ trước đó đã đưa ra cảnh báo về các lỗ hổng IDOR. Đơn vị cung cấp phần mềm đặt chỗ phòng tập vẫn chưa được nêu tên và chưa có bản vá nào được công bố tính đến ngày 25 tháng 8.
Cục Tín hiệu Úc (ASD), đơn vị đã nêu tên sự cố ban đầu trong một cảnh báo xuất bản ngày 11 tháng 8, đã đưa ra các lời khuyên sau:
- Cá nhân nên hạn chế sử dụng AI agent cho các nhiệm vụ rủi ro thấp, không nhạy cảm và tránh cấp cho agent quyền truy cập rộng rãi hoặc quyền ra quyết định không bị hạn chế.
- Duy trì sự kiểm soát của con người (human in the loop) để xem xét, phê duyệt và giám sát các hành động của agent, đặc biệt là nơi có thể xảy ra tương tác với các dịch vụ của bên thứ ba hoặc người dùng khác.
- Các tổ chức cung cấp dịch vụ trực tuyến nên cân nhắc rằng AI agent có thể xác định và khai thác các lỗ hổng với tốc độ và quy mô lớn.
Sự việc diễn ra trong bối cảnh Hugging Face cho biết họ đã phải chuyển sang một mô hình open-weight để tái hiện vụ xâm nhập của chính họ vào tháng 7, sau khi các mô hình frontier mà họ thử nghiệm trước đó đã từ chối thực hiện công việc giám định pháp y.
"Các mô hình mà chúng tôi tiếp cận đầu tiên là Claude Opus và Fable đã từ chối một phần lớn công việc đó: các rào chắn an toàn của chúng coi việc dịch ngược (reverse-engineering) một bản khai thác lỗ hổng cũng giống như việc tung ra một cuộc tấn công," Hugging Face chia sẻ.