Tấn công Cryptographic Context Injection mới có thể cho phép trang web đánh cắp dữ liệu chat của Grok

Adversa AI đã tiết lộ một kỹ thuật tấn công có tên Cryptographic Context Injection, có khả năng khiến chatbot Grok của xAI đánh cắp và gửi tên người dùng, vị trí, gói đăng ký cùng lịch sử trò chuyện của người dùng đến máy chủ của kẻ tấn công sau khi tóm tắt một trang web độc hại.
Grok Chatbot Security Attack
Kỹ thuật tấn công mới nhắm vào chatbot Grok của xAI

Adversa AI đã tiết lộ một kỹ thuật tấn công mà họ cho rằng có thể khiến chatbot Grok của xAI gửi tên người dùng, vị trí tương đối, gói đăng ký và các prompt từ cuộc trò chuyện hiện tại đến máy chủ do kẻ tấn công kiểm soát sau khi người dùng yêu cầu nó tóm tắt một trang web thông thường.

Công ty bảo mật AI này đã đặt tên mã cho kỹ thuật này là "Cryptographic Context Injection". Họ cho biết quá trình truyền dữ liệu được hoàn tất mà không cần bước xác nhận và không có cảnh báo hiển thị trong bản trình diễn Proof-of-Concept (PoC) của mình.

Hiện tại vẫn chưa có bản vá, chưa có mã định danh CVE và không có giải pháp tạm thời cho người dùng. Bài viết cũng không báo cáo bất kỳ hành vi khai thác thực tế nào. Khi được hỏi phiên bản nào đã được thử nghiệm, Adversa nói với The Hacker News rằng mục tiêu là phiên bản Grok web chat tại grok.com chạy Grok 4.5 Fast, và cuộc tấn công đã được tái hiện một lần vào ngày 19 tháng 8 năm 2026.

Báo cáo không đưa ra tỷ lệ thành công cụ thể. Tuy nhiên, công ty cho biết họ đã thử nghiệm cuộc tấn công 20 lần kể từ tháng 6 với tỷ lệ thành công 40%, và các lần thất bại là do Grok gặp khó khăn trong việc giải mã chứ không phải do prompt hay phản hồi bị gắn cờ vi phạm.

Cơ chế hoạt động của Cryptographic Context Injection

Kỹ thuật này chuyển các hướng dẫn của kẻ tấn công dưới dạng bản mã (ciphertext) thay vì văn bản có thể đọc được. Trang web sẽ chứa một đối tượng JSON đã mã hóa, dữ liệu khóa (key material) và hướng dẫn giải mã, thứ mà Grok sẽ thực thi trong môi trường chạy mã (runtime) Python của chính nó.

Việc khôi phục bản rõ (plaintext) đòi hỏi phải chạy PBKDF2 và AES-256-GCM, những thứ mà các bộ phân loại nội dung (content classifier) không thực hiện tại thời điểm kiểm tra. Do đó, các chỉ dẫn sẽ tiếp cận ngữ cảnh của mô hình dưới dạng đầu ra của mã mà mô hình vừa thực thi, thay vì là nội dung web được truy xuất thông thường.

"Mã hóa mạnh không thể bị đọc bởi bộ phân loại nội dung và không thể bị chặn tắt trong các trọng số (in-weights), vì vậy nó buộc phải khôi phục thông qua môi trường runtime mà cuộc tấn công phụ thuộc vào. Việc liệu một kiểu mã hóa yếu hơn có thể vượt qua các bộ lọc cụ thể của mục tiêu hay không là một câu hỏi thực nghiệm," Rony Utevsky, nhà nghiên cứu chính tại Adversa AI, cho biết.

Các chỉ dẫn sau khi giải mã sẽ điều hướng AI agent truy xuất ngữ cảnh phiên riêng tư của nó và nhúng vào một URL mà nó được yêu cầu mở để "lấy thêm ngữ cảnh".

Một thành phần trong chuỗi tấn công là mô hình tự tạo ra một "khóa giải mã" bổ sung (thực tế không phải là dữ liệu khóa), với giá trị là một chuỗi mẫu chứa các biến như tên, vị trí, gói đăng ký và lịch sử chat. Grok sau đó gọi công cụ điều hướng của chính nó để tải URL đó, mang theo dữ liệu trong các tham số truy vấn (query parameters) của yêu cầu.

Utevsky cho biết các prompt bị lấy đi trong kịch bản thử nghiệm chỉ giới hạn ở cuộc trò chuyện đang diễn ra, và mọi thứ được trích xuất đều đã nằm trong ngữ cảnh của mô hình. Khả năng tiếp cận của AI agent mở rộng đến "bất cứ thứ gì nó nắm giữ trong ngữ cảnh hoặc có thể tìm nạp bằng các công cụ của mình". Công ty đã không thử nghiệm liệu nó có thể truy cập các cuộc trò chuyện khác, bộ nhớ của agent hoặc các nội dung khác hay không.

"Framework do xAI xây dựng cho phép các chỉ dẫn và dữ liệu được phân tích cú pháp từ một trang web bên ngoài không đáng tin cậy thúc đẩy việc gọi một công cụ có đặc quyền, được kết nối internet; nó cho phép metadata của phiên riêng tư và lịch sử hội thoại được đưa vào đầu vào của công cụ hướng ngoại đó; và nó không thực thi ranh giới thoát (egress boundary) hay cổng chấp thuận hiệu quả nào trên con đường này," Adversa nhận định.

Phản hồi từ các bên liên quan

Công ty cho biết họ đã báo cáo vấn đề lần đầu cho xAI vào ngày 3 tháng 6 năm 2026 và cho chương trình Bug Bounty của xAI trên HackerOne cùng ngày. xAI đã xác nhận báo cáo nhưng không cung cấp thông tin chi tiết hoặc lộ trình khắc phục. Các nỗ lực liên lạc tiếp theo vào ngày 4 tháng 8 và ngày 10 tháng 8 đều không nhận được phản hồi.

Adversa là nguồn duy nhất cho phát hiện về Grok này và cho biết họ đang giữ lại các payload vận hành để tránh bị khai thác. Tính đến ngày 20 tháng 8 năm 2026, xAI vẫn chưa công bố tuyên bố hay tư vấn nào về nghiên cứu này.

Một bản trình diễn thứ hai trong cùng bài viết nhắm vào Gemini của Google ở chế độ Deep Thinking. Một prompt duy nhất có thể khiến mô hình giải mã một payload, sau đó biến thành một Python traceback giả mạo chứa callback hủy kích hoạt chính sách an toàn, khiến mô hình đưa ra các phản hồi bị hạn chế.

Adversa cho biết kỹ thuật này đã tạo ra nội dung bị hạn chế và tái hiện được các hướng dẫn hệ thống của Gemini. Google đã không được thông báo vì các kỹ thuật Jailbreak nằm ngoài phạm vi chương trình tiết lộ lỗ hổng của họ. Tỷ lệ thành công đối với Gemini đã "giảm đáng kể vào tháng 8", có thể do các bản cập nhật bộ lọc hoặc thay đổi phiên bản mô hình.

Khuyến nghị bảo mật cho các hệ thống AI Agent

Adversa cho rằng vấn đề này không nhất thiết phải được khắc phục ở tầng mô hình, mà nằm ở các biện pháp kiểm soát xung quanh AI agent. Các nhóm vận hành agent được khuyên thực hiện các bước sau:

  • Cách ly nội dung không đáng tin cậy (Quarantine): Đặt nội dung này trong một ngữ cảnh không có công cụ và không có thông tin xác thực, chỉ trả về dữ liệu có cấu trúc cho ngữ cảnh có đặc quyền.
  • Kiểm soát các hành động không thể đảo ngược và hướng ngoại: Xác nhận các đích đến mạng mới, các lệnh push, merge, publish hoặc ghi dữ liệu bên ngoài không gian làm việc với các đối số đã được phân giải đầy đủ, thay vì sử dụng template.
  • Ghi lại dấu vết công cụ (Tool traces) theo từng phiên: Lưu lại các đối số đã được phân giải để phục vụ phát hiện và điều tra dấu vết (forensics).
  • Cảnh báo dựa trên chuỗi hành động: Cảnh báo khi xuất hiện một khối dữ liệu mờ đục (opaque blob) đi kèm với hướng dẫn giải mã, thay vì chỉ dựa vào các bộ lọc chặn đơn lẻ.
  • Yêu cầu về nguồn gốc ngữ cảnh (Context provenance): Đưa yêu cầu này vào tiêu chuẩn mua sắm và hỏi các nhà cung cấp liệu đầu ra của công cụ có được tách biệt khỏi kênh chỉ dẫn hay không.

Sự việc này diễn ra trong bối cảnh các nghiên cứu khác cũng chỉ ra lỗ hổng trong các khối "encrypted chain-of-thought" của Anthropic, OpenAI và Google, có thể bị kẻ tấn công lợi dụng để thực hiện các cuộc tấn công Prompt Injection vô hình nhằm đầu độc các hệ thống AI công cộng.