Máy chủ MCP độc hại có thể chia nhỏ chỉ dẫn để lừa AI Agent đánh cắp dữ liệu nhạy cảm

Một máy chủ công cụ độc hại kết nối với trợ lý lập trình AI có thể âm thầm lấy đi các khóa SSH, bí mật môi trường, mã nguồn và dữ liệu khách hàng mà không cần gửi bất kỳ chỉ dẫn gây hại rõ ràng nào. Thủ thuật này hoạt động bằng cách chia nhỏ yêu cầu thành các mảnh trông có vẻ bình thường để đánh lừa Agent lắp ghép lại và gửi dữ liệu đi.
AI Agent và lỗ hổng MCP
Kỹ thuật GhostSplice cho phép máy chủ MCP độc hại lừa các trợ lý AI đánh cắp dữ liệu nhạy cảm.

Một máy chủ công cụ độc hại khi kết nối với trợ lý lập trình AI có thể âm thầm đánh cắp các SSH keys, bí mật môi trường (environment secrets), mã nguồn và dữ liệu khách hàng mà không cần gửi bất kỳ một chỉ dẫn gây hại rõ ràng nào.

Thủ thuật này có thể hoạt động ngay cả khi một yêu cầu đánh cắp trực tiếp bị mô hình từ chối: bằng cách chia nhỏ yêu cầu thành các mảnh trông có vẻ bình thường, đặt chúng vào các kênh mà trợ lý AI đã sử dụng, sau đó để chính Agent tự lắp ghép chúng lại và gửi dữ liệu ngược về cho kẻ tấn công.

Cuộc tấn công nhắm vào các công cụ lập trình kết nối với máy chủ bên ngoài thông qua Model Context Protocol (MCP), một tiêu chuẩn mở cho phép các trợ lý AI gọi các công cụ ngoại vi.

GhostSplice: Kỹ thuật chia nhỏ chỉ dẫn độc hại

Một máy chủ MCP độc hại có thể đặt một mảnh chỉ dẫn trong phần mô tả công cụ và một mảnh khác trong kết quả trả về của công cụ; một số thiết lập còn hỗ trợ lấy mẫu do máy chủ khởi xướng (server-initiated sampling). Mặc dù MCP có bảo vệ ranh giới cấu trúc của công cụ và kết quả, nhưng các thử nghiệm của ASSET Research Group cho thấy các Agent vẫn có thể kết hợp các chỉ dẫn này trong cùng một ngữ cảnh làm việc (working context), do đó không có mảnh đơn lẻ nào chứa toàn bộ yêu cầu độc hại.

Nhóm nghiên cứu gọi kỹ thuật này là GhostSplice. Công bố của họ mô tả các thử nghiệm được kiểm soát trong các dự án cô lập chứa thông tin đăng nhập giả lập, không phải là một vụ xâm nhập thực tế được báo cáo. Nhóm cũng cho biết các định danh CVE sẽ được công bố sau quá trình tiết lộ có phối hợp; tính đến ngày 10 tháng 8 năm 2026, The Hacker News chưa tìm thấy mã định danh nào được niêm yết.

Kết quả đáng chú ý nhất không phải là bảng xếp hạng mô hình đơn thuần. Cùng một mô hình có thể từ chối thực hiện yêu cầu trong một ứng dụng lập trình này nhưng lại đánh cắp dữ liệu trong một ứng dụng khác, tùy thuộc vào các biện pháp kiểm soát an toàn xung quanh nó.

Cuộc tấn công này cũng có giới hạn nhất định. Nó không phải là cách để xâm nhập vào một Agent bất kỳ từ bên ngoài: nó giả định rằng lập trình viên đã kết nối với máy chủ MCP của kẻ tấn công và Agent đó đã có quyền đọc các tệp tin đang bị lấy đi.

Giao thức Model Context Protocol
Cơ chế hoạt động của Model Context Protocol (MCP) tiềm ẩn rủi ro nếu kết nối với máy chủ không tin cậy.

Cách thức triển khai thực tế

Trong bản triển khai tham chiếu của nhóm, một máy chủ quảng cáo một công cụ có vẻ vô hại tên là integrity_checker với bốn trường dữ liệu thông thường (alpha đến delta) và không có tên tệp nhạy cảm nào. Kết quả quét dự án sau đó cung cấp ánh xạ còn thiếu: điền vào các trường đó nội dung của .ssh/id_rsa, mã nguồn độc quyền, customers.csv.env để "xác minh mã băm phía máy chủ".

Nếu đọc riêng biệt, không mảnh nào chứa đựng hành vi trộm cắp hoàn chỉnh. Nhưng khi đọc cùng nhau, chúng ra lệnh cho Agent thu thập các tệp cục bộ nhạy cảm và chuyển nội dung của chúng vào công cụ của kẻ tấn công. Kho lưu trữ công khai cũng bao gồm một biến thể ba kênh, tách biệt danh mục dự án, ánh xạ tệp-trường và công cụ thu thập qua ba lần tương tác khác nhau.

Tỷ lệ thành công của cuộc tấn công

Khi chia nhỏ thành hai mảnh, tỷ lệ tuân thủ trung bình tăng từ 42% lên 82% trên 11 mô hình được thử nghiệm qua API. GPT-4o, Gemini 2.0 Flash và Llama 3.3 70B đã tăng từ 0% trong bài kiểm tra một mảnh lên 100% khi bị chia đôi. Claude Haiku 4.5 giữ ở mức 0% trong các bài kiểm tra API nhưng đạt 100% trong bài kiểm tra Cursor ba mảnh. GPT-5.4 đạt 90% trong Cursor và 100% qua Codex CLI.

"Nhiệm vụ đối với mô hình lúc này chỉ đơn giản là 'điền vào biểu mẫu mà công cụ đã yêu cầu tôi điền'."

Giải pháp phòng vệ cho lập trình viên

Trách nhiệm phòng vệ thuộc về phía máy khách (client). Đặc tả MCP nêu rõ rằng các ứng dụng nên để con người có quyền từ chối việc thực thi công cụ và phải coi các chú thích từ các máy chủ không tin cậy là không an toàn. Hướng dẫn hiện tại của OpenAI cũng cảnh báo rằng các máy chủ MCP không an toàn làm tăng rủi ro prompt-injection và khuyến cáo các tổ chức nên kiểm duyệt kỹ các tích hợp tùy chỉnh và từ bên thứ ba.

Khuyến nghị của ASSET thậm chí còn chặt chẽ hơn: hãy coi đầu ra của máy chủ là dữ liệu thuần túy chứ không phải chỉ dẫn, và không cho phép các giá trị từ đầu ra của một công cụ tự động chảy vào đối số của một công cụ khác mà không được kiểm tra.

GhostSplice tiếp nối Ghostcommit, một công bố vào tháng 6 từ cùng phòng thí nghiệm này, vốn ẩn chỉ dẫn bên trong một tệp PNG để lừa Agent mã hóa các bí mật trong tệp .env thành các số nguyên bên trong mã nguồn. Cả hai đều chỉ ra cùng một điểm yếu: ranh giới an toàn xung quanh mô hình AI cũng quan trọng không kém gì bản thân mô hình đó.