Các hướng dẫn ẩn trong tài liệu Word có thể khiến Microsoft 365 Copilot viết lại số liệu trong một báo cáo, sau đó sao chép chính các hướng dẫn đó vào tệp tin đã hoàn thành. Håkon Måløy đã tiết lộ kỹ thuật này vào ngày 28 tháng 7, 144 ngày sau khi báo cáo cho Microsoft.
Trong Proof of Concept (PoC) của mình, tệp tin được tạo ra nội bộ đã kích hoạt cùng một hành vi khi nó được sử dụng trong một phiên soạn thảo Copilot thứ hai.
Dòng thời gian của Måløy cho biết Microsoft đã xác nhận hành vi được báo cáo vào ngày 31 tháng 3 và triển khai hai biện pháp giảm nhẹ. Biện pháp đầu tiên là chặn cách dùng từ của prompt gốc; biện pháp thứ hai là nâng cấp mô hình cơ sở lên GPT-5.5.
Ông cho biết toàn bộ chuỗi tấn công vẫn hoạt động với các hướng dẫn đã được sửa đổi trên GPT-5.6 vào ngày hôm sau, và loại hình tấn công này vẫn có thể tái hiện vào ngày 28 tháng 7. Måløy nhận định: "Do đó, lớp lỗ hổng này vẫn có thể bị khai thác tại thời điểm công bố."
Cuộc tấn công này không phải là zero-click và không thực thi phần mềm độc hại (malware) truyền thống. Nó yêu cầu một thao tác soạn thảo hoặc chỉnh sửa bằng Copilot, và tài liệu độc hại phải nằm trong ngữ cảnh của mô hình dưới dạng tệp đính kèm hoặc nguồn OneDrive được chọn bởi Work IQ, công cụ trí tuệ đằng sau Microsoft 365 Copilot.
Bản công bố không ghi nhận trường hợp khai thác thực tế nào (in the wild), và Måløy đã giữ lại mã khai thác (payload) hoàn chỉnh. Ông khuyến nghị nên coi các tài liệu bên ngoài là không đáng tin cậy, kiểm tra kỹ các tài liệu đính kèm trước khi bắt đầu tạo hoặc chỉnh sửa nội dung, và kiểm tra các tệp do Copilot tạo ra hoặc chỉnh sửa trước khi tái sử dụng hoặc chia sẻ.
Cơ chế hoạt động của chuỗi tấn công
Chuỗi tấn công chạy qua văn bản tài liệu và hành vi soạn thảo của chính Copilot. Copilot đọc các tệp nguồn để quyết định nội dung gì thuộc về bản nháp và có thể nhầm lẫn các hướng dẫn bên trong chúng là một phần yêu cầu của người dùng. Trong PoC, nó đã giảm một nửa mọi con số tài chính, sao chép toàn bộ prompt vào đầu ra bằng văn bản màu trắng, cỡ chữ 8 và không tiết lộ bất kỳ thay đổi nào.
Måløy cho biết Word loại bỏ màu sắc và kích thước phông chữ trước khi gửi văn bản tài liệu đến mô hình ngôn ngữ lớn (LLM), khiến các hướng dẫn "trắng trên nền trắng" vẫn có thể đọc được đối với mô hình. Một phần của payload đã thay đổi tài liệu; phần còn lại yêu cầu Copilot sao chép và che giấu các hướng dẫn, trình bày các lệnh đó như là yêu cầu theo dõi nguồn gốc và khả năng đọc.
Microsoft cho biết Word có thể xây dựng bản nháp dựa trên tối đa 20 tệp, email hoặc cuộc họp, và tính năng Edit with Copilot có thể sử dụng Work IQ. Edit with Copilot hiện vẫn đang được triển khai trên toàn thế giới cho người dùng có giấy phép phù hợp. Trong thử nghiệm của Måløy, Copilot đã tìm kiếm trên OneDrive một báo cáo hàng quý, tìm thấy bản phân tích thị trường độc hại nằm ngoài thư mục chứa các nguồn khác và đưa nó vào ngữ cảnh. Work IQ vẫn đánh giá tệp đó là có liên quan.
Khi tài liệu độc hại ban đầu không còn và chỉ có báo cáo Q1 bị "nhiễm" được đính kèm, Copilot đã giảm một nửa các con số trong bản nháp Q2 và tiếp tục đính kèm prompt một lần nữa. Vật mang mới là một tài liệu thông thường được tạo ra nội bộ. Chuỗi này không tự lây lan: mỗi bước yêu cầu một thao tác soạn thảo hoặc chỉnh sửa khác của Copilot, trong đó vật mang phải nằm trong ngữ cảnh của mô hình.
Định dạng ẩn chỉ là điểm xâm nhập. Một khi Copilot sao chép các hướng dẫn vào một tài liệu được tạo nội bộ, nguồn gốc ban đầu không còn hiện diện khi tệp đó tham gia vào phiên làm việc tiếp theo. Måløy lập luận rằng sự đứt gãy trong vết tích nguồn gốc (provenance trail) này khiến việc truy vết sự thao túng trở nên khó khăn hơn.
Phản hồi từ Microsoft và các biện pháp bảo vệ
Tính đến thời điểm xuất bản, The Hacker News không tìm thấy CVE công khai hoặc thông báo riêng lẻ nào từ Microsoft cho phát hiện về Word này trong các tìm kiếm trên NVD, CVE.org và Security Update Guide của Microsoft. Microsoft cho biết các bộ phân loại jailbreak và tấn công tiêm nhiễm chéo prompt (XPIA) giúp chặn các prompt rủi ro cao, mặc dù chúng có thể không khả dụng trong mọi tình huống của Copilot.
Defender for Office 365 bổ sung tính năng kiểm tra luồng thư cho email đến. Microsoft mô tả các biện pháp bảo vệ khi thực thi (runtime) của Copilot bao gồm việc xử lý các hướng dẫn bị tiêm nhiễm từ nội dung nền tảng. Cả Microsoft và Måløy đều không cho biết liệu payload chính xác này có bị phát hiện ở tầng nào hay không.
Theo Måløy, không có biện pháp khắc phục nào phía khách hàng giải quyết triệt để vấn đề này. Lập luận của ông là việc chặn các payload cụ thể không giải quyết được tận gốc lớp lỗ hổng: mô hình phải xử lý nội dung do kẻ tấn công kiểm soát để quyết định xem nó có độc hại hay không, vì vậy "nội dung đang được kiểm tra tham gia trực tiếp vào quá trình kiểm tra."
Microsoft cũng đưa ra một quan điểm tương tự trong một bài đăng vào tháng 6 về bộ nhớ AI, viết rằng "Chỉ riêng việc sử dụng prompt không phải là một ranh giới bảo mật đáng tin cậy" và việc truy cập và cô lập bộ nhớ nên được kiểm soát bởi các hệ thống xác định (deterministic systems) thay vì các hướng dẫn của mô hình.