Ba nhà nghiên cứu tại công ty bảo mật Hacktron đã sử dụng Claude Opus 5 của Anthropic để liên kết hai lỗ hổng và chiếm quyền điều khiển tài khoản ChatGPT và Codex của một số nhân viên OpenAI, từ đó tiếp cận kho mã nguồn nội bộ của công ty.
Chuỗi khai thác bắt đầu từ một lỗi trong phần mềm vận hành diễn đàn hỗ trợ công khai của OpenAI và đi qua một điểm yếu trong hệ thống đăng nhập của chính OpenAI.
Đây là một cuộc nghiên cứu bảo mật, không phải một cuộc tấn công thực tế: nhóm nghiên cứu đã báo cáo các lỗ hổng cho OpenAI, chứng minh quyền truy cập bằng một pull request vô hại và sau đó dừng lại. Theo ghi nhận ban đầu, việc truy cập nội bộ đó chỉ mất chưa đầy 72 giờ.
OpenAI đã xác nhận bản vá khoảng 14 giờ sau báo cáo, theo Hacktron, và vào ngày 1 tháng 9 đã trả cho nhóm khoản tiền thưởng bug bounty trị giá $6,500. OpenAI cho biết giải thưởng này
"ghi nhận phát hiện phía OpenAI, không phải các hành động chống lại Discourse"phần mềm mã nguồn mở chạy diễn đàn. Việc kiểm tra chính diễn đàn nằm ngoài chương trình bug bounty của họ.
OpenAI chưa mô tả công khai lỗi đăng nhập và họ xác nhận phát hiện này thông qua bản vá và khoản thanh toán thay vì chi tiết hóa các vụ chiếm đoạt tài khoản.
Hacktron, đơn vị tự mô tả mình là một công ty nghiên cứu bảo mật hỗ trợ bởi AI, đã rất thận trọng về những gì họ đã làm. Khi một liên kết Codex của nhân viên tới mã nguồn của OpenAI trên GitHub được mở, nó đã kích hoạt một pull request duy nhất trong kho lưu trữ nội bộ. Nhóm không đọc bất kỳ mã nguồn nào, không merge hay triển khai bất cứ thứ gì, cũng như không chạm vào dữ liệu khách hàng.
Những gì chuỗi khai thác có thể tiếp cận còn lớn hơn nhiều. Vì nhân viên kết nối các dịch vụ khác với ChatGPT và Codex, nhóm nghiên cứu cho biết quyền truy cập tương tự về mặt lý thuyết có thể mở rộng sang các công cụ như GitHub, Slack và email. Phạm vi tiếp cận rộng hơn đó là khả thi, nhưng đã không được thực hiện.
Tại sao lỗi diễn đàn lại tiếp cận được tài khoản nhân viên
Lý do khiến một lỗi trên diễn đàn công khai có thể tiếp cận tài khoản nhân viên nằm ở hệ thống đăng nhập của OpenAI, chứ không phải ở phần mềm diễn đàn. Diễn đàn của OpenAI cung cấp tùy chọn "Sign in with OpenAI", cùng một hệ thống single sign-on (SSO) mà nhân viên sử dụng ở những nơi khác.
Khi các nhà nghiên cứu kiểm soát được máy chủ diễn đàn, thông tin đăng nhập dùng chung đã cho phép họ chiếm đoạt tài khoản ChatGPT và Codex của các thành viên diễn đàn làm việc tại OpenAI. Các nạn nhân không cần phải thực hiện bất kỳ thao tác nào.
Hacktron cho biết đây là vấn đề về định danh (identity) của OpenAI, không phải lỗi trong phần mềm diễn đàn: bất kỳ dịch vụ bên thứ nhất hoặc thứ ba nào sử dụng cùng một hệ thống đăng nhập đều có thể cấp quyền truy cập tương tự.
Lối vào là một lỗi xử lý hình ảnh. Diễn đàn chạy trên Discourse, và Discourse chuyển các hình ảnh HEIC và HEIF được tải lên cho một công cụ gọi là ImageMagick, công cụ này sử dụng thư viện libheif để đọc chúng. Một lỗ hổng trong libheif cho phép một hình ảnh được tạo đặc biệt làm hỏng bộ nhớ của máy chủ diễn đàn.
Thông báo của Discourse đánh giá kết quả là remote code execution (RCE), đạt điểm 8.8/10 và được theo dõi với mã hiệu CVE-2026-32882. Tuy nhiên, hồ sơ công khai cho chính lỗ hổng này lại hẹp hơn. Trong thông báo của libheif và cơ sở dữ liệu lỗi quốc gia, CVE-2026-32882 được mô tả là lỗi out-of-bounds read có thể làm treo phần mềm hoặc rò rỉ bộ nhớ lân cận, thay vì là lỗi thực thi mã trực tiếp.
Phần bộ nhớ bị rò rỉ đó giúp vượt qua lớp bảo vệ phổ biến là ASLR. Các nhà nghiên cứu cho biết họ đã kết hợp các lỗi bộ nhớ của libheif, với sự trợ giúp của AI, để chuyển đổi vụ crash thành thực thi mã (code execution) hoạt động trên máy chủ diễn đàn. Lỗi này đã được sửa trong libheif 1.22.0 vào tháng 5 năm 2026.
Bản vá đó đã tồn tại nhiều tháng trước cuộc thử nghiệm. Tuy nhiên, image máy chủ của diễn đàn, được xây dựng trên bản phân phối Debian 12 Linux, vẫn sử dụng libheif cũ phiên bản 1.19.7 khi các nhà nghiên cứu kiểm tra vào tháng 7. Mặc dù bản vá và CVE đã công khai, Debian vẫn chưa đưa chúng vào phiên bản đóng gói mà diễn đàn sử dụng.
Nếu bạn tự vận hành máy chủ Discourse, điều này ảnh hưởng trực tiếp đến bạn. Hãy xây dựng lại (rebuild) trên image mới nhất để có libheif đã được vá, vì chỉ cập nhật giao diện web có thể không thay thế được thư viện hệ thống cũ. Các trang web do Discourse lưu trữ trực tiếp đã được vá, và các phiên bản tự lưu trữ đã khắc phục lỗi là 2026.7.0, 2026.6.1, 2026.5.2 và 2026.1.6.
Cách các nhà nghiên cứu sử dụng AI
Các nhà nghiên cứu đã sử dụng AI để giải quyết phần khó khăn nhất. Đầu tiên họ thử Claude Opus 4.8, nhưng mô hình này gặp khó khăn trong việc xây dựng một bản exploit hoạt động khi lớp bảo vệ bộ nhớ ASLR được kích hoạt.
Anthropic phát hành mô hình tiếp theo, Claude Opus 5, vào tối ngày 24 tháng 7. Trong một phiên làm việc mới, nó đã tạo ra một bản exploit hoạt động chỉ trong vài giờ.
Opus 5 được trang bị các biện pháp an toàn nhằm ngăn chặn việc viết mã exploit cho các mục tiêu thực tế. Các nhà nghiên cứu đã vượt qua chúng bằng cách hướng mô hình vào máy chủ thử nghiệm của riêng họ, được ngụy trang dưới dạng mục tiêu thực hành capture-the-flag (CTF), sau đó để nó chạy trong một vòng lặp tự động. Mặc dù vậy, họ nhấn mạnh rằng công việc này không hoàn toàn tự động: sự chỉ đạo của con người có kỹ năng vẫn rất quan trọng.
Trường hợp này phản ánh xu hướng mà các chuyên gia bảo mật và công ty AI đã cảnh báo: các mô hình AI có năng lực đang cắt giảm đáng kể thời gian và kỹ năng cần thiết cho các hoạt động tấn công mạng nghiêm túc. Anthropic đã báo cáo rằng các nhóm tội phạm và các nhóm được nhà nước bảo trợ đang sử dụng các mô hình Claude để thực hiện các cuộc xâm nhập thực sự.
OpenAI chỉ là một mục tiêu trong một dự án rộng lớn hơn mang tên HEIF Heist. Trong khoảng hai tháng, nhóm nghiên cứu cho biết họ đã tìm thấy cùng một loại lỗi giải mã hình ảnh trong phần mềm của nhiều tập đoàn lớn khác, với tổng chi phí sử dụng AI chưa đến $3,000. Họ liên kết chiến dịch này với các lỗi được báo cáo trong Slack, Meta, GitHub Enterprise và các framework như Next.js.
Tuy nhiên, các tuyên bố rộng hơn này chưa được xác nhận đồng đều. Lỗi Next.js đã được xác nhận bởi Vercel, và các nhà phát triển libheif đã xác nhận một bản exploit RCE cho lỗi liên quan đến Meta. Nhưng tuyên bố về việc thực thi mã trên quy mô lớn ở nhiều ứng dụng khác vẫn chưa được xác nhận độc lập.
Chiến dịch rộng hơn này đã sử dụng một mô hình khác là GPT-5.6 Sol của chính OpenAI cho các trường hợp nhóm nghiên cứu không biết gì về mục tiêu trước đó. Theo các nhà nghiên cứu, chỉ có Shopify dường như đã nhận ra hoạt động bất thường, dù bộ xử lý hình ảnh của họ liên tục bị treo dưới hàng nghìn lần tải lên thử nghiệm.
Những hành động cần thực hiện
Bài học rút ra vượt ra ngoài khuôn khổ của Discourse. Nếu dịch vụ của bạn chấp nhận hình ảnh từ người dùng và sử dụng libheif để xử lý các tệp HEIC, HEIF hoặc AVIF, các bản build cũ có thể đang gặp nguy hiểm.
Ngoài ra, nếu một dịch vụ công cộng, có độ tin cậy thấp chia sẻ cùng hệ thống SSO với các công cụ nội bộ, một lỗ hổng trên dịch vụ đó có thể trở thành "bàn đạp" để xâm nhập toàn bộ hệ thống.
- Cập nhật libheif lên phiên bản bảo mật mới nhất (hiện là 1.23.4 tính đến tháng 9/2026) hoặc sử dụng bản build đã được vá từ bản phân phối Linux của bạn.
- Tắt tính năng giải mã các định dạng hình ảnh HEIF và AVIF từ nguồn không tin cậy nếu không thực sự cần thiết, hoặc chạy quá trình xử lý hình ảnh trong một sandbox bị cô lập hoàn toàn.
- Giới hạn các dịch vụ mà hệ thống SSO tin cậy và yêu cầu xác thực lại (re-authentication) trước khi thực hiện các hành động nhạy cảm thay vì chỉ dựa vào phiên làm việc (session) hiện có.
Hiện tại không có dấu hiệu nào cho thấy lỗ hổng của OpenAI đã bị khai thác bởi các tác nhân độc hại trong thực tế. Tính đến giữa tháng 9 năm 2026, nó không nằm trong danh sách các lỗ hổng bị khai thác đã biết của chính phủ Hoa Kỳ.