Ba nhà nghiên cứu tại công ty bảo mật Hacktron đã sử dụng Claude Opus 5 của Anthropic để liên kết hai lỗ hổng và chiếm quyền điều khiển tài khoản ChatGPT và Codex của nhiều nhân viên OpenAI, từ đó truy cập vào một repository mã nguồn nội bộ của OpenAI.
Chuỗi khai thác bắt đầu bằng một lỗi trong phần mềm vận hành diễn đàn trợ giúp công khai của OpenAI và tiếp tục thông qua một điểm yếu trong hệ thống đăng nhập của chính OpenAI.
Đây là một cuộc nghiên cứu bảo mật, không phải là một cuộc tấn công thực tế: nhóm đã báo cáo các lỗ hổng cho OpenAI, chứng minh quyền truy cập bằng một pull request vô hại và sau đó dừng lại. Theo đánh giá ban đầu, quá trình truy cập nội bộ này mất chưa đầy 72 giờ.
Theo Hacktron, OpenAI đã xác nhận bản vá khoảng 14 giờ sau báo cáo và vào ngày 1 tháng 9 đã trả cho nhóm khoản tiền thưởng bug bounty trị giá 6.500 USD. OpenAI cho biết giải thưởng này "ghi nhận phát hiện phía OpenAI, không phải các hành động chống lại Discourse," phần mềm mã nguồn mở vận hành diễn đàn. Việc thử nghiệm trên chính diễn đàn nằm ngoài chương trình bug bounty của họ.
OpenAI chưa mô tả công khai về lỗi đăng nhập và họ xác nhận phát hiện này thông qua bản vá và khoản thanh toán thay vì cung cấp chi tiết về các vụ chiếm đoạt tài khoản.
Hacktron, tự mô tả mình là một công ty nghiên cứu bảo mật được hỗ trợ bởi AI, đã rất cẩn thận về những gì họ đã làm. Khi một liên kết Codex của nhân viên dẫn đến mã nguồn OpenAI trên GitHub được mở, nó chỉ kích hoạt một pull request duy nhất trong repository nội bộ. Họ đã không đọc bất kỳ mã nguồn nào, không merge hay triển khai bất cứ thứ gì, cũng như không chạm vào dữ liệu khách hàng.
Tầm ảnh hưởng mà chuỗi khai thác này có thể đạt tới còn lớn hơn nhiều. Vì nhân viên kết nối các dịch vụ khác với ChatGPT và Codex, nhóm nghiên cứu cho biết về lý thuyết, quyền truy cập tương tự có thể mở rộng sang các công cụ như GitHub, Slack và email. Tuy nhiên, khả năng tiếp cận rộng hơn đó đã không được thực hiện.
Tại sao lỗi diễn đàn lại ảnh hưởng đến tài khoản nhân viên
Lý do một lỗi trên diễn đàn công cộng có thể tiếp cận tài khoản nhân viên nằm ở hệ thống đăng nhập của OpenAI, chứ không phải trong phần mềm diễn đàn. Diễn đàn của OpenAI cung cấp tùy chọn "Sign in with OpenAI", cùng một hệ thống single sign-on (SSO) mà nhân viên sử dụng ở những nơi khác.
Sau khi các nhà nghiên cứu kiểm soát được máy chủ diễn đàn, hệ thống đăng nhập dùng chung đã cho phép họ chiếm quyền điều khiển tài khoản ChatGPT và Codex của các thành viên diễn đàn là nhân viên OpenAI. Các nạn nhân không cần phải thực hiện bất kỳ thao tác nào.
Hacktron cho biết đây là một vấn đề về danh tính của OpenAI, không phải lỗi trong phần mềm diễn đàn: bất kỳ dịch vụ bên thứ nhất hoặc thứ ba nào sử dụng cùng một hệ thống đăng nhập đều có thể cấp quyền truy cập tương tự.
Điểm xâm nhập là một lỗi hình ảnh. Diễn đàn chạy trên Discourse, và Discourse chuyển các hình ảnh HEIC và HEIF được tải lên cho một công cụ gọi là ImageMagick, công cụ này sử dụng thư viện libheif để đọc chúng. Một lỗi trong libheif đã cho phép một hình ảnh được tạo đặc biệt làm hỏng bộ nhớ của máy chủ diễn đàn.
Cố vấn của Discourse đánh giá kết quả là remote code execution, đạt điểm 8.8/10 và được theo dõi mã định danh là CVE-2026-32882. Hồ sơ công khai về chính lỗ hổng này thì hẹp hơn. Trong cố vấn của chính libheif và trong các cơ sở dữ liệu lỗ hổng quốc gia, CVE-2026-32882 là một lỗi out-of-bounds read có thể làm sập phần mềm hoặc rò rỉ bộ nhớ lân cận, không phải là một lỗi thực thi mã trực tiếp.
Bộ nhớ bị rò rỉ đó giúp đánh bại một lớp bảo vệ phổ biến gọi là ASLR. Các nhà nghiên cứu cho biết họ đã kết hợp các lỗi bộ nhớ của libheif, với sự trợ giúp của AI, để biến việc làm sập phần mềm thành thực thi mã (code execution) hoạt động trên máy chủ diễn đàn. Lỗ hổng đã được sửa trong libheif 1.22.0 vào tháng 5 năm 2026.
Bản vá đó đã tồn tại nhiều tháng trước khi thử nghiệm. Nhưng hình ảnh máy chủ của diễn đàn, được xây dựng trên bản phân phối Linux Debian 12, vẫn cài đặt phiên bản libheif cũ chưa được vá (1.19.7) khi các nhà nghiên cứu kiểm tra vào tháng 7. Bản vá và mã CVE đã được công khai, nhưng Debian vẫn chưa đưa chúng vào phiên bản đóng gói mà diễn đàn sử dụng.
Nếu bạn vận hành máy chủ Discourse riêng, phần này ảnh hưởng trực tiếp đến bạn. Hãy xây dựng lại trên hình ảnh (image) mới nhất để có libheif đã được vá, vì chỉ cập nhật giao diện web có thể không thay thế được thư viện cũ. Các trang web được lưu trữ bởi Discourse đã được vá, và các bản phát hành tự lưu trữ (self-hosted) đã sửa lỗi là 2026.7.0, 2026.6.1, 2026.5.2 và 2026.1.6.
Cách các nhà nghiên cứu sử dụng AI
Các nhà nghiên cứu đã sử dụng AI để thực hiện phần khó nhất. Đầu tiên họ thử Claude Opus 4.8, model này đã gặp khó khăn qua nhiều phiên làm việc để xây dựng một exploit hoạt động sau khi lớp bảo vệ bộ nhớ tiêu chuẩn ASLR được kích hoạt.
Anthropic đã phát hành mô hình tiếp theo, Claude Opus 5, vào tối ngày 24 tháng 7, và trong một phiên làm việc mới, nó đã tạo ra một exploit hoạt động chỉ trong vài giờ.
Opus 5 đi kèm với các rào cản an toàn nhằm ngăn chặn nó viết mã exploit cho các mục tiêu thực tế. Các nhà nghiên cứu đã vượt qua chúng bằng cách hướng mô hình vào máy chủ thử nghiệm của riêng họ, được ngụy trang thành một mục tiêu thực hành capture-the-flag, sau đó để nó chạy trong một vòng lặp tự động. Mặc dù vậy, họ nói rằng công việc không hoàn toàn tự động: sự chỉ đạo có kỹ năng của con người vẫn đóng vai trò quan trọng.
Trường hợp này phù hợp với những gì các nhà nghiên cứu và các công ty AI đã mô tả trong năm nay: các mô hình AI có khả năng đang cắt giảm mạnh thời gian và kỹ năng mà các công việc tấn công nghiêm túc từng yêu cầu. Anthropic đã báo cáo rằng các nhóm tội phạm và các nhóm do nhà nước bảo trợ đã sử dụng các mô hình Claude của họ để thực hiện các vụ xâm nhập thực tế, chứ không chỉ để trả lời câu hỏi.
OpenAI chỉ là một mục tiêu trong một dự án rộng lớn hơn mà Hacktron gọi là HEIF Heist. Trong khoảng hai tháng, nhóm cho biết họ đã tìm thấy cùng một loại lỗi giải mã hình ảnh trong phần mềm được sử dụng bởi các công ty lớn khác, với tổng chi phí chưa đến 3.000 USD sử dụng AI. Họ liên kết chiến dịch này với các lỗi được báo cáo trong Slack, các sản phẩm của Meta, GitHub Enterprise và các web framework như Next.js.
Những tuyên bố rộng hơn đó được chứng minh không đồng đều. Lỗi Next.js đã được xác nhận trong cố vấn của chính Vercel, và những người duy trì libheif đã xác nhận một exploit thực thi mã hoạt động cho lỗi liên quan đến Meta. Tuy nhiên, tuyên bố rộng hơn về việc thực thi mã trên nhiều ứng dụng vẫn chưa được xác nhận độc lập.
Chiến dịch rộng lớn này đã sử dụng một mô hình khác, GPT-5.6 Sol của chính OpenAI, cho những trường hợp mà nhóm không biết gì trước về mục tiêu. Theo các nhà nghiên cứu, chỉ có một công ty là Shopify dường như đã nhận thấy hoạt động này, mặc dù các bộ xử lý hình ảnh của họ đã bị sập liên tục dưới hàng nghìn lượt tải lên thử nghiệm.
Những việc cần làm
Những bài học lớn hơn vượt ra ngoài phạm vi của Discourse. Nếu dịch vụ của bạn chấp nhận hình ảnh của người dùng và đọc các tệp HEIC, HEIF hoặc AVIF thông qua libheif, một bản build cũ có thể gặp nguy hiểm.
Và nếu một dịch vụ công cộng, có độ tin cậy thấp hơn chia sẻ hệ thống single sign-on với các công cụ nội bộ, thì một vụ xâm nhập vào dịch vụ đó có thể trở thành một vụ xâm nhập vào mọi nơi mà hệ thống đăng nhập đó tiếp cận.
- Cập nhật libheif lên bản phát hành bảo mật mới nhất (1.23.4 tính đến đầu tháng 9 năm 2026) hoặc bản build đã được vá của bản phân phối của bạn.
- Ở những nơi không cần thiết, hãy tắt tính năng giải mã các hình ảnh HEIF và AVIF không đáng tin cậy, hoặc chạy quá trình xử lý hình ảnh bên trong một sandbox được kiểm soát chặt chẽ.
- Giới hạn các dịch vụ mà hệ thống single sign-on của bạn tin tưởng và yêu cầu kiểm tra danh tính mới trước các hành động nhạy cảm thay vì tin tưởng vào một phiên làm việc hiện có.
Không có dấu hiệu nào cho thấy lỗ hổng OpenAI đã được sử dụng để chống lại bất kỳ ai trong thế giới thực. Tính đến giữa tháng 9 năm 2026, nó không nằm trong danh sách các lỗ hổng đã biết bị khai thác của chính phủ Hoa Kỳ.