Ba nhà nghiên cứu tại công ty bảo mật Hacktron đã sử dụng Claude Opus 5 của Anthropic để kết hợp hai lỗ hổng, chiếm quyền điều khiển tài khoản ChatGPT và Codex của nhiều nhân viên OpenAI, từ đó truy cập vào kho lưu trữ mã nguồn nội bộ của OpenAI.
Chuỗi tấn công bắt đầu từ một lỗi trong phần mềm vận hành diễn đàn hỗ trợ công cộng của OpenAI và tiến tới điểm yếu trong hệ thống đăng nhập riêng của OpenAI.
Đây là một nghiên cứu bảo mật, không phải một cuộc tấn công thực tế: nhóm nghiên cứu đã báo cáo các lỗ hổng cho OpenAI, chứng minh quyền truy cập bằng một pull request vô hại và sau đó dừng lại. Từ cái nhìn đầu tiên, việc truy cập nội bộ đó mất chưa đầy 72 giờ.
OpenAI đã xác nhận bản vá khoảng 14 giờ sau báo cáo, theo Hacktron, và vào ngày 1 tháng 9 đã trả cho nhóm nghiên cứu khoản tiền thưởng lỗi (bounty) trị giá 6.500 USD. OpenAI cho biết giải thưởng này "ghi nhận phát hiện phía OpenAI, chứ không phải các hành động chống lại Discourse," phần mềm mã nguồn mở vận hành diễn đàn. Việc kiểm tra chính diễn đàn nằm ngoài chương trình bug bounty của họ.
OpenAI chưa mô tả công khai về lỗi đăng nhập và họ đã xác nhận phát hiện này thông qua bản vá và thanh toán thay vì chi tiết hóa các vụ chiếm quyền điều khiển tài khoản.
Hacktron, công ty tự mô tả mình là một công ty nghiên cứu bảo mật được hỗ trợ bởi AI, đã rất cẩn thận về những gì họ đã làm và không làm. Khi một liên kết Codex của một nhân viên tới mã của OpenAI trên GitHub được mở, nó đã kích hoạt một pull request duy nhất trong kho lưu trữ nội bộ. Họ đã không đọc bất kỳ mã nguồn nào, không merge hay ship bất cứ thứ gì, cũng như không chạm vào dữ liệu khách hàng.
Những gì chuỗi tấn công này có thể tiếp cận còn lớn hơn nhiều. Vì nhân viên kết nối các dịch vụ khác với ChatGPT và Codex, nhóm nghiên cứu cho biết quyền truy cập tương tự về lý thuyết có thể mở rộng sang các công cụ như GitHub, Slack và email. Phạm vi tiếp cận rộng hơn đó là khả thi, nhưng đã không được thực hiện.
Tại sao lỗi diễn đàn lại ảnh hưởng đến tài khoản nhân viên
Lý do một lỗi trong diễn đàn công cộng có thể tiếp cận tài khoản nhân viên nằm ở hệ thống đăng nhập của OpenAI, chứ không phải ở phần mềm diễn đàn. Diễn đàn của OpenAI cung cấp tùy chọn "Sign in with OpenAI", cùng một hệ thống đăng nhập một lần (SSO) mà nhân viên sử dụng ở những nơi khác.
Khi các nhà nghiên cứu kiểm soát được máy chủ diễn đàn, thông tin đăng nhập dùng chung đã cho phép họ chiếm quyền điều khiển tài khoản ChatGPT và Codex của các thành viên diễn đàn làm việc tại OpenAI. Các nạn nhân không cần phải thực hiện bất kỳ hành động nào.
Hacktron cho biết đây là vấn đề về định danh của OpenAI, không phải lỗi trong phần mềm diễn đàn: bất kỳ dịch vụ bên thứ nhất hoặc thứ ba nào sử dụng cùng một hệ thống đăng nhập đều có thể cấp quyền truy cập tương tự.
Lối vào là một lỗi xử lý hình ảnh. Diễn đàn chạy trên Discourse, và Discourse chuyển các hình ảnh HEIC và HEIF đã tải lên cho một công cụ gọi là ImageMagick, công cụ này sử dụng thư viện libheif để đọc chúng. Một lỗi trong libheif cho phép một hình ảnh được tạo đặc biệt làm hỏng bộ nhớ của máy chủ diễn đàn.
Cố vấn bảo mật của Discourse đánh giá kết quả là remote code execution, đạt điểm 8.8/10 và theo dõi dưới mã lỗi CVE-2026-32882. Hồ sơ công khai cho chính lỗ hổng này thì hẹp hơn. Trong cố vấn của chính libheif và trong các cơ sở dữ liệu lỗ hổng quốc gia, CVE-2026-32882 là một lỗi out-of-bounds read có thể làm treo phần mềm hoặc rò rỉ bộ nhớ lân cận, không phải là một lỗi thực thi mã trực tiếp.
Bộ nhớ bị rò rỉ đó giúp đánh bại một cơ chế bảo vệ phổ biến gọi là ASLR. Các nhà nghiên cứu cho biết họ đã kết hợp các lỗi bộ nhớ của libheif, với sự trợ giúp của AI, để biến lỗi crash thành thực thi mã (code execution) hoạt động trên máy chủ diễn đàn. Ở phía thượng nguồn, lỗi này đã được vá trong libheif 1.22.0 vào tháng 5 năm 2026.
Bản vá đó đã tồn tại nhiều tháng trước khi thử nghiệm. Nhưng image máy chủ của diễn đàn, được xây dựng trên bản phân phối Linux Debian 12, vẫn xuất xưởng phiên bản libheif cũ, chưa được vá (phiên bản 1.19.7) khi các nhà nghiên cứu kiểm tra vào tháng 7. Bản vá và CVE của nó đã được công khai, nhưng Debian vẫn chưa đưa chúng vào phiên bản đóng gói mà diễn đàn sử dụng.
Nếu bạn vận hành máy chủ Discourse riêng, phần này ảnh hưởng trực tiếp đến bạn. Hãy rebuild dựa trên image mới nhất để có bản libheif đã được vá, vì chỉ cập nhật giao diện web có thể không thay thế được thư viện cũ. Các trang web do Discourse lưu trữ (hosted) đã được vá, và các bản phát hành tự lưu trữ (self-hosted) đã sửa lỗi là 2026.7.0, 2026.6.1, 2026.5.2 và 2026.1.6.
Các nhà nghiên cứu đã sử dụng AI như thế nào
Các nhà nghiên cứu đã sử dụng AI để thực hiện phần khó nhất. Đầu tiên họ thử nghiệm với Claude Opus 4.8, model này đã gặp khó khăn qua nhiều phiên làm việc để xây dựng một bản exploit hoạt động sau khi lớp phòng vệ bộ nhớ tiêu chuẩn ASLR được kích hoạt.
Anthropic đã phát hành mô hình tiếp theo của mình, Claude Opus 5, vào tối ngày 24 tháng 7, và trong một phiên làm việc mới, nó đã tạo ra một bản exploit hoạt động chỉ trong vòng vài giờ.
Opus 5 được xuất xưởng với các biện pháp bảo vệ nhằm ngăn nó viết mã exploit cho các mục tiêu thực tế. Các nhà nghiên cứu đã vượt qua chúng bằng cách hướng mô hình vào máy chủ thử nghiệm của riêng họ, được ngụy trang thành mục tiêu thực hành capture-the-flag, sau đó để nó chạy trong một vòng lặp tự động. Mặc dù vậy, họ nói rằng công việc này không hoàn toàn tự động: sự chỉ đạo kỹ năng của con người vẫn đóng vai trò quan trọng, và đây không phải là hành vi hack tự động mà không có ai điều khiển.
Trường hợp này phù hợp với những gì các nhà nghiên cứu và các công ty AI đã mô tả trong năm nay: các mô hình AI có năng lực đang cắt giảm đáng kể thời gian và kỹ năng mà các công việc tấn công nghiêm túc từng đòi hỏi. Anthropic đã báo cáo rằng các nhóm tội phạm và các nhóm được nhà nước hậu thuẫn đã sử dụng các mô hình Claude của họ để thực hiện các cuộc xâm nhập thực tế, không chỉ để trả lời câu hỏi.
OpenAI là một mục tiêu trong một dự án rộng lớn hơn mà Hacktron gọi là HEIF Heist. Trong khoảng hai tháng, nhóm nghiên cứu cho biết họ đã tìm thấy cùng một loại lỗi giải mã hình ảnh trong phần mềm được sử dụng bởi các công ty lớn khác, với tổng chi phí chưa đến 3.000 USD sử dụng AI. Họ liên kết chiến dịch này với các lỗi được báo cáo trong Slack, các sản phẩm của Meta, GitHub Enterprise và các web framework như Next.js.
Những tuyên bố rộng hơn đó được chứng minh không đồng đều. Lỗi Next.js đã được xác nhận trong cố vấn của chính Vercel, và những người duy trì libheif đã xác nhận một bản exploit thực thi mã hoạt động cho lỗi liên quan đến Meta. Tuyên bố rộng hơn về việc thực thi mã trên nhiều ứng dụng chưa được xác nhận độc lập.
Chiến dịch rộng lớn hơn đã sử dụng một mô hình khác, GPT-5.6 Sol của chính OpenAI, cho các trường hợp mà nhóm nghiên cứu không biết gì trước về mục tiêu. Chỉ có một công ty, Shopify, dường như đã nhận thấy hoạt động này, các nhà nghiên cứu nói, mặc dù các bộ xử lý hình ảnh của nó bị treo liên tục dưới hàng nghìn lần tải lên thử nghiệm.
Các biện pháp cần thực hiện
Những bài học lớn hơn vượt ra ngoài Discourse. Nếu dịch vụ của bạn chấp nhận hình ảnh người dùng và đọc các tệp HEIC, HEIF hoặc AVIF thông qua libheif, một bản build cũ có thể bị phơi nhiễm.
Và nếu một dịch vụ công cộng, có độ tin cậy thấp hơn chia sẻ hệ thống đăng nhập một lần (SSO) với các công cụ nội bộ, một vụ xâm nhập vào dịch vụ đó có thể trở thành một vụ xâm nhập vào mọi nơi mà thông tin đăng nhập đó có thể tiếp cận.
- Cập nhật libheif lên bản phát hành bảo mật mới nhất (1.23.4 tính đến đầu tháng 9 năm 2026) hoặc lên bản build đã vá lỗi của bản phân phối của bạn.
- Ở những nơi không cần thiết, hãy tắt tính năng giải mã các hình ảnh HEIF và AVIF không tin cậy, hoặc chạy xử lý hình ảnh bên trong một sandbox được khóa chặt.
- Hạn chế những dịch vụ mà hệ thống đăng nhập một lần của bạn tin tưởng và yêu cầu kiểm tra danh tính mới trước các hành động nhạy cảm thay vì tin tưởng vào một phiên làm việc hiện có.
Không có dấu hiệu cho thấy lỗi của OpenAI đã được sử dụng để chống lại bất kỳ ai trong thế giới thực. Tính đến giữa tháng 9 năm 2026, nó không nằm trong danh sách các lỗ hổng đã biết bị khai thác của chính phủ Hoa Kỳ, mặc dù danh sách đó không phải là bằng chứng tuyệt đối cho cả hai phía.
Những gì các báo cáo hiện có không giải quyết được là liệu một tổ chức đã vá lỗi có nên kiểm tra các lần truy cập trước đó hay không; về điểm này, các nguồn tin đều im lặng.