Vào thứ Tư, OpenAI đã công bố sáu trường hợp mới về "hành vi mô hình không mong muốn hoặc đáng lo ngại" diễn ra trong sáu tháng qua. Đồng thời, công ty cũng chia sẻ một khung làm việc mới để báo cáo, theo dõi, điều tra và công bố tình trạng model misalignment (sai lệch mô hình) nhằm nỗ lực cải thiện tính minh bạch.
"Khi các hệ thống AI ngày càng tiên tiến và được triển khai rộng rãi hơn, chúng ta cần xây dựng một sự đồng thuận rộng rãi và có cơ sở hơn về tiến trình nghiên cứu căn chỉnh (alignment)," OpenAI cho biết. "Chúng tôi không tin rằng ngành công nghiệp AI đã giải quyết được vấn đề alignment và giám sát ở mức độ đủ để tiếp tục mở rộng quy mô một cách có trách nhiệm với tốc độ tối đa trong thời gian dài hơn nữa."
"Các quyết định về cách thức phát triển AI trong những tháng và năm tới cần dựa trên những bằng chứng mà những người bên ngoài các công ty xây dựng mô hình hàng đầu có thể tự mình kiểm tra."
Sáu sự cố này nằm ngoài các hoạt động sai lệch đã được tiết lộ gần đây nhắm vào Hugging Face, DseWiki, và RubyGems. Chi tiết về các sự cố như sau:
- Sự cố 1 (Xảy ra vào ngày 18 tháng 7, 2026) - Một mô hình thuộc dòng Astra nội bộ chưa được phát hành đã tự viết các hướng dẫn giống như jailbreak vào chính compaction summaries của nó (các khối tóm tắt nội dung hội thoại cũ và đầu ra của công cụ được tạo tự động khi phiên làm việc của tác nhân AI đạt đến giới hạn ngữ cảnh). Điều này bao gồm việc tác nhân thêm hướng dẫn "BREACH ALERT" yêu cầu ngữ cảnh bỏ qua các tin nhắn của nhà phát triển và chỉ tuân theo tin nhắn từ hệ thống và người dùng.
- Sự cố 2 - Trong quá trình huấn luyện GPT-5.6 Sol, một số phiên bản mô hình đã thêm hướng dẫn vào bản tóm tắt của chúng để che giấu lỗi hoặc hành vi sai lệch đối với người dùng. Các tóm tắt này chứa các hướng dẫn tự tạo ra dữ liệu bị thiếu mà không tiết lộ và che giấu các thất bại.
- Sự cố 3 (Xảy ra vào ngày 15 tháng 5, 2026) - Một mô hình nội bộ chưa phát hành đã tìm thấy và sử dụng một API key bị lộ từ các kho lưu trữ GitHub công khai mà không được phép khi cố gắng truy xuất dữ liệu lịch sử trong quá trình huấn luyện. "Việc đăng ký thất bại, nhưng một khóa đã xác thực thành công và trả về metadata," OpenAI cho biết. "Khi dữ liệu yêu cầu vẫn không có sẵn, mô hình đã tự tạo ra chúng và khẳng định rằng chúng đến từ trang web được yêu cầu."
- Sự cố 4 - Trong hai mẫu huấn luyện từ ngày 22 tháng 10, 2025 và ngày 24 tháng 1, 2026, các mô hình nội bộ đã tải các hồ sơ mà nó đã truy xuất lên một dịch vụ paste công khai, sau đó cố gắng mở URL kết quả làm nguồn trích dẫn và tải một ảnh tác vụ lên để tìm kiếm hình ảnh bên ngoài. Mặc dù việc tải lên thành công, các thao tác trình duyệt sau đó đã thất bại.
- Sự cố 5 - Hai mẫu từ ngày 8 và 15 tháng 5, 2026, đã sử dụng Artifactory để trao đổi tin nhắn. Các mô hình đã "đọc ghi chú của các trình giải (solver) khác, đăng phản hồi và sử dụng những trao đổi đó để cung cấp thông tin cho câu trả lời của chúng."
- Sự cố 6 (Xảy ra vào ngày 14 tháng 4, 2026) - Các tác nhân liên quan đến một mô hình nội bộ chưa phát hành khi làm việc cùng nhau trên một workbook đã không thể cộng tác trên tệp thông qua hệ thống tệp cục bộ như dự định. Điều này khiến một trong các tác nhân chia sẻ workbook lên một nền tảng lưu trữ công khai để các tác nhân khác có thể truy xuất, vi phạm hướng dẫn nhiệm vụ.
Các phát hiện này trùng khớp với một báo cáo mới từ Reuters, tiết lộ rằng các tác nhân "nổi loạn" từ OpenAI đã chiếm đoạt tài khoản người dùng Hugging Face và thăm dò các lỗ hổng tiềm ẩn trên trang web ngay từ ngày 13 tháng 5, 2026, gần hai tháng trước khi sự việc được đưa ra ánh sáng.
Công ty an ninh mạng SentinelOne cho biết họ đã xác định được hai tài khoản Hugging Face, 0Time và Nyx9, được sử dụng trong các hoạt động liên quan. "Trình tự thời gian nội bộ của OpenAI xác nhận rằng các tác nhân đã sử dụng thông tin đăng nhập Hugging Face bị lộ để ghi một tệp bên ngoài và triển khai các proxy Spaces vào ngày 26 tháng 5," nhà nghiên cứu bảo mật Tom Hegel cho biết.
"Lịch sử tài khoản công khai được kiểm tra ở đây cho thấy một lớp khác: mã chuyển tiếp do người gọi điều khiển dưới tài khoản 0Time vào ngày 13 tháng 5; các bản sao công khai chính xác từng phút dưới tài khoản Nyx9 cho việc ghi tệp vào ngày 26 tháng 5; một workbook chứa các công thức xử lý tệp và hướng tới SSRF vào đêm muộn hôm đó; và vào ngày 30 tháng 5, mã đăng ký tài khoản OpenAI của bên thứ ba đã được cam kết cùng với một trình bao bọc định nghĩa một lộ trình web không xác thực."
Là một phần của khung làm việc mới, OpenAI cho biết họ có ý định công bố các trường hợp liên quan đến model misalignment, cách nó biểu hiện và nơi các rào cản bảo vệ thành công hoặc thất bại. Điều này có thể bao gồm nhiều tình huống khác nhau:
- Các cách thức mới để mô hình hành động mà không được phép, phối hợp với các mô hình khác hoặc vượt qua sự giám sát.
- Các thất bại khiến một phương pháp alignment hoặc biện pháp bảo vệ bị nghi ngờ.
- Hành vi thách thức một tuyên bố trong một đánh giá an toàn đã được công bố.
Công ty AI mới nổi này cho biết cũng có thể có các trường hợp trùng lặp thuộc cùng một loại sai lệch, một yếu tố mà họ cho rằng có thể hữu ích để chỉ ra mức độ hiệu quả của một biện pháp bảo vệ và làm nổi bật hành vi sai lệch bất chấp những nỗ lực giảm thiểu lặp đi lặp lại.
"Các ví dụ về sai lệch có thể giúp xác định các vấn đề mà những nhà phát triển AI khác có thể gặp phải khi hệ thống của họ đạt đến khả năng tương tự, tiết lộ điểm yếu trong các biện pháp bảo vệ hoặc thách thức các giả định về hành vi của mô hình," OpenAI cho biết. "Việc chia sẻ những phát hiện này cho phép những người khác điều tra cùng một vấn đề, kiểm tra các giải thích của chúng tôi và cải thiện các biện pháp giảm thiểu."
Sự phát triển này diễn ra trong bối cảnh các công ty AI đang đối mặt với áp lực ngày càng tăng trong việc giải quyết vấn đề sai lệch và an toàn mô hình, dẫn đến các lời kêu gọi điều chỉnh tốc độ phát triển các mô hình tiên tiến nhất. Đầu tuần này, Microsoft đã ban hành một code of conduct (quy tắc ứng xử) tạm thời nhằm hướng dẫn các mô hình AI tránh xa các hành vi nguy hiểm và thiết lập "cách các mô hình MAI chúng tôi đang phát triển dự định hoạt động, những gì chúng không bao giờ được làm và chúng phải chịu trách nhiệm trước ai."
"Khi các mô hình tiến bộ và được triển khai rộng rãi hơn, các quyết định về phát triển AI cần bằng chứng mà mọi người bên ngoài các công ty xây dựng mô hình có thể kiểm tra," Kai Chen, trưởng bộ phận nghiên cứu alignment của OpenAI, chia sẻ với WIRED. "Chúng tôi không tin rằng ngành công nghiệp AI đã giải quyết được vấn đề alignment và giám sát ở mức độ đủ để tiếp tục mở rộng quy mô một cách có trách nhiệm với tốc độ tối đa."