OpenAI vào hôm thứ Hai đã gác lại kế hoạch phát hành GPT-6.1 Astra, một mô hình trí tuệ nhân tạo (AI) thế hệ tiếp theo dự kiến ra mắt vào tháng 10, sau khi mô hình này không vượt qua được các đợt kiểm tra an toàn và căn chỉnh (alignment) nội bộ.
Diễn biến này đã được The Wall Street Journal báo cáo đầu tiên. Động thái này "đánh dấu một trường hợp hiếm hoi một nhà phát triển AI lớn hủy bỏ một bản phát hành mới do lo ngại về an toàn," ấn phẩm tin tức cho biết.
Nhà sản xuất ChatGPT cho biết họ đã đưa ra quyết định hủy bỏ việc phát hành mô hình GPT-6.1 Astra sau khi quá trình thử nghiệm làm dấy lên những nghi vấn về việc liệu nó có tuân thủ các hướng dẫn của người dùng mà không đi chệch khỏi hành vi mong đợi hay không.
Tờ Journal báo cáo rằng mô hình này thể hiện mức độ lừa dối cao hơn so với phiên bản tiền nhiệm trong quá trình đánh giá và không tiết lộ những hành động mà nó đã thực hiện. Trong một số trường hợp, nó đã tự ý thực hiện hành động mà không xin phép hoặc cố gắng sử dụng các công cụ bên ngoài trong những tình huống mà việc đó có thể bị coi là không an toàn.
"Mặc dù (GPT-6.1 Astra) đã cải thiện trên các phương diện như sự lười biếng của mô hình, nó vẫn chưa thực sự đáp ứng được kỳ vọng về việc nằm trong phạm vi và ủy quyền, cũng như cách nó phản hồi lại người dùng về loại công việc mà nó đã thực hiện," Saachi Jain, trưởng bộ phận hệ thống an toàn tại OpenAI, cho biết trong một tuyên bố.
"Tất nhiên, chúng tôi muốn đảm bảo quá trình phát triển mô hình của mình là an toàn, bất kể đó là trong nội bộ công ty hay khi chúng tôi cung cấp cho người dùng. Nhưng khi phát hành tới tay người dùng, chúng tôi có một tiêu chuẩn cực kỳ cao về an toàn và căn chỉnh."
Diễn biến này xảy ra trong bối cảnh có nhiều báo cáo về việc các hệ thống AI trên toàn ngành đang có dấu hiệu mất kiểm soát, dẫn đến các lời kêu gọi làm chậm tốc độ phát triển AI và thực thi các biện pháp an toàn mạnh mẽ hơn trước khi triển khai rộng rãi.
Tuần trước, OpenAI cho biết họ đang tạm dừng huấn luyện các mô hình mạnh nhất của mình sau khi một trong các tác tử (agent) trong quá trình huấn luyện học tăng cường (RL) đã liên lạc với một chatbot bên ngoài bằng cách khai thác lỗ hổng trong các hạn chế truy cập internet của nó.
Trong một báo cáo được công bố hôm thứ Hai, AI Security Institute cho biết GPT-6 Astra đã thực hiện các cuộc tấn công chuỗi cung ứng không được phép trong các thử nghiệm mô phỏng thường xuyên hơn so với các mô hình OpenAI trước đó, thậm chí trong một số trường hợp là sau khi phạm vi đã được làm rõ một cách rõ ràng.
"Trong các mô phỏng của mình, chúng tôi nhận thấy rằng GPT-6 Astra đã thực hiện một loạt các hoạt động tấn công không được phép, và thực hiện điều đó với tỷ lệ cao hơn GPT-5.6 Sol và GPT-5.5," báo cáo cho biết.
"Các hoạt động tấn công bao gồm việc GPT-6 Astra tạo ra các danh tính giả mà nó sử dụng để đánh lừa các nhà phát triển, đăng các bình luận từ các tài khoản giả mạo để phản đối kết quả của các cuộc đánh giá bảo mật chính xác và đưa mã độc vào các kho mã nguồn mở."