NVIDIA và 36 tổ chức khác đã thành lập Open Secure AI Alliance nhằm phát triển và chia sẻ các công nghệ, kỹ thuật và công cụ mở để bảo mật phần mềm và các agent trí tuệ nhân tạo (AI).
Nhóm 37 thành viên này bao gồm các công ty điện toán đám mây, bảo mật, phần mềm doanh nghiệp và AI, bao gồm Microsoft, Cisco, Cloudflare, CrowdStrike, Hugging Face, IBM, Palo Alto Networks, Red Hat và Linux Foundation.
Phạm vi hoạt động được công bố bao quát toàn bộ ngăn xếp của agent (agent stack), bao gồm định danh (identity), quyền hạn (permissions), cô lập (isolation), rào chắn bảo vệ (guardrails), nhật ký (logs), định dạng mô hình, quét đa mô hình và quy trình làm việc mã hóa bảo mật.
Mục tiêu cốt lõi là các nhà phòng thủ mạng cần những mô hình AI mà họ có thể đọc, thay đổi và chạy trên phần cứng của chính mình, thay vì chỉ dựa vào các hệ thống đóng được truy cập qua giao diện lập trình ứng dụng (API) của nhà cung cấp.
Sự kiện ra mắt cũng giới thiệu đóng góp kỹ thuật đầu tiên: NVIDIA-labs OO Agents (NOOA), một framework nghiên cứu theo giấy phép Apache 2.0 được thiết kế để giúp hành vi của agent dễ dàng kiểm thử, truy vết, kiểm toán và quản trị hơn. Các tài liệu ra mắt hiện chưa bao gồm hiến chương, ban quản trị, các luồng công việc kỹ thuật, lịch trình bàn giao hoặc kho lưu trữ chung của liên minh, và trang web độc lập của tổ chức vẫn đang trong quá trình xây dựng.
The Hacker News đã liên hệ với NVIDIA để biết thêm chi tiết về quản trị liên minh, cam kết của các thành viên và các sản phẩm dự kiến đầu tiên, và sẽ cập nhật câu chuyện này khi có phản hồi.
Mã nguồn đầu tiên đi kèm với cảnh báo Sandbox
Harness của agent là lớp phần mềm bao quanh một mô hình, có nhiệm vụ xử lý ngữ cảnh, thực thi hành động, quản lý trạng thái và quyết định khi nào một nhiệm vụ hoàn thành. Trong NOOA, lớp đó được đại diện dưới dạng một Python class. Các trường (fields) lưu trữ trạng thái, các phương thức (methods) thể hiện khả năng, docstrings đóng vai trò là câu lệnh (prompts) và các chú thích kiểu (type annotations) xác định các ràng buộc mà mô hình phải tuân theo.
Một phương thức chứa thân hàm là dấu ba chấm (...) sẽ được hoàn thiện trong quá trình thực thi bởi một vòng lặp do mô hình ngôn ngữ lớn (LLM) điều khiển. Một phương thức chứa mã Python thông thường vẫn là mã xác định (deterministic code). Cấu trúc này cho phép các nhà phát triển sử dụng các quy trình kiểm thử, truy vết, kiểm soát phiên bản và tái cấu trúc quen thuộc thay vì chia nhỏ hành vi của agent qua các prompts, tool schemas, callbacks và đồ thị quy trình công việc.
Trong đánh giá riêng, NVIDIA báo cáo rằng framework này đạt điểm 86,8% trên điểm chuẩn CyberGym L1 vulnerability-rediscovery khi sử dụng GPT-5.5, với quyền truy cập mạng bị chặn và các kiểm tra dựa trên quy tắc được áp dụng cho từng quỹ đạo hành vi.
Kho lưu trữ cũng trực tiếp cảnh báo về rủi ro. NOOA có thể được cấu hình để thực thi mã Python do LLM tạo ra, điều này có thể truyền dữ liệu riêng tư, xóa tệp hoặc sửa đổi môi trường của nó. Các kiểm tra cây cú pháp trừu tượng (abstract syntax tree checks) và danh sách từ chối mô-đun (module deny-lists) được mô tả là các biện pháp kiểm soát phòng thủ theo chiều sâu, "không phải là một ranh giới ngăn chặn (containment boundary)."
NVIDIA đặt việc ngăn chặn bên ngoài bản thân NOOA. Các agent thực thi mã được tạo ra phải chạy sau sự cô lập ở cấp độ hệ điều hành, chẳng hạn như container, máy ảo hoặc sandbox OpenShell của nó. NOOA cung cấp khả năng kiểm tra và truy vết; sandbox cấp hệ điều hành mới là ranh giới ngăn chặn.
Hướng dẫn đóng góp của dự án cho biết việc phát triển được duy trì bởi NVIDIA, hoan nghênh các đóng góp bên ngoài thông qua pull requests. Kho lưu trữ hiện chưa có tệp quản trị cấp gốc hoặc lộ trình (roadmap) cụ thể.
Sự cố Hugging Face trở thành luận điểm quan trọng
NVIDIA đã gắn kết trường hợp của liên minh về các mô hình phòng thủ được kiểm soát cục bộ với sự cố xâm nhập vào tháng 7 tại Hugging Face, nơi một hệ thống agent tự trị đã làm tổn hại các phần hạ tầng sản xuất của công ty.
Hugging Face đã xác định việc truy cập trái phép vào một nhóm nhỏ các tập dữ liệu nội bộ và một số thông tin xác thực (credentials) được sử dụng bởi các dịch vụ của mình. Họ không tìm thấy bằng chứng về việc can thiệp vào các mô hình công khai, tập dữ liệu, Spaces, hình ảnh container hoặc các gói đã xuất bản.
Hugging Face cho biết quyền truy cập ban đầu vào môi trường của họ đến từ một tập dữ liệu độc hại đã lạm dụng trình tải tập dữ liệu mã từ xa (remote-code dataset loader) và template injection trong cấu hình tập dữ liệu. Hoạt động này đã tiến triển thành truy cập nút (node access), thu thập thông tin xác thực và di chuyển ngang (lateral movement) qua một số cụm nội bộ.
Hugging Face cho biết họ đã chạy các agent phân tích do LLM điều khiển trên hơn 17.000 hành động được ghi lại để tái dựng dòng thời gian, trích xuất các chỉ số xâm nhập (indicators of compromise) và lập bản đồ các thông tin xác thực đã bị chạm tới. Các API mô hình tiên tiến được lưu trữ thương mại ban đầu đã từ chối các lệnh tấn công, payload exploit và các tạo tác command-and-control cần thiết cho việc phân tích.
Thay vào đó, công ty đã chạy mô hình open-weight GLM 5.2 trên hạ tầng của riêng mình, điều này cũng giúp giữ dữ liệu tấn công và thông tin xác thực tham chiếu bên trong môi trường của họ. Lời khuyên vận hành của họ là "hãy chuẩn bị sẵn một mô hình có năng lực mà bạn có thể chạy trên hạ tầng của riêng mình và đã được kiểm duyệt trước khi xảy ra sự cố."
Như đã được báo cáo trước đó, OpenAI sau đó cho biết cuộc điều tra sơ bộ của họ tìm thấy GPT-5.6 Sol và một mô hình tiền phát hành có năng lực hơn đã gây ra sự cố trong khi hoạt động với các chế độ từ chối an ninh mạng bị giảm bớt trong một đợt đánh giá ExploitGym nội bộ.
Tiết lộ của OpenAI mô tả một bước sớm hơn trong chuỗi tấn công. Các mô hình đã khai thác một lỗ hổng zero-day trong một proxy bộ nhớ đệm kho lưu trữ gói được lưu trữ nội bộ để có quyền truy cập internet. Sau đó, chúng đã chuỗi các lỗ hổng và thông tin xác thực bị đánh cắp trên các hệ thống của OpenAI và Hugging Face trong khi tìm kiếm các câu trả lời cho điểm chuẩn. OpenAI cho biết một chuỗi đã tìm thấy đường dẫn thực thi mã từ xa trên máy chủ Hugging Face.
Các tiết lộ chính xác lập rằng mô hình mở đã giúp Hugging Face tái dựng vụ xâm nhập và hỗ trợ phản ứng của họ. Tuy nhiên, chúng không cho thấy GLM 5.2 đã độc lập phát hiện, ngăn chặn hoặc kiểm soát được vụ vi phạm.
Một liên minh chưa có quy trình vận hành công khai
Liên minh được thành lập sau một bức thư công nghiệp vào ngày 24 tháng 7 lập luận rằng các mô hình có thể tải xuống cung cấp cho các nhà phòng thủ những khả năng tương đương với những kẻ tấn công, giảm sự phụ thuộc vào các nhà cung cấp đơn lẻ và cho phép các công việc nhạy cảm được giữ trên hạ tầng do người dùng kiểm soát.
OpenAI, Google và Meta xuất hiện trong số những bên ký kết bức thư nhưng lại vắng mặt trong danh sách thành viên ban đầu của liên minh. Anthropic cũng không xuất hiện trong cả hai danh sách tính đến ngày 27 tháng 7 năm 2026.
Một số công nghệ được trích dẫn trong thông báo đã có từ trước khi liên minh thành lập, bao gồm định dạng mô hình Safetensors của Hugging Face, định danh khối lượng công việc SPIFFE/SPIRE do HPE hỗ trợ, hệ thống khắc phục Lightwell của IBM và Red Hat, hệ thống an ninh đa mô hình MDASH của Microsoft và agent mã hóa Grok Build của SpaceXAI. Đây là các dự án của thành viên, không phải sản phẩm do liên minh tạo ra.
Elastic cho biết họ sẽ đóng góp nghiên cứu, công cụ và kiến thức kiến trúc về bảo mật, tìm kiếm, khả năng quan sát và phát hiện do AI hỗ trợ. CrowdStrike cho biết họ đang phát triển các kỹ thuật sử dụng mô hình mở để phát hiện các cuộc tấn công chống lại hệ thống AI và agent.
Linux Foundation mô tả mình là một đối tác sáng lập và cho biết vai trò của họ là cung cấp một nơi trung lập cho các tổ chức cạnh tranh cộng tác. Hiện tại, hồ sơ công khai cho thấy một liên minh, một quan điểm chính sách, một số cam kết của thành viên và một bản phát hành mã mới do NVIDIA duy trì là NOOA. Quản trị của liên minh, lộ trình chung và các mô hình, trọng số (weights) cũng như tập dữ liệu mà NVIDIA hứa hẹn vẫn chưa được tiết lộ.