Microsoft cho biết mô hình AI an ninh mạng mới giúp MDASH đạt 95,95% hiệu suất với chi phí chỉ bằng một nửa

Microsoft vừa ra mắt MAI-Cyber-1-Flash, mô hình AI chuyên dụng cho an ninh mạng đầu tiên tích hợp trong hệ thống MDASH. Sự kết hợp này giúp MDASH đạt hiệu suất 95,95% trên CyberGym với chi phí giảm tới 50% so với các cấu hình trước đây. Hiện quyền truy cập đang giới hạn cho các khách hàng Azure AI Foundry bản private preview.
Mô hình MAI-Cyber-1-Flash của Microsoft
Microsoft ra mắt mô hình AI an ninh mạng MAI-Cyber-1-Flash

Microsoft đã chính thức ra mắt mô hình AI chuyên dụng cho an ninh mạng đầu tiên của mình tích hợp trong MDASH, hệ thống nhận diện và khắc phục lỗ hổng đa mô hình (multi-model vulnerability identification and remediation harness) của hãng.

Công ty cho biết MDASH, khi sử dụng kết hợp MAI-Cyber-1-Flash và GPT-5.4, đã đạt số điểm ấn tượng 95,95% trên CyberGym. Microsoft cũng khẳng định rằng cấu hình này giúp giảm 50% chi phí so với sự kết hợp tốt nhất hiện tại của MDASH (bao gồm GPT-5.4, GPT-5.4 mini và GPT-5.3 Codex). Hiện tại, quyền truy cập chỉ giới hạn cho các khách hàng MDASH được phê duyệt thông qua chương trình Azure AI Foundry private preview.

MAI-Cyber-1-Flash được thiết kế để xử lý tới 90% các tác vụ trong MDASH, trong khi GPT-5.4 sẽ đảm nhận 10% các tác vụ khó nhất. Mô hình này chỉ khả dụng bên trong MDASH và không được cung cấp như một mô hình độc lập hay API (application programming interface) dùng chung.

Hiệu suất trên các bài kiểm tra Benchmarks

Cần lưu ý rằng điểm số cao nhất thuộc về hệ thống MDASH chạy MAI-Cyber-1-Flash cùng với GPT-5.4, chứ không phải bản thân mô hình mới. CyberGym Cấp độ 1 là một bài kiểm tra tái hiện lỗ hổng đã biết. Nó cung cấp cho agent mô tả về lỗ hổng và mã nguồn chưa được vá tương ứng, sau đó kiểm tra xem liệu agent có thể tạo ra một bản khai thác thử nghiệm (proof of concept) hoạt động được hay không. Bài kiểm tra này không đo lường khả năng phát hiện lỗ hổng một cách ngẫu nhiên (blind vulnerability discovery) hoặc tính chính xác của bản vá được tạo ra.

Bảng xếp hạng công khai của CyberGym vẫn chưa liệt kê kết quả 95,95% của Microsoft tính đến ngày 28 tháng 7 năm 2026. Kết quả hiện tại vẫn là 88,4% từ lần gửi thử của MDASH vào ngày 12 tháng 5. Các tài liệu công khai của Microsoft không nêu rõ liệu kết quả mới này đã được gửi để niêm yết hay chưa.

Kết quả MDASH 96,55% trước đó của Microsoft cũng không làm rõ được sự so sánh này. Con số vào tháng 6 đó tính bất kỳ sự cố (crash) nào, bao gồm cả các lỗ hổng không phải mục tiêu. Các tài liệu tháng 7 không cho biết liệu kết quả 95,95% có sử dụng cùng tiêu chí hay không, vì vậy hai điểm số này không thể được coi là một xu hướng hiệu suất trước và sau một cách chắc chắn.

Chi tiết kỹ thuật của MAI-Cyber-1-Flash

Theo model card của Microsoft, MAI-Cyber-1-Flash là một transformer dạng sparse mixture-of-experts với tổng cộng 137 tỷ tham số (parameters), 5 tỷ tham số hoạt động (active parameters) và context window lên đến 256.000 token. Đây là phiên bản fine-tune chuyên về an ninh mạng của MAI-Code-1-Flash, vốn được phát triển từ một checkpoint giữa quá trình huấn luyện của MAI-Thinking-1.

Dữ liệu CyberGym
Biểu đồ hiệu suất CyberGym của Microsoft

Model card cho biết cấu hình được đánh giá đã thay thế 80% các mô hình hiện có của MDASH và nâng kết quả CyberGym được báo cáo từ 88,4% lên 95,95%. Con số 80% này là tỷ lệ các mô hình được thay thế, trong khi con số 90% riêng biệt là tỷ lệ tác vụ tối đa mà Microsoft nói rằng mô hình nhỏ hơn có thể xử lý.

Tổng kết lại, thiết kế được công bố tập trung vào khả năng điều phối (routing) như một tuyên bố kỹ thuật trọng tâm: MAI-Cyber-1-Flash được thiết kế để xử lý hầu hết các tác vụ, GPT-5.4 sẽ đảm nhận phần còn lại khó khăn nhất và Microsoft báo cáo kết quả ở cấp độ hệ thống MDASH.

CyberGym Microsoft Results

Thông báo ra mắt của Microsoft xác định mức tiết kiệm 50% dựa trên sự kết hợp mô hình MDASH tốt nhất hiện tại. Trang sản phẩm mô tả hệ thống mang lại "hiệu suất tương đương với chi phí bằng 50% so với các mô hình hàng đầu". Tuy nhiên, thông báo không tiết lộ số lượng token sử dụng, khối lượng cuộc gọi (call volume), độ trễ (latency) hay phân bổ tính toán đằng sau sự so sánh đó, nên con số này chưa thể được kiểm chứng độc lập.

"Mô hình là một đầu vào, hệ thống xung quanh nó mới là sản phẩm."

Taesoo Kim, Phó chủ tịch phụ trách agentic security của Microsoft, đã sử dụng sự phân biệt này khi mô tả về MDASH vào tháng 6. Trong các bài kiểm tra khác, model card báo cáo điểm số 0,314 trên CVEBench, 0,553 trên CyberSecEval4, 0,33 trên bài kiểm tra phân tích mã độc (malware-analysis) và 0,651 trên CRSBench tại POV=1200.

Đáng chú ý, mô hình đạt điểm 0 trong các danh mục kernel, userspace và trình duyệt của ExploitGym, nơi yêu cầu các agent chuyển đổi các lỗ hổng được cung cấp thành mã khai thác thực thi (code-execution exploits) hoạt động được.

Hướng tới tương lai với Project Perception

Microsoft cho biết tất cả các thử nghiệm benchmark diễn ra trong môi trường cách ly mạng, không có quyền truy cập vào các hệ thống sản xuất, internet công cộng hoặc các dịch vụ bên ngoài. Model card cũng cảnh báo rằng văn bản và mã được tạo ra có thể không chính xác hoặc không đầy đủ và cần được xem xét kỹ trước khi sử dụng.

Quản lý lỗ hổng phần mềm sử dụng MAI-Cyber-1-Flash bên trong MDASH là kịch bản đầu tiên mà Microsoft công bố cho Project Perception, hệ thống rộng lớn hơn của hãng nhằm điều phối các agent an ninh phòng thủ. Project Perception dự kiến sẽ bắt đầu bản xem trước công khai (public preview) vào ngày 3 tháng 8, với kế hoạch mở rộng mô hình sang các quy trình làm việc an ninh khác ngoài lỗ hổng phần mềm.