Microsoft a publié son premier modèle de cybersécurité dédié, MAI-Cyber-1-Flash, le 27 juillet, et l’a intégré à MDASH, un système de chasse aux vulnérabilités qui obtient 95,95 % sur le benchmark CyberGym. La société indique que cette configuration surpasse Mythos 5 d’Anthropic et GPT-5,6 Sol d’OpenAI, tout en coûtant 50 % de moins que la meilleure configuration MDASH actuelle de Microsoft. CyberGym est un benchmark qui demande à des agents IA de reproduire 1 507 vulnérabilités connues sur 188 projets open source, en les notant selon le pourcentage de reproductions réussies dans un environnement contrôlé. Le PDG de Microsoft, Satya Nadella, a déclaré que le système combiné offre des performances de niveau mondial pour la moitié du coût des modèles leaders, marquant la première fois qu’un modèle orienté efficacité de Microsoft a battu des modèles d’état de l’art denses conçus pour des capacités générales.
MDASH surpasse les modèles concurrents sur le benchmark CyberGym
Le système MDASH de Microsoft affiche 95,95 % sur CyberGym, selon la société. Ce résultat le place devant GPT-5,5 Cyber à 85,6 %, Mythos 5 à 83,8 %, GPT-5,6 Sol à 83,6 % et Gemini 3,5 Flash Cyber à 83,2 %. Le résultat est auto-déclaré par Microsoft et n’apparaissait pas dans le classement public de CyberGym au moment de la publication, bien que le benchmark utilise un jeu de tests public et une métrique de réussite définie. Le score représente environ 10 points de plus que le résultat précédent de GPT-5,5 Cyber et 7,5 points de plus que le résultat antérieur de MDASH.
MAI-Cyber-1-Flash gère 90 % de la charge de travail avec une sauvegarde GPT-5,4
MAI-Cyber-1-Flash ne fonctionne pas seul. Microsoft affirme qu’il gère jusqu’à 90 % des tâches, tandis que MDASH dirige les 10 % les plus difficiles vers GPT-5,4. Le modèle est l’IA qui raisonne sur le code, tandis que MDASH est le « banc » — la machinerie qui inclut des agents, des outils, des vérifications et un workflow qui décide où chercher, conteste les résultats suspects, supprime les doublons et prouve qu’on peut déclencher des bugs. MDASH s’appuie sur plus de 100 agents spécialisés chargés d’auditer le code, de débattre si une découverte est réelle, et de construire une preuve de concept démontrant que la faille existe.

Microsoft ouvre un aperçu privé via le portail Defender
Microsoft met MDASH en aperçu privé via Microsoft Security Exposure Management dans le portail Defender. Les clients peuvent analyser des dépôts Git, voir des conclusions classées de « peu probable » à « prouvé », et utiliser la Defender CLI pour générer des correctifs de code proposés à des fins de revue par les développeurs. L’aperçu limite actuellement les dépôts à environ 256 Mo et autorise un scan concurrent par tenant. Project Perception devrait étendre la même approche multi-agents au-delà du balayage de code, vers des flux de surveillance des menaces et de remédiation plus larges.
FAQ
Quel score le MDASH de Microsoft a-t-il obtenu sur CyberGym ?
Microsoft indique que MDASH a obtenu 95,95 % sur CyberGym, un benchmark qui demande à des agents IA de reproduire 1 507 vulnérabilités connues sur 188 projets open source.
Comment MAI-Cyber-1-Flash répartit-il sa charge de travail ?
Microsoft indique que MAI-Cyber-1-Flash gère jusqu’à 90 % des tâches, tandis que MDASH dirige les 10 % les plus difficiles vers GPT-5,4. Le système utilise plus de 100 agents spécialisés pour auditer le code et valider les conclusions.
Quelles sont les limites de l’aperçu privé de MDASH ?
L’aperçu limite actuellement les dépôts à environ 256 Mo et autorise un scan concurrent par tenant via Microsoft Security Exposure Management dans le portail Defender.