Microsoft MDASH набирает 95,95% в CyberGym, обходит Claude Mythos и GPT-5.6 Sol

Microsoft выпустила свою первую специализированную модель кибербезопасности MAI-Cyber-1-Flash 27 июля и интегрировала её в MDASH — систему поиска уязвимостей, набравшую 95,95% на бенчмарке CyberGym. Компания заявляет, что эта конфигурация превосходит Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI, при этом стоит на 50% меньше, чем текущее лучшее решение MDASH от Microsoft. CyberGym — это бенчмарк, который просит ИИ-агентов воспроизвести 1 507 известных уязвимостей в 188 проектах с открытым исходным кодом, оценивая их по доле успешно воспроизведённых случаев в контролируемой среде. Генеральный директор Microsoft Сатья Наделла заявил, что объединённая система обеспечивает производительность мирового класса при стоимости вдвое ниже ведущих моделей, отметив первый случай, когда ориентированная на эффективность модель Microsoft обошла state-of-the-art модели, созданные для универсальных возможностей.

MDASH обходит конкурентов на бенчмарке CyberGym

Система MDASH от Microsoft набрала 95,95% на CyberGym, утверждает компания. Этот результат вывел её вперёд GPT-5.5 Cyber (85,6%), Mythos 5 (83,8%), GPT-5.6 Sol (83,6%) и Gemini 3.5 Flash Cyber (83,2%). Результат заявлен самой Microsoft и на момент публикации не был представлен на публичном лидерборде CyberGym, хотя бенчмарк использует публичный тестовый набор и определённый показатель успеха. Оценка примерно на 10 пунктов выше, чем у GPT-5.5 Cyber, и на 7,5 пункта выше предыдущего результата MDASH.

MAI-Cyber-1-Flash выполняет 90% нагрузки с резервной GPT-5.4

MAI-Cyber-1-Flash не работает в одиночку. Microsoft говорит, что она обрабатывает до 90% задач, а MDASH направляет самые сложные 10% в GPT-5.4. Модель — это ИИ, который рассуждает по коду, тогда как MDASH — это стенд: механика, включающая агентов, инструменты, проверки и рабочий процесс, которые решают, где искать, оспаривают предполагаемые находки, убирают дубликаты и доказывают, что баги можно триггерить. MDASH использует более 100 специализированных агентов, чтобы аудитировать код, обсуждать, является ли находка реальной, и собирать доказательство концепции, демонстрирующее наличие изъяна.

Microsoft MDASH system architecture

Microsoft открывает частный preview через портал Defender

Microsoft запускает MDASH в частный preview через Microsoft Security Exposure Management в портале Defender. Клиенты смогут сканировать Git-репозитории, видеть находки, ранжированные от маловероятных до подтверждённых, и использовать Defender CLI, чтобы генерировать предложенные исправления кода для проверки разработчиками. В текущей версии preview она ограничивает репозитории примерно 256MB и разрешает один одновременный скан на одного арендатора (tenant). Ожидается, что Project Perception расширит тот же многоагентный подход за пределы сканирования кода — на более широкий мониторинг угроз и сценарии устранения.

FAQ

Какой результат показал MDASH от Microsoft на CyberGym?
Microsoft говорит, что MDASH набрал 95,95% на CyberGym — бенчмарке, который просит ИИ-агентов воспроизвести 1 507 известных уязвимостей в 188 проектах с открытым исходным кодом.

Как MAI-Cyber-1-Flash распределяет нагрузку?
Microsoft говорит, что MAI-Cyber-1-Flash обрабатывает до 90% задач, а MDASH направляет самые сложные 10% в GPT-5.4. В системе используется более 100 специализированных агентов, чтобы аудитировать код и валидировать находки.

Какие ограничения у частного preview MDASH?
Preview сейчас ограничивает репозитории примерно 256MB и позволяет один одновременный скан на одного арендатора (tenant) через Microsoft Security Exposure Management в портале Defender.

Дисклеймер: Информация на этой странице может быть получена из источников третьих сторон и предоставляется только для ознакомления. Она не отражает взгляды или мнения Gate и не является финансовой, инвестиционной или юридической рекомендацией. Торговля виртуальными активами связана с высоким риском. Пожалуйста, не основывайте свои решения исключительно на данных этой страницы. Подробнее смотрите в Дисклеймере.
комментарий
0/400
Нет комментариев