Positive Technologies натравила 4 ИИ-агента на MaxPatrol O2: HexStrike на GLM 5.1 оказался самым опасным
🛠 Positive Technologies натравила 4 ИИ-агента на MaxPatrol O2: HexStrike на GLM 5.1 оказался самым опасным
По данным Habr, эксперимент на киберполигоне Standoff длился четыре дня: четыре автономных атакующих агента (три open-source проекта и собственная разработка PT Yasen) по очереди реализовывали критические события против системы расследования MaxPatrol O2. Инфраструктура восстанавливалась из снапшота перед каждым прогоном, работа шла в режиме human-in-the-loop — если агент упирался в тупик, оператор корректировал его поведение. Точка входа у всех была одна: ProjectSend RCE (CVE-2024-11680), затем повышение привилегий через SUID-бит и Lateral Movement во внутреннюю сеть.
HexStrike AI на DeepSeek V4 Pro справился лучше всех — реализовал все четыре критических события, уложившись в 40 минут на одном из сценариев. PentAGI на GLM 5.1, самый архитектурно навороченный участник с графовой памятью и оркестратором, ожидаемо застревал чаще и требовал вмешательства оператора. Собственный Yasen использовал связку Anthropic Haiku 4.5 для быстрых операций и Opus 4.6 для планирования — но модели Opus 4.7 и 4.8 применить не вышло из-за ограничений Anthropic на offensive-сценарии.
MaxPatrol O2 восстанавливала kill chain через LLM-агента, который обходит графы ресурсов и обогащает индикаторы через VirusTotal и WHOIS. Качество расследования оценивали двумя метриками: точность последовательности переходов между хостами (SA) и структурное совпадение по индексу Жаккара (SJS). Приоритет — 0.6 на полноту обнаружения, 0.4 на связывание в единую цепочку. Защита собрала контекст по ключевым этапам атак, но не безупречно — ложные корреляции случались.
Самый неочевидный результат — не скорость агентов, а то, как сильно они зависят от оператора на этапе разведки во внутренней сети. HexStrike выиграл не потому, что на борту была лучшая LLM, а потому что его воркфлоу-менеджер быстрее подсовывал модели правильные рельсы — и в этом весь инженерный урок: архитектура оркестрации сейчас важнее сырой мощности модели.
#MaxPatrolO2 #AIagents #Pentesting #PositiveTechnologies
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.