РАЗБОР
На проверке
Агентный пентест: обзор ИИ-инструментов 2026
[ обложка статьи ]
Режим чтения
Последние полтора года я встраиваю LLM-агенты в пентест-процессы - от recon до exploitation. По данным разработчиков XBOW, их агент выстраивает 48-шаговые цепочки до RCE и выполняет свыше 1 060 автономных атак за одну сессию. Horizon3.ai NodeZero в пилотном проекте покрыл 3 600 хостов за три дня при 98% охвате - классический ручной пентест на том же скоупе едва дотягивал до 600 хостов (данные Astra Security). А параллельно агент другого класса на моём проекте потратил сутки на галлюцинации и записал в отчёт несуществующий SSRF как critical. Просто выдумал его.
Агентный пентест - не волшебная кнопка и не замена пентестера. Это конкретный инструментарий с измеримыми преимуществами и понятными дырами, который стоит разобрать без маркетинговой обёртки.
Агентный пентест vs автоматизированное сканирование
Прежде чем сравнивать инструменты, зафиксируем терминологию. В индустрии сосуществуют три уровня автоматизации пентеста, и путаница между ними порождает завышенные ожидания.Три уровня автоматизации пентеста
Автоматические сканеры (DAST/SAST). Прогоняют предопределённые проверки по известным классам уязвимостей. На выходе - простыня потенциальных проблем с false positive rate от 60 до 80% (Astra Security). Нет цепочек эксплуатации, нет понимания бизнес-контекста. Nessus, OpenVAS, Nikto - этот уровень.LLM-ассистенты. Большие языковые модели подсказывают команды, интерпретируют вывод инструментов, помогают строить гипотезы. PentestGPT (2023) показал улучшение completion rate на 228,6% по сравнению с базовым GPT-3.5 (Astra Security). Но человек по-прежнему нажимает Enter на каждом шаге. Усилитель - да. Автопилот - нет.
Агентный пентест. Многоагентная система, где координатор раскидывает задачи между специализированными агентами - recon, XSS, BOLA/IDOR, validator. Каждый работает со своим контекстом и набором инструментов, обмениваясь данными через общий слой памяти. Агент получает цель и задание - дальше reconnaissance, анализ, exploitation и отчёт без пошагового контроля оператора.
Архитектурное отличие простое: автоматизация следует скрипту, агент преследует цель. Сканер не заметит, что две low-severity находки объединяются в critical account takeover. Агент - может.
Picus Security предлагает конкретный тест для проверки вендорских заявлений: определяет ли инструмент скоуп самостоятельно по входному сигналу, или оператор по-прежнему задаёт цель и нажимает «Go»? Рассуждает ли система за пределами заранее написанной логики? Если внутренний движок остаётся rule-based - смена маркетингового описания не меняет архитектурный потолок.
Архитектура автономных ИИ-агентов в пентесте
Понимание архитектуры критично до сравнения инструментов. Иначе непонятно, что именно сравниваем и почему одни системы галлюцинируют, а другие нет.Координатор, специализированные агенты, sandbox
По данным Escape (разработчик агентной платформы для API-пентеста), рабочая архитектура включает три слоя:Координатор. Сам ничего не тестирует. Анализирует скоуп, разбивает задачу на независимые подзадачи, раскидывает между агентами и контролирует границы. В промпте координатора Escape явно указано: «You are a COORDINATION AGENT ONLY. You do NOT perform any security testing yourself.»
Специализированные агенты. Каждый отвечает за конкретный вектор:
- Recon Agent - маппинг маршрутов, анализ архитектуры, определение точек входа
- XSS Agent - тестирование cross-site scripting с контекстно-зависимыми payload'ами
- BOLA Agent - поиск broken object-level authorization (IDOR, privilege escalation)
- Adversarial Validator - подтверждение эксплуатируемости в реальных условиях
Обмен разведданными между агентами идёт через intelligence layer. Recon Agent обнаруживает аутентифицированный API endpoint - сигнализирует BOLA Agent проверить авторизацию. XSS Agent находит отражение ввода - Validator подтверждает эксплуатируемость.
Пятифазный цикл агентного пентеста
Цикл повторяет OSSTMM/PTES, но с параллельным выполнением и машинной скоростью:1. Discovery / Recon. Маппинг attack surface: домены, поддомены, API (REST/GraphQL), authentication flows, облачные ресурсы. В терминах MITRE ATT&CK - Active Scanning (T1595, Reconnaissance). Тут агенты обрабатывают тысячи целей параллельно - и это их реальное преимущество.
2. Threat Modeling. Координатор решает, какие классы уязвимостей тестировать и где: checkout flow получает probing на платёжную логику и сессии, admin panel - BOLA/IDOR и privilege escalation.
3. Exploitation. Специализированные агенты запускают payload'ы через sandbox-инструменты. Самое интересное - цепочки: SSRF → обращение к метаданным облачного провайдера → временные учётные данные IAM → доступ к приватному хранилищу. Четыре находки по отдельности - medium, цепочка - critical. В терминах ATT&CK это покрывает Exploit Public-Facing Application (T1190, Initial Access), Brute Force (T1110, Credential Access), Exploitation of Remote Services (T1210, Lateral Movement).
4. Validation. Агент не сообщает о теоретическом CVE-совпадении, а пытается неразрушительно эксплуатировать уязвимость и фиксирует воспроизводимое доказательство. XBOW формулирует принцип: «AI discovers - logic validates. If it can't be proven, it doesn't ship.»
5. Reporting & Remediation. Отчёт с полными цепочками атак, шагами воспроизведения, анализом воздействия на уровне кода и приоритизацией по реальному бизнес-риску - не только CVSS-баллам.
Обзор AI pentest tools: сравнение инструментов автоматизации
Почему именно эти инструменты
В обзор вошли платформы, которые соответствуют определению агентного пентеста - многоагентная архитектура, автономное принятие решений, цепочки эксплуатации - и о которых есть верифицируемые данные из публичных EN-источников уровня Tier-2. Не включены: чистые DAST/SAST-сканеры (Burp Suite, ZAP, Nessus), LLM-ассистенты без автономного цикла (ChatGPT/HackerGPT в ручном режиме), продукты без публичной документации архитектуры.| Инструмент | Тип | Автономность | Ключевая метрика | Когда НЕ подходит | Open Source |
|---|---|---|---|---|---|
| XBOW | Полностью автономный | Цепочки до 48 шагов без человека | 1 060 атак за сессию | Нужен контроль scope или self-hosted | Нет |
| Horizon3.ai NodeZero | Автономный (сеть + AD) | Самостоятельный скоупинг | 3 600 хостов / 3 дня (98% coverage) | Web-приложения, API-пентест | Нет |
| Pentera | Автоматизированная валидация | Высокая, но rule-based ядро | Широкий охват TTPs | Нестандартные сценарии за пределами библиотеки | Нет |
| Escape | Агентный (API-фокус) | Multi-agent с координатором | API-first, GraphQL/REST | Сетевой пентест, внутренняя инфраструктура | Нет |
| PentAGI | Полностью автономный | Self-hosted, мульти-LLM | 24 900+ stars на GitHub | Требует настройки, зависит от качества LLM | Да (MIT) |
| Aikido Security | Агентный | С валидацией через видео/captures | Интеграция в CI/CD | Документация архитектуры ограничена | Нет |
| Astra Security | Гибридный (агент + человек) | Агент - breadth, человек - validation | Обучен на 4 000+ пентестах | Зависимость от доступности экспертов | Нет |
XBOW выполняет 48-шаговые цепочки атак до RCE и проводит свыше 1 060 автономных атак за одну сессию (Astra Security). Принцип детерминированной валидации - если уязвимость не доказана, она не попадает в отчёт - решает проблему ложных срабатываний. Обратная сторона: уязвимости, требующие нестандартного контекста для эксплуатации, остаются за бортом. Агент просто не знает, что искать.
Horizon3.ai NodeZero заточен под internal pentest и атаки на Active Directory. В пилотном проекте медиакомпании платформа покрыла 3 600 хостов за три дня при 98% охвате - против ~600 хостов при классическом ручном тестировании (Astra Security). Строит цепочки credential harvesting → lateral movement → domain admin. На внутрянке с AD - зверь. На веб-приложениях - мимо.
PentAGI - проект с 24 900+ звёзд на GitHub (MIT-лицензия), единственный open source в обзоре. Полностью автономная мультиагентная система с поддержкой нескольких LLM-бэкендов (OpenAI, Anthropic). Для тех, кому критичен self-hosted режим и контроль над данными - единственный вариант. Развернуть базовую конфигурацию:
Bash:
git clone https://github.com/vxcontrol/pentagi.git
cd pentagi
cp .env.example .env
# Указать API-ключи LLM-провайдеров в .env
docker-compose up -d
Pentera ближе к BAS (Breach and Attack Simulation), чем к чистому агентному пентесту. Rule-based ядро с широким покрытием TTPs, но без способности рассуждать за пределами заранее написанных правил. Для continuous validation уже известных векторов - ок. Для поиска нестандартных цепочек - не тот инструмент.
Ограничения автономного ИИ-пентеста: где агенты ломаются
Галлюцинации и фейковые эксплойты
Escape открыто описал случай: их XSS-агент залогинился в консоль браузера, выполнил скрипт напрямую и отчитался - «XSS vulnerability found here!» Агент галлюцинировал эксплойт, которого не существовало, подделав сам процесс эксплуатации. По сути - сам себя обманул.Это не единичный инцидент. Агенты на базе LLM склонны к нескольким типам ошибок:
- Фантомные уязвимости - агент интерпретирует нормальное поведение приложения как аномалию и строит на этом цепочку
- Самоподтверждение - агент выполняет действие, которое сам считает доказательством, но оно не является валидным тестом (тот самый кейс Escape)
- Путаница контекстов - данные из одного endpoint'а используются для построения вывода о другом
Контроль scope и blast radius
Автономный агент, который «рассуждает и адаптируется», запросто выходит за пределы согласованного scope. В ручном пентесте скоуп контролирует человек. В агентном - нужны программные guardrails: ограничение сетевых сегментов, whitelist/blacklist хостов, rate limiting.Picus Security отмечает отдельно: автономный пентест валидирует эксплуатируемость и цепочки атак, но не подтверждает, сработали ли detection rules и prevention controls - это задача BAS и detection validation. Разные инструменты, разные задачи.
Архитектурный потолок автоматизации
По данным Picus Security, автоматизированный пентест (rule-based, не агентный) упирается в четыре фундаментальных ограничения:- Chain dependency - шаг B зависит от шага A; один блокированный шаг каскадирует в слепое пятно по всей ветке
- Frozen intelligence - decision tree хорош ровно настолько, насколько хороши правила, написанные на момент разработки
- Оператор-зависимый триггер - инструмент запускается по расписанию, а не по появлению нового CVE
- Убывающая отдача - к третьему запуску на фиксированном скоупе новые находки иссякают
Как встроить LLM-агенты в пентест-цепочку
Для старта с минимальными затратами: PentAGI на локальном стенде + изолированная сеть. Развернуть через
docker-compose up, указать в .env ключ API для LLM-провайдера, натравить на тестовую инфраструктуру. Результат - понимание, что агент реально делает, а где выдумывает.Хайп вокруг агентного пентеста сейчас кратно опережает зрелость инструментов. По данным Habr со ссылкой на CyberScoop, Кевин Мандиа (основатель Mandiant) тестировал компанию из Fortune 150 - RCE или утечка найдены в 100% приложений. Звучит впечатляюще, но вопрос не «может ли агент найти уязвимость», а «можно ли доверять его отчёту без перепроверки». Ни один инструмент из обзора не работает в режиме fire-and-forget на проде.
Мой рабочий критерий: агент экономит время на Active Scanning (T1595) и Brute Force (T1110) - на том, что требует объёма, а не изобретательности. На этапе exploitation, где нужны кастомные payload'ы, обход EDR, нестандартный lateral movement - агент в лучшем случае генерирует стартовые гипотезы. MITRE уже включил Artificial Intelligence (T1588.007) в тактику Resource Development - атакующие используют ИИ для подготовки инструментария. Защитникам разумно делать то же, но с трезвым пониманием границ.
Через год-два расклад изменится: LLM станут точнее, мультиагентные архитектуры - стабильнее. Но сегодня агентный пентест - усилитель, а не замена. Пентестер, который грамотно оркестрирует агентов, получает преимущество не потому, что инструмент умнее, а потому, что высвободившееся время уходит на задачи, которые ни один LLM пока не решает: цепочки с evasion, бизнес-логику и нестандартный контекст. Если хочется калибровать чутьё на реальных цепочках - web-задачи на HackerLab дают ту самую практику, где понимаешь, что агент пропустил бы.
AI-выжимка
сгенерировано ИИ
Тезисы статьи скоро
Статья читается полностью. Тезисы со ссылками на разделы появятся позже.
Содержание
Codeby Academy
Практика и мастерство
От основ до продвинутого — программы для практиков Codeby.
Перейти к курсу →
Поиск в обсуждении
Продолжить чтение
Следующий разбор
Как обойти SOC при пентесте: stealth-сканирование
Ещё по теме
- Статья
- Статья
- Статья
Комментарии
0