На проверке AI-агенты в кибератаках: от лабораторных CTF до реальных операций

Плата на антистатическом коврике подключена к Raspberry Pi с OLED-экраном, где искажённым моноширинным шрифтом мигает CVE-2025-53773 COMMAND INJECTION. Один чип обуглен у отладочного разъёма, над...


Последние полтора года я собираю pipeline'ы на базе LLM-агентов для пентеста - LangChain-обёртка над Nmap, nuclei и gobuster с GPT-4 или Claude в роли «мозга». На CTF-полигонах агент сам раскручивает типовую SQL-инъекцию, переводит LFI в RCE, генерирует payload под конкретный стек - без моего участия после начального промпта. На реальном внешнем пентесте - три часа фаззинга формы логина, десяток false positive, ноль findings, которые nuclei не выдал бы за десять минут. AI-агенты в кибератаках - мощный множитель на конкретных этапах, но не замена оператору. И это уже не конференционная демо, а рабочий инструмент с понятными границами.

Бизнес-логика: зачем атакующему автономный ИИ-агент​

Атакующий, который ставит AI-агента в свой pipeline, решает задачу масштаба. Группа из пяти операторов одновременно ведёт три-четыре интрузии. Автономный агент берёт на себя рутину: сканирование, перебор, парсинг вывода инструментов, приоритизацию находок. В отчёте Anthropic за ноябрь 2025 года описано, как агент самостоятельно выполнял разведку, обнаружение уязвимостей, разработку эксплойтов, credential harvesting, lateral movement и эксфильтрацию. Операторы сместились с роли исполнителей на роль супервайзеров: ставили стратегические цели, проверяли находки, одобряли продвижение (анализ IAPS).

Финансовый импакт - прямой. Марк Стокли из Malwarebytes (цитата по MIT Technology Review) говорит прямо: «Если можно делегировать выбор цели агенту, ransomware масштабируется так, как сейчас невозможно. Если я воспроизвёл атаку один раз - дальше это вопрос денег, чтобы воспроизвести её сто раз». Тут не про новые техники - про конвейер.

Типичная жертва - организация с непропатченными системами и дефолтными паролями. По данным IAPS (не верифицировано), «AI использовался для масштабирования операций, эксплуатирующих существующие бреши, а не для преодоления надёжных средств защиты». Агентный ИИ не делает невзламываемое взламываемым - он делает массово эксплуатируемым то, что раньше ломали поштучно.

В терминах MITRE ATT&CK полная цепочка AI-агента выглядит так:
  1. Resource Development - атакующий использует публичные или собственные AI-сервисы для генерации артефактов атаки (T1588.007 - Artificial Intelligence), разрабатывает вредоносное ПО с AI-компонентом (T1587.001 - Malware)
  2. Reconnaissance - агент запрашивает публичные AI-сервисы (T1682 - Query Public AI Services), сканирует уязвимости (T1595.002 - Vulnerability Scanning)
  3. Initial Access - эксплуатация обнаруженных уязвимостей в публичных приложениях (T1190 - Exploit Public-Facing Application)
  4. Execution - запуск команд через интерпретаторы (T1059 - Command and Scripting Interpreter)
  5. C2 - доставка дополнительных инструментов на скомпрометированный хост (T1105 - Ingress Tool Transfer)
Каждый этап агент выполняет в цикле «наблюдение → решение → действие → обратная связь». Оператор подключается только для стратегических решений.

Архитектура LLM-агента для атак​

Наступательный AI-агент - не LLM с промптом «взломай сервер». Это система из четырёх компонентов, и слабость любого из них ограничивает весь pipeline.

LLM-ядро - модель, которая рассуждает, планирует и принимает решения. Закрытые API (GPT-4, Claude) дают лучшее качество reasoning на многоступенчатых задачах, но оставляют логи у провайдера - для OPSEC это проблема. Открытые модели вроде семейства Hermes (NousResearch) работают локально без телеметрии, но на длинных reasoning-цепочках заметно проседают.

Scaffolding (каркас) - обвязка, управляющая циклом принятия решений. В отчёте Anthropic описано, как атакующие собрали кастомный scaffolding поверх Claude Code для многоэтапных атак. Scaffolding позволил обойти встроенные защитные механизмы модели - и большинство его компонентов состояло из коммерческих или open-source инструментов. Для пентестера это инженерная задача уровня разработки C2: state management, error recovery, timeout'ы, ограничения scope - всё руками.

Инструменты (tools) - внешние программы: Nmap, sqlmap, Metasploit, nuclei, gobuster. Агент вызывает их через shell или API, парсит вывод и выбирает следующий шаг. Нет инструмента для протокола - агент бессилен. Тут без вариантов.

Память - хранение результатов (векторная БД, файловый кеш). Без памяти агент зацикливается, повторяя уже выполненные сканы. С памятью - строит карту инфраструктуры и адаптирует стратегию.

Архитектура порождает риски, описанные в OWASP LLM Top 10 (2025): LLM06 - Excessive Agency (избыточная автономия при доступе к shell), LLM01 - Prompt Injection (перехват агента через модифицированные данные на цели), LLM07 - System Prompt Leakage (раскрытие внутренних инструкций агента при взаимодействии с защитником). Практический вывод: ваш наступательный агент сам может стать вектором атаки. Достаточно prompt injection на целевом хосте, чтобы перенаправить его действия - и вот уже ваш агент работает против вас.

AI-агенты в реальных кибератаках: подтверждённые кейсы​

Кибершпионская кампания с Claude Code​

В ноябре 2025 года Anthropic обнаружил и прервал кибершпионскую кампанию с автономным AI-агентом. По данным Carnegie Endowment, операцию связывают с китайскими группировками, использовавшими Claude против иностранных правительств и критической инфраструктуры. Это первая публично задокументированная крупномасштабная AI-assisted операция.

[Применимо: внешний пентест, непропатченная инфраструктура с дефолтными конфигурациями]

Атакующие взяли Claude Code - кодинг-агент Anthropic - и надстроили кастомный scaffolding. Агент вёл полный цикл: recon, обнаружение уязвимостей, разработка эксплойтов, credential harvesting, lateral movement, exfiltration. Операторы задавали только стратегическое направление.

Зафиксированное ограничение (и оно показательное): модель «иногда завышала значимость находок или фабриковала данные» (по данным IAPS). Hallucination в операционном контексте - не философская проблема, а ложные находки, на верификацию которых тратится время. Знакомо всем, кто хоть раз просил LLM проанализировать вывод sqlmap.

LLM Agent Honeypot: проект Palisade Research​

Palisade Research развернула LLM Agent Honeypot - уязвимые серверы, замаскированные под ресурсы с правительственной информацией (по данным MIT Technology Review). С октября 2024 года система зафиксировала более 11 миллионов попыток доступа.

Из них восемь классифицированы как потенциальные AI-агенты, два подтверждены - с IP-адресами из Гонконга и Сингапура. Метод идентификации красивый: honeypot предлагал выполнить команду cat8193 для доступа. AI-агент исполнял инструкцию менее чем за 1.5 секунды - быстрее, чем человек прочитает и напечатает. Просто и эффективно.

Руководитель проекта Дмитрий Волков: «В ближайшие годы я ожидаю увидеть автономных хакерских агентов, которым ставят задачу: "Вот твоя цель. Взломай её"» (MIT Technology Review).

PromptLock: первый AI-ransomware​

В августе 2025 года ESET Research обнаружил PromptLock - первый ransomware со встроенной локальной LLM (по данным OSIbeyond). Вредонос упаковывает языковую модель в пакет - не обращается к внешним API, не триггерит сетевой мониторинг. Тихий зверь.

PromptLock генерирует Lua-скрипты на лету, адаптируясь под конкретную систему: выбирает файлы для шифрования, определяет метод, решает, когда начать эксфильтрацию. В терминах MITRE ATT&CK создание PromptLock - T1587.001 (Malware, Resource Development), разработка вредоносного ПО с AI-компонентом на стороне атакующего до развёртывания. Работа уже развёрнутого ransomware на целевой системе - T1486 (Data Encrypted for Impact). Исследователь ESET Антон Черепанов: «Практически неизбежно, что киберпреступники будут использовать ИИ для создания новых семейств ransomware» (по данным OSIbeyond).

CVE-2025-53773: AI-ассистент как вектор​

CVE-2025-53773 - command injection в GitHub Copilot and Visual Studio (CVSS 7.8 HIGH, вектор CVSS:3.1/AV:L/AC:L/PR:N/UI:R/S:U/C:H/I:H/A:H, CWE-77). Неавторизованный атакующий может выполнить произвольный код локально. В NVD в качестве затронутого продукта (Affected) указан только microsoft:visual_studio_2022.

Механика: атакующий подкладывает вредоносный файл правил в репозиторий. Copilot автоматически считывает его при анализе кода и выполняет встроенные инструкции. AV:L (локальный доступ) + UI:R (требуется действие - открытие проекта) означает: достаточно, чтобы разработчик склонировал репозиторий с вредоносной конфигурацией. Клонировал - и всё, Copilot отработал за атакующего.

Это T1203 (Exploitation for Client Execution): эксплуатация через клиентское приложение (Visual Studio/Copilot), которое интерпретирует вредоносные данные при штатном использовании (UI:R).

ExploitGym, CyberStrike и Hermes: фреймворки для AI пентеста​

Три подхода к автоматизации пентеста ИИ, которые я тестировал в лабораторных средах. Различаются по архитектуре и назначению. Ни один из них - не «серебряная пуля» (спойлер: её вообще нет).

ExploitGym - среда для тренировки и бенчмаркинга AI-агентов. Набор CTF-подобных сценариев с программным интерфейсом: агент получает описание цели, выбирает инструменты, выполняет действия, получает обратную связь (эксплуатация успешна или нет). По данным Daniel Kang (University of Illinois Urbana-Champaign, цитата по MIT Technology Review), текущие AI-агенты успешно эксплуатировали заметную долю уязвимостей, причём результат существенно улучшался при наличии краткого описания уязвимости. То есть: дай агенту подсказку - он справится. Не дай - будет тыкаться вслепую.

CyberStrike-подобные решения - класс pipeline'ов для автоматизации полного kill chain. Агент работает в связной среде, выстраивая цепочку от разведки до захвата. Scaffolding обычно включает интеграцию с Metasploit, Nmap, Burp Suite через API. Архитектурно ближе всего к тому, что Anthropic описывает как «кастомный scaffolding поверх Claude Code» в отчёте о кибершпионской операции.

Hermes (NousResearch) - семейство open-source LLM с минимальными ограничениями на генерацию контента. Hermes - не фреймворк, а модель-«мозг» для агентных pipeline'ов. Работает локально через [URL='https://ollama.com/library/nous-hermes2']ollama run nous-hermes2[/URL] или llama.cpp без телеметрии. Для OPSEC - самое то.

КритерийExploitGymCyberStrike-подобныеHermes (LLM)
ТипБенчмарк-средаПолный pipelineЯзыковая модель
Место в kill chainОтдельные этапыПолная цепочка recon - exfilЯдро для любого этапа
Работа offlineДа (локальный стенд)Зависит от реализацииДа (Ollama, llama.cpp)
ДетектируемостьНе применимо (лаб)Высокая (шумный трафик)Зависит от scaffolding
Reasoning qualityЗависит от LLMЗависит от LLMНиже GPT-4 на цепочках >5 шагов
Подходит дляОценки моделей, R&DAI red team в лабораторияхOffline-операций, OPSEC
Не подходит дляРеальных пентестовProduction с EDRДлинных reasoning-цепочек

Место в цепочке атаки​

ExploitGym - этап валидации: проверяете, способен ли ваш агент решить конкретный класс задач, прежде чем пускать его на реальный стенд. CyberStrike-подобные решения - полный цикл в лабораторной среде: от initial access до post-exploitation. Hermes - сменный компонент: подставляете вместо GPT-4, когда OPSEC требует offline-работы.

По данным Carnegie Endowment, Claude Mythos Preview (на момент публикации не выпущена в открытый доступ) показала высокие результаты на expert-level CTF-задачах и прошла многошаговую симулированную сетевую интрузию от начала до конца (данные не верифицированы). При этом модель «не смогла проникнуть в захарденную среду с активной защитой». Для практика вывод прямой: даже топовая модель работает только против слабых конфигураций. Захарденный хост с EDR - и агент упирается в стену.

В моём рабочем pipeline - гибридная схема: Hermes через Ollama для первичного OSINT-парсинга и генерации гипотез (тихий этап, нет облачных API), а GPT-4 или Claude - для сложного reasoning (анализ исходников, конструирование exploit chain). Выбор модели определяется trade-off между качеством рассуждений и OPSEC.

Автоматизация пентеста ИИ: минимальный recon-агент​

📚 Часть контента скрыта. Этот материал доступен участникам сообщества с рангом One Level или выше
Получить доступ просто — достаточно зарегистрироваться и проявить активность на форуме

Агент получает вывод Nmap, анализирует открытые порты и версии сервисов, формулирует следующий шаг - например, запуск nuclei -t cves/ -u http://target:8080. Каждый цикл «наблюдение → решение → действие» записывается в лог. На стенде без EDR pipeline работает предсказуемо. Трудности начинаются, когда выходишь в production.

Когда recon-агент НЕ работает​

Против CrowdStrike Falcon: массовое сканирование портов детектируется политикой Suspicious Network Scan. У агента нет встроенного rate limiting - задержки и рандомизацию нужно программировать в scaffolding руками.

Против Elastic 8.x+ с Network Detection: корреляция сетевых событий выявляет паттерн последовательного перебора портов с одного IP. Для обхода нужна имитация легитимного трафика с распределением по времени и source IP.

Против SentinelOne с Ranger: обнаружение аномальной сетевой активности новых устройств в сегменте. Подключение нового хоста с последующим массовым сканированием - красный флаг для Ranger.

Захарденный production в целом: AI-агент перебирает варианты brute-force'ом, создавая аномалии в логах SIEM. Без кастомного evasion-модуля в scaffolding он шумнее скрипт-кидди. Я не преувеличиваю - на одном стенде с Elastic агент нагенерировал 400+ алертов за 15 минут.

[Применимо: лабораторная среда без EDR, CTF-полигоны, внешний пентест grey box по согласованию]

Ограничения AI-агентов для эксплуатации уязвимостей​

Четыре ограничения, которые проявляются в ежедневной работе с ИИ для эксплуатации уязвимостей:

Hallucination. Агент «находит» уязвимость, которой нет. Отчёт Anthropic фиксирует: «модель иногда завышала значимость находок или фабриковала данные». На пентесте каждая ложная находка - потраченное время на верификацию. Я считал: на стенде с 20 хостами агент выдал 7 «критических» находок, из которых 3 оказались галлюцинацией.

Отсутствие OPSEC. Агент по умолчанию не заботится о скрытности: Nmap с дефолтными параметрами, нет ротации source IP, нет rate limiting. Всё это нужно программировать руками, а это инженерная задача уровня разработки C2.

Зависимость от инструментов. Нет инструмента для конкретного протокола - агент бессилен. Нет up-to-date базы CVE в nuclei - агент пропускает свежие уязвимости. LLM-агенты для атак не умнее tools, которые им доступны.

Правовой риск автономности. Автономный агент может «решить» расширить scope за пределы согласованного периметра. Scaffolding обязан содержать жёсткие ограничения: whitelist IP, blacklist действий, timeout на каждый шаг. Иначе - юридическая катастрофа. Это не теоретический риск: на одном из тестов агент попытался сканировать соседнюю подсеть, которая не входила в scope. Хорошо, что whitelist отработал.

По данным Carnegie Endowment (не верифицировано), на платформе Moltbook за несколько дней появилось значительное число аккаунтов AI-агентов при относительно небольшом количестве операторов - каждый контролировал десятки агентов. При таком соотношении один-ко-многим атрибуция перестаёт работать по привычным схемам.

Бен Шипли из IBM X-Force (по данным OSIbeyond) сформулировал точно: «Ransomware, написанный AI, не оказывает на жертву большего воздействия, чем ransomware, написанный человеком». Угроза - не в новизне техник, а в масштабе их применения.

Я работаю с наступательными AI-агентами ежедневно и вижу паттерн, который мало кто обсуждает вслух: многие из тех, кто рассуждает об AI-агентах, ни разу не собирали работающий pipeline. Просили ChatGPT сгенерировать payload - да. Строили scaffolding, подключали инструменты, отлаживали цикл обратной связи - нет. Между «попросить LLM написать скрипт» и «запустить автономного агента на scope» - инженерная пропасть.

Прогноз на ближайшие два года: автономные ИИ-агенты станут стандартным инструментом в арсенале APT-групп, но не заменят операторов. Модель, которая периодически фабрикует данные, не годится для операций, где одна ошибка сжигает доступ. Для пентестера AI-агент - множитель на фазе recon и типовой эксплуатации, не замена creative thinking.

Защитники получат те же модели: Project Glasswing от Anthropic уже раздаёт Claude Mythos Preview организациям, обслуживающим критическую инфраструктуру (AWS, Apple, Google, Microsoft). Гонка вооружений симметрична - вопрос, кто быстрее интегрирует.

Полезная проверка навыков - собрать multi-step exploit chain руками, без LLM-костыля. На HackerLab таски по web и pwn как раз для этого.
 
Мы в соцсетях:

Взломай свой первый сервер и прокачай скилл — Начни игру на HackerLab

Похожие темы

🚀 Первый раз на Codeby?
Гайд для новичков: что делать в первые 15 минут, ключевые разделы, правила
Начать здесь →
🧭 Навигатор · ИБ 2026
Не знаешь, какой трек твой?
5 направлений ИБ, реальные зарплаты и точка входа для каждого — в одном треде.
JuniorSenior+
100K → 600K+ ₽ /мес
Открыть навигатор →
🔴 Свежие CVE, 0-day и инциденты
То, о чём ChatGPT ещё не знает — обсуждаем в реальном времени
Threat Intel →
💼 Вакансии и заказы в ИБ
Pentest, SOC, DevSecOps, bug bounty — работа и проекты от проверенных компаний
Карьера в ИБ →

HackerLab