По данным Kaspersky Digital Footprint Intelligence, за 2023 год на underground-форумах зафиксировано 249 предложений по продаже jailbreak-промптов для языковых моделей. Продавец FraudGPT заявлял о 3000+ продажах при годовой подписке до $1700. Мониторя закрытые площадки и Telegram-каналы, вижу чёткий тренд: рынок weaponized LLM для кибератак проходит ту же эволюцию, что прошёл рынок RaaS пятью годами ранее - от кустарных поделок к коммерческим продуктам с тикет-системой и Telegram-ботом поддержки. Про сами инструменты пишут все. А вот как детектировать AI-генерируемые атаки на уровне SOC - тишина. Этот разрыв закрываем здесь.
Бизнес-логика атаки: зачем хакерам weaponized LLM
Перед тем как лезть в архитектуру, зафиксируем: какую конкретную задачу злоумышленника решают WormGPT-подобные AI-инструменты в даркнете? Подробнее - в нашем подробном разборе безопасность llm атаки.Они закрывают три узких места в цепочке атаки.
Языковой барьер. BEC-атаки (Business Email Compromise) традиционно требовали носителя языка или хорошего копирайтера. Генерация фишинговых писем с помощью AI убирает эту проблему - модель выдаёт грамматически чистый текст на любом языке, имитируя стиль конкретной компании. Исследователи SlashNext, тестировавшие WormGPT на задаче BEC-генерации, описали результаты как «unsettling» - пугающе убедительные (данные по InfoSecurity Europe). И тут я с ними согласен: когда модель за 30 секунд выдаёт письмо, неотличимое от реального CFO - это уже не игрушки.
Порог входа в разработку малвари. По данным Unit 42 (Palo Alto Networks), AI-инструменты для взлома позволяют low-skill атакующим генерировать функциональные скрипты на Python без глубокой экспертизы. Unit 42 вводит термин «AI-empowered script kiddies» - и это не гипербола. Скрипт-кидди с ChatGPT опаснее скрипт-кидди с форумным туториалом, просто потому что скорость итерации выросла на порядок.
Компрессия времени. Цикл подготовки атаки - исследование цели, создание фишинговой приманки, генерация tooling-кода - сжимается с дней до минут промптинга. По данным экспертов SecPost, подготовка кибернападений уже исчисляется часами, а не днями.
В терминах MITRE ATT&CK это соответствует тактике Resource Development: техника Artificial Intelligence (T1588.007) для получения AI-capabilities и Generate Content / Written Content (T1683, T1683.001) для производства контента атаки.
Три архитектуры нелегальных ChatGPT-аналогов для хакеров
Русскоязычные источники обычно сваливают все «даркнет-нейросети» в одну кучу. На практике - три принципиально разных подхода, и различие между ними критично для выбора стратегии детекции.Fine-tuned модели: от WormGPT до KawaiiGPT
Оригинальный WormGPT - канонический пример. По данным Unit 42, он построен на базе GPT-J 6B (open-source модель от EleutherAI, 2021 год) и дообучен на специализированных датасетах: код вредоносных программ, описания эксплойтов, шаблоны фишинга. Этические ограничения не снимались - они просто никогда не устанавливались, потому что fine-tuning шёл изначально на вредоносных данных.Что отличает fine-tuned вредоносные модели:
- Модель «из коробки» заточена под криминальные задачи
- Не требует jailbreak-промптов - отказа от вредоносных запросов нет в её поведении
- Качество выходных данных выше, чем у jailbroken mainstream-моделей, потому что модель обучена именно на этом домене
- Затраты на создание значительные: нужны GPU-ресурсы, датасеты и ML-экспертиза
Wrapper-сервисы: jailbroken LLM как услуга
Второй подход проще технически: оператор не обучает собственную модель, а проксирует запросы через mainstream LLM (ChatGPT, Gemini) с предустановленным jailbreak-промптом. По данным dexpose.io, такие сервисы используют prompt injection для обхода safety-фильтров, а не строят модель заново. На выходе - тот же ассистент без контентной модерации, только под капотом чужой API.С точки зрения OWASP LLM Top 10 (2025), это прямая эксплуатация риска LLM01 - Prompt Injection: специально сформированный ввод изменяет поведение модели, обходя контроли безопасности.
Для SOC-инженера различие между fine-tuned и wrapper критично. Трафик wrapper-сервиса идёт к API легитимного провайдера (
api.openai.com), что затрудняет блокировку на уровне сети. Fine-tuned модель живёт на собственной инфраструктуре злоумышленника - другой профиль трафика и другие IoC. Два разных зверя - два разных подхода к охоте.Open-source модели без ограничений: Llama и Mixtral для атак
Третий и самый неприятный тренд. По данным dexpose.io, примерно через шесть месяцев после хайпа WormGPT и FraudGPT threat intelligence команды зафиксировали сдвиг: злоумышленники переходили на бесплатные uncensored-версии open-source моделей вместо оплаты подписки на брендированные продукты. По информации SecPost, Nytheon AI построен на Llama и Gemma с предварительно снятыми этическими ограничениями. По данным Cato Networks (упомянутых SecurityLab), такие модификации не являются уязвимостью самих моделей Grok или Mixtral - речь идёт о злоупотреблении открытостью архитектуры.Почему это опаснее всего:
- Нулевая стоимость входа (модели доступны на HuggingFace)
- Локальный запуск на consumer-grade GPU
- Полное отсутствие логирования и телеметрии
- Невозможность takedown - модель уже скачана
Экосистема darknet AI marketplace: FraudGPT WormGPT сравнение
Ценообразование и коммерческая модель
Рынок AI-инструментов для взлома в даркнете работает по модели CaaS (Crime-as-a-Service). Верифицированные данные о ценообразовании (по материалам LevelBlue, InfoSecurity Europe и dexpose.io):| Продукт | Базовая модель | Цена (месяц) | Цена (год) | Заявленный функционал |
|---|---|---|---|---|
| WormGPT v1 | GPT-J 6B | 60-100 EUR | 550 EUR | BEC, генерация малвари, фишинг |
| WormGPT v2 | Не раскрыта | Только годовая | 550 EUR (private build 5000 EUR) | Улучшенная приватность, переключение моделей |
| FraudGPT | Не раскрыта | 90-200 USD | 800-1700 USD | Фишинг-страницы, вредоносный код, поиск утечек, карты без VBV |
| WolfGPT | Python-based | Нет данных | Нет данных | Криптографическая малварь, фишинг |
| XXXGPT | Не раскрыта | Нет данных | Нет данных | Ботнеты, RAT, ATM-малварь, криптостилеры |
FraudGPT позиционируется как инструмент «for fraudsters, hackers, scammers and like-minded individuals» (данные dexpose.io). По данным SecureOps, продавец заявлял о 3000+ подтверждённых продажах. Исследователи Netenrich (по InfoSecurity Europe) предполагали, что за FraudGPT и WormGPT может стоять одна группа. FraudGPT при этом фокусировался на краткосрочных high-volume атаках (фишинг), WormGPT - на долгосрочных (AI малварь на основе языковых моделей, ransomware).
Форум XSS, по данным LevelBlue, имеет выделенную секцию AI/ML, где обсуждаются способы атак на AI-модели, методы построения собственных GPT-систем и ресурсы по теме, включая ссылки на раздел MITRE, посвящённый атакам на AI.
Жизненный цикл и ротация брендов
Момент, который упускают русскоязычные источники: рынок malicious AI крайне волатилен. По данным dexpose.io, брендированные подписочные инструменты живут около шести месяцев - после чего привлекают внимание правоохранителей или теряют клиентов из-за бесплатных open-source альтернатив.Оригинальный разработчик WormGPT свернул проект в середине 2023 года, сославшись на негативную публичность. Но бренд продолжил жить: по данным Unit 42, WormGPT 4 продвигается через отдельный Telegram-канал и собственный сайт. Разработчики WormGPT 4 скрывают архитектуру и не раскрывают, используют ли fine-tuning или persistent jailbreaking. Позиционирование прямолинейное: «WORMGPT is your key to an AI without boundaries» (Unit 42).
EvilGPT, VenomGPT, MalwareGPT - многие из них, по данным dexpose.io, являются ребрендами или реселлерами, а не самостоятельными моделями. Часть инструментов - откровенный scam, нацеленный на самих злоумышленников: «tools that underdeliver on their marketing or are outright scams targeting the criminals who buy them» (dexpose.io). Скамят скамеров - ирония рынка.
AI-powered кибератаки в контексте MITRE ATT&CK
Использование вредоносных LLM укладывается в конкретные техники MITRE ATT&CK. Этот маппинг - основа для построения детект-правил и threat hunting гипотез.Resource Development (подготовка ресурсов):
- Artificial Intelligence (T1588.007) - приобретение доступа к AI-capabilities для подготовки атаки
- Malware (T1587.001) - разработка AI-малвари и вредоносных скриптов с помощью LLM
- Generate Content (T1683) - использование AI для генерации контента атаки
- Written Content (T1683.001) - генерация фишинговых писем, BEC-сообщений, scam-скриптов
- Upload Malware (T1608.001) - размещение AI-сгенерированной малвари на атакующей инфраструктуре
- Spearphishing Attachment (T1566.001) - доставка AI-сгенерированного фишинга с вложением
- Spearphishing Link (T1566.002) - доставка AI-сгенерированного фишинга со ссылкой на фишинговую страницу
Как детектировать вредоносные LLM и AI-генерируемые атаки
📚 Часть контента скрыта. Этот материал доступен участникам сообщества с рангом One Level или выше
Получить доступ просто — достаточно зарегистрироваться и проявить активность на форуме
Получить доступ просто — достаточно зарегистрироваться и проявить активность на форуме
На что обращать внимание при анализе подозрительных email:
Статистические аномалии текста. LLM генерируют текст с более стабильной статистикой, чем человек. Неестественно равномерная длина предложений, отсутствие опечаток и стилистических «шумов», характерных для конкретного отправителя, высокая лексическая density при low perplexity - текст «слишком гладкий» для этого автора. Если ваш CFO обычно пишет «ок, сделай» и вдруг пришло письмо на три абзаца с идеальной пунктуацией - это повод задуматься.
Метаданные email. Несоответствие часового пояса отправки и рабочего расписания предполагаемого отправителя. Нетипичный X-Mailer или его отсутствие. Всплеск отправки однотипных, но лексически разнообразных писем с одного источника за короткий период.
Контентные паттерны. Отсутствие характерных для конкретного человека речевых паттернов: привычный сленг, устойчивые обороты, формат подписи. Deepfake BEC атаки с использованием AI характеризуются высокой формальностью при попытке имитировать неформальный стиль CEO или CFO - модель «знает» как должен звучать руководитель, но не знает конкретных привычек конкретного человека.
Поведенческая аналитика и UEBA для защиты от AI-генерируемых атак
По рекомендациям Rapid7, эффективная защита требует visibility across identity, endpoint, network и cloud environments. На практике:- UEBA (User and Entity Behavior Analytics) - фиксация аномалий в паттернах email-коммуникации. Сотрудник, обычно отправляющий 10 писем в день, вдруг шлёт 200 уникальных - повод для расследования, даже если каждое письмо выглядит легитимным
- Корреляция с TI-фидами - мониторинг появления новых malicious LLM через MISP или коммерческие платформы (Recorded Future, Kaspersky DFI). Новый инструмент = новые IoC: домены, IP-адреса, Telegram-каналы распространения. Обсуждение свежих IoC по malicious LLM и обмен Sigma-правилами ведётся в профильных сообществах - в тематических тредах на форуме codeby.net такие разборы появляются регулярно
- Мониторинг underground-площадок - отслеживание упоминаний вашей компании, домена или ключевых сотрудников в контексте AI-powered таргетинга
Практический чеклист: защита от AI-powered кибератак 2026
Чеклист построен на синтезе рекомендаций Unit 42, Rapid7 и практики мониторинга darknet AI marketplace.Немедленные меры:
- Настройте мониторинг DNS-запросов к доменам LLM-провайдеров из неожиданных сегментов сети
- Обновите правила email-security: добавьте анализ статистики текста (перплексия, burstiness) помимо традиционного content filtering
- Проведите обучение сотрудников с примерами AI-генерированного фишинга - по данным Rapid7, тренинг должен включать образцы, отличающиеся от традиционного фишинга именно лингвистической точностью, а не кривизной
- Внедрите DMARC/DKIM/SPF в enforce-режиме. AI генерирует идеальный текст, но не подделывает криптографические подписи
- Сегментируйте сеть так, чтобы обращения к AI API из production-сегментов проходили через прокси с полным логированием
- Интегрируйте TI по darknet AI marketplace в SIEM: новый домен клона WormGPT = IoC для блокировки
- Рассмотрите AI-powered email security решения с модулями AI-detection (Abnormal Security, Proofpoint) и UEBA-платформы с кастомизацией baseline
- Если атакующий использует locally-hosted open-source модель (Llama, Mixtral без RLHF) - сетевых индикаторов нет, обращений к внешним API нет. Единственная линия детекции - анализ самого контента (email, код) на признаки AI-генерации
- Если wrapper-сервис ротирует API-ключи и IP - стандартные IoC устаревают быстро
- Если фишинговое письмо доставлено через скомпрометированную легитимную учётку - email authentication (SPF/DKIM/DMARC) не спасёт, нужна именно поведенческая аналитика на уровне содержания
Но расслабляться рано. Реальная угроза в том, что любая 7B-параметровая open-source модель с убранным RLHF-слоем выдаёт ровно тот же результат - бесплатно, локально, без логов и телеметрии. Рынок брендированных dark LLM сдуется так же, как сдулись первые RaaS-платформы, уступив место более зрелым операторам. А open-source AI-powered атаки никуда не денутся, потому что не требуют централизованной инфраструктуры для takedown.
Для SOC это значит одно: хватит охотиться за конкретными инструментами - начинайте детектировать паттерны. Статистику текста, аномалии в email-трафике, нехарактерные обращения к API. Signature-based подход к AI-powered атакам мёртв по определению - каждый output модели уникален. Побеждает только поведенческая аналитика. Если хотите отработать детект AI-генерируемого фишинга и разбор malicious LLM на практике - на курсе WAPT эту цепочку проходят в модуле по social engineering с реальными лабами.