Металлическая планка кукловода с надписью «WormGPT T1588.007 WEAPONIZED LLM» держит на нитях марионетку в виде говорящего чат-пузыря, освещённую тёплой настольной лампой на тёмном фоне.


По данным Kaspersky Digital Footprint Intelligence, за 2023 год на underground-форумах зафиксировано 249 предложений по продаже jailbreak-промптов для языковых моделей. Продавец FraudGPT заявлял о 3000+ продажах при годовой подписке до $1700. Мониторя закрытые площадки и Telegram-каналы, вижу чёткий тренд: рынок weaponized LLM для кибератак проходит ту же эволюцию, что прошёл рынок RaaS пятью годами ранее - от кустарных поделок к коммерческим продуктам с тикет-системой и Telegram-ботом поддержки. Про сами инструменты пишут все. А вот как детектировать AI-генерируемые атаки на уровне SOC - тишина. Этот разрыв закрываем здесь.

Бизнес-логика атаки: зачем хакерам weaponized LLM​

Перед тем как лезть в архитектуру, зафиксируем: какую конкретную задачу злоумышленника решают WormGPT-подобные AI-инструменты в даркнете? Подробнее - в нашем подробном разборе безопасность llm атаки.

Они закрывают три узких места в цепочке атаки.

Языковой барьер. BEC-атаки (Business Email Compromise) традиционно требовали носителя языка или хорошего копирайтера. Генерация фишинговых писем с помощью AI убирает эту проблему - модель выдаёт грамматически чистый текст на любом языке, имитируя стиль конкретной компании. Исследователи SlashNext, тестировавшие WormGPT на задаче BEC-генерации, описали результаты как «unsettling» - пугающе убедительные (данные по InfoSecurity Europe). И тут я с ними согласен: когда модель за 30 секунд выдаёт письмо, неотличимое от реального CFO - это уже не игрушки.

Порог входа в разработку малвари. По данным Unit 42 (Palo Alto Networks), AI-инструменты для взлома позволяют low-skill атакующим генерировать функциональные скрипты на Python без глубокой экспертизы. Unit 42 вводит термин «AI-empowered script kiddies» - и это не гипербола. Скрипт-кидди с ChatGPT опаснее скрипт-кидди с форумным туториалом, просто потому что скорость итерации выросла на порядок.

Компрессия времени. Цикл подготовки атаки - исследование цели, создание фишинговой приманки, генерация tooling-кода - сжимается с дней до минут промптинга. По данным экспертов SecPost, подготовка кибернападений уже исчисляется часами, а не днями.

В терминах MITRE ATT&CK это соответствует тактике Resource Development: техника Artificial Intelligence (T1588.007) для получения AI-capabilities и Generate Content / Written Content (T1683, T1683.001) для производства контента атаки.

Три архитектуры нелегальных ChatGPT-аналогов для хакеров​

Русскоязычные источники обычно сваливают все «даркнет-нейросети» в одну кучу. На практике - три принципиально разных подхода, и различие между ними критично для выбора стратегии детекции.

Fine-tuned модели: от WormGPT до KawaiiGPT​

Оригинальный WormGPT - канонический пример. По данным Unit 42, он построен на базе GPT-J 6B (open-source модель от EleutherAI, 2021 год) и дообучен на специализированных датасетах: код вредоносных программ, описания эксплойтов, шаблоны фишинга. Этические ограничения не снимались - они просто никогда не устанавливались, потому что fine-tuning шёл изначально на вредоносных данных.

Что отличает fine-tuned вредоносные модели:
  • Модель «из коробки» заточена под криминальные задачи
  • Не требует jailbreak-промптов - отказа от вредоносных запросов нет в её поведении
  • Качество выходных данных выше, чем у jailbroken mainstream-моделей, потому что модель обучена именно на этом домене
  • Затраты на создание значительные: нужны GPU-ресурсы, датасеты и ML-экспертиза
KawaiiGPT (описан в том же исследовании Unit 42) - ещё один представитель этого класса. Заявленные возможности: генерация скриптов для social engineering, lateral movement и data exfiltration, создание ransom note. Звучит как рекламный буклет, но сам факт специализации - показателен.

Wrapper-сервисы: jailbroken LLM как услуга​

Второй подход проще технически: оператор не обучает собственную модель, а проксирует запросы через mainstream LLM (ChatGPT, Gemini) с предустановленным jailbreak-промптом. По данным dexpose.io, такие сервисы используют prompt injection для обхода safety-фильтров, а не строят модель заново. На выходе - тот же ассистент без контентной модерации, только под капотом чужой API.

С точки зрения OWASP LLM Top 10 (2025), это прямая эксплуатация риска LLM01 - Prompt Injection: специально сформированный ввод изменяет поведение модели, обходя контроли безопасности.

Для SOC-инженера различие между fine-tuned и wrapper критично. Трафик wrapper-сервиса идёт к API легитимного провайдера (api.openai.com), что затрудняет блокировку на уровне сети. Fine-tuned модель живёт на собственной инфраструктуре злоумышленника - другой профиль трафика и другие IoC. Два разных зверя - два разных подхода к охоте.

Open-source модели без ограничений: Llama и Mixtral для атак​

Третий и самый неприятный тренд. По данным dexpose.io, примерно через шесть месяцев после хайпа WormGPT и FraudGPT threat intelligence команды зафиксировали сдвиг: злоумышленники переходили на бесплатные uncensored-версии open-source моделей вместо оплаты подписки на брендированные продукты. По информации SecPost, Nytheon AI построен на Llama и Gemma с предварительно снятыми этическими ограничениями. По данным Cato Networks (упомянутых SecurityLab), такие модификации не являются уязвимостью самих моделей Grok или Mixtral - речь идёт о злоупотреблении открытостью архитектуры.

Почему это опаснее всего:
  • Нулевая стоимость входа (модели доступны на HuggingFace)
  • Локальный запуск на consumer-grade GPU
  • Полное отсутствие логирования и телеметрии
  • Невозможность takedown - модель уже скачана
Отдельно стоит PoisonGPT - демонстрационный проект французской Mithrill Security. По данным InfoSecurity Europe, они модифицировали GPT-J с помощью алгоритма ROME (rank-one model editing) для инъекции ложных фактов. Разница в точности между оригинальной и «отравленной» моделью - всего 0.1% на бенчмарке ToxiGen. Отравление практически неотличимо от нормального поведения. Это не атакующий инструмент, а proof-of-concept, но он показывает: supply chain атаки через модели - не фантастика, а вопрос времени.

Экосистема darknet AI marketplace: FraudGPT WormGPT сравнение​

Ценообразование и коммерческая модель​

Рынок AI-инструментов для взлома в даркнете работает по модели CaaS (Crime-as-a-Service). Верифицированные данные о ценообразовании (по материалам LevelBlue, InfoSecurity Europe и dexpose.io):

ПродуктБазовая модельЦена (месяц)Цена (год)Заявленный функционал
WormGPT v1GPT-J 6B60-100 EUR550 EURBEC, генерация малвари, фишинг
WormGPT v2Не раскрытаТолько годовая550 EUR (private build 5000 EUR)Улучшенная приватность, переключение моделей
FraudGPTНе раскрыта90-200 USD800-1700 USDФишинг-страницы, вредоносный код, поиск утечек, карты без VBV
WolfGPTPython-basedНет данныхНет данныхКриптографическая малварь, фишинг
XXXGPTНе раскрытаНет данныхНет данныхБотнеты, RAT, ATM-малварь, криптостилеры

FraudGPT позиционируется как инструмент «for fraudsters, hackers, scammers and like-minded individuals» (данные dexpose.io). По данным SecureOps, продавец заявлял о 3000+ подтверждённых продажах. Исследователи Netenrich (по InfoSecurity Europe) предполагали, что за FraudGPT и WormGPT может стоять одна группа. FraudGPT при этом фокусировался на краткосрочных high-volume атаках (фишинг), WormGPT - на долгосрочных (AI малварь на основе языковых моделей, ransomware).

Форум XSS, по данным LevelBlue, имеет выделенную секцию AI/ML, где обсуждаются способы атак на AI-модели, методы построения собственных GPT-систем и ресурсы по теме, включая ссылки на раздел MITRE, посвящённый атакам на AI.

Жизненный цикл и ротация брендов​

Момент, который упускают русскоязычные источники: рынок malicious AI крайне волатилен. По данным dexpose.io, брендированные подписочные инструменты живут около шести месяцев - после чего привлекают внимание правоохранителей или теряют клиентов из-за бесплатных open-source альтернатив.

Оригинальный разработчик WormGPT свернул проект в середине 2023 года, сославшись на негативную публичность. Но бренд продолжил жить: по данным Unit 42, WormGPT 4 продвигается через отдельный Telegram-канал и собственный сайт. Разработчики WormGPT 4 скрывают архитектуру и не раскрывают, используют ли fine-tuning или persistent jailbreaking. Позиционирование прямолинейное: «WORMGPT is your key to an AI without boundaries» (Unit 42).

EvilGPT, VenomGPT, MalwareGPT - многие из них, по данным dexpose.io, являются ребрендами или реселлерами, а не самостоятельными моделями. Часть инструментов - откровенный scam, нацеленный на самих злоумышленников: «tools that underdeliver on their marketing or are outright scams targeting the criminals who buy them» (dexpose.io). Скамят скамеров - ирония рынка.

AI-powered кибератаки в контексте MITRE ATT&CK​

Использование вредоносных LLM укладывается в конкретные техники MITRE ATT&CK. Этот маппинг - основа для построения детект-правил и threat hunting гипотез.

Resource Development (подготовка ресурсов):
  • Artificial Intelligence (T1588.007) - приобретение доступа к AI-capabilities для подготовки атаки
  • Malware (T1587.001) - разработка AI-малвари и вредоносных скриптов с помощью LLM
  • Generate Content (T1683) - использование AI для генерации контента атаки
  • Written Content (T1683.001) - генерация фишинговых писем, BEC-сообщений, scam-скриптов
  • Upload Malware (T1608.001) - размещение AI-сгенерированной малвари на атакующей инфраструктуре
Initial Access (первоначальный доступ):
  • Spearphishing Attachment (T1566.001) - доставка AI-сгенерированного фишинга с вложением
  • Spearphishing Link (T1566.002) - доставка AI-сгенерированного фишинга со ссылкой на фишинговую страницу
Ключевое наблюдение: AI-powered кибератаки не создают новых TTP. Они ускоряют и масштабируют существующие. Модель угроз не меняется принципиально, но скорость генерации контента и объём атак растут на порядки. Существующие detection-фреймворки применимы - нужно адаптировать пороговые значения и добавить AI-специфичные индикаторы.

Как детектировать вредоносные LLM и AI-генерируемые атаки

📚 Часть контента скрыта. Этот материал доступен участникам сообщества с рангом One Level или выше
Получить доступ просто — достаточно зарегистрироваться и проявить активность на форуме

На что обращать внимание при анализе подозрительных email:

Статистические аномалии текста. LLM генерируют текст с более стабильной статистикой, чем человек. Неестественно равномерная длина предложений, отсутствие опечаток и стилистических «шумов», характерных для конкретного отправителя, высокая лексическая density при low perplexity - текст «слишком гладкий» для этого автора. Если ваш CFO обычно пишет «ок, сделай» и вдруг пришло письмо на три абзаца с идеальной пунктуацией - это повод задуматься.

Метаданные email. Несоответствие часового пояса отправки и рабочего расписания предполагаемого отправителя. Нетипичный X-Mailer или его отсутствие. Всплеск отправки однотипных, но лексически разнообразных писем с одного источника за короткий период.

Контентные паттерны. Отсутствие характерных для конкретного человека речевых паттернов: привычный сленг, устойчивые обороты, формат подписи. Deepfake BEC атаки с использованием AI характеризуются высокой формальностью при попытке имитировать неформальный стиль CEO или CFO - модель «знает» как должен звучать руководитель, но не знает конкретных привычек конкретного человека.

Поведенческая аналитика и UEBA для защиты от AI-генерируемых атак​

По рекомендациям Rapid7, эффективная защита требует visibility across identity, endpoint, network и cloud environments. На практике:
  • UEBA (User and Entity Behavior Analytics) - фиксация аномалий в паттернах email-коммуникации. Сотрудник, обычно отправляющий 10 писем в день, вдруг шлёт 200 уникальных - повод для расследования, даже если каждое письмо выглядит легитимным
  • Корреляция с TI-фидами - мониторинг появления новых malicious LLM через MISP или коммерческие платформы (Recorded Future, Kaspersky DFI). Новый инструмент = новые IoC: домены, IP-адреса, Telegram-каналы распространения. Обсуждение свежих IoC по malicious LLM и обмен Sigma-правилами ведётся в профильных сообществах - в тематических тредах на форуме codeby.net такие разборы появляются регулярно
  • Мониторинг underground-площадок - отслеживание упоминаний вашей компании, домена или ключевых сотрудников в контексте AI-powered таргетинга

Практический чеклист: защита от AI-powered кибератак 2026​

Чеклист построен на синтезе рекомендаций Unit 42, Rapid7 и практики мониторинга darknet AI marketplace.

Немедленные меры:
  • Настройте мониторинг DNS-запросов к доменам LLM-провайдеров из неожиданных сегментов сети
  • Обновите правила email-security: добавьте анализ статистики текста (перплексия, burstiness) помимо традиционного content filtering
  • Проведите обучение сотрудников с примерами AI-генерированного фишинга - по данным Rapid7, тренинг должен включать образцы, отличающиеся от традиционного фишинга именно лингвистической точностью, а не кривизной
Стратегические меры:
  • Внедрите DMARC/DKIM/SPF в enforce-режиме. AI генерирует идеальный текст, но не подделывает криптографические подписи
  • Сегментируйте сеть так, чтобы обращения к AI API из production-сегментов проходили через прокси с полным логированием
  • Интегрируйте TI по darknet AI marketplace в SIEM: новый домен клона WormGPT = IoC для блокировки
  • Рассмотрите AI-powered email security решения с модулями AI-detection (Abnormal Security, Proofpoint) и UEBA-платформы с кастомизацией baseline
Когда подход НЕ работает:
  • Если атакующий использует locally-hosted open-source модель (Llama, Mixtral без RLHF) - сетевых индикаторов нет, обращений к внешним API нет. Единственная линия детекции - анализ самого контента (email, код) на признаки AI-генерации
  • Если wrapper-сервис ротирует API-ключи и IP - стандартные IoC устаревают быстро
  • Если фишинговое письмо доставлено через скомпрометированную легитимную учётку - email authentication (SPF/DKIM/DMARC) не спасёт, нужна именно поведенческая аналитика на уровне содержания
Основная проблема с WormGPT, FraudGPT и всем этим зоопарком - не сами инструменты. Мониторя underground-площадки, вижу: значительная часть darknet AI marketplace - это scam. Ребренды, реселлеры, wrapper'ы поверх jailbroken ChatGPT с красивой страницей и Telegram-ботом для оплаты. По данным dexpose.io, рынок содержит «a substantial share of tools that underdeliver on their marketing or are outright scams targeting the criminals who buy them» - scam, нацеленный на самих же преступников.

Но расслабляться рано. Реальная угроза в том, что любая 7B-параметровая open-source модель с убранным RLHF-слоем выдаёт ровно тот же результат - бесплатно, локально, без логов и телеметрии. Рынок брендированных dark LLM сдуется так же, как сдулись первые RaaS-платформы, уступив место более зрелым операторам. А open-source AI-powered атаки никуда не денутся, потому что не требуют централизованной инфраструктуры для takedown.

Для SOC это значит одно: хватит охотиться за конкретными инструментами - начинайте детектировать паттерны. Статистику текста, аномалии в email-трафике, нехарактерные обращения к API. Signature-based подход к AI-powered атакам мёртв по определению - каждый output модели уникален. Побеждает только поведенческая аналитика. Если хотите отработать детект AI-генерируемого фишинга и разбор malicious LLM на практике - на курсе WAPT эту цепочку проходят в модуле по social engineering с реальными лабами.
 
Мы в соцсетях:

Взломай свой первый сервер и прокачай скилл — Начни игру на HackerLab

🚀 Первый раз на Codeby?
Гайд для новичков: что делать в первые 15 минут, ключевые разделы, правила
Начать здесь →
🧭 Навигатор · ИБ 2026
Не знаешь, какой трек твой?
5 направлений ИБ, реальные зарплаты и точка входа для каждого — в одном треде.
JuniorSenior+
100K → 600K+ ₽ /мес
Открыть навигатор →
🔴 Свежие CVE, 0-day и инциденты
То, о чём ChatGPT ещё не знает — обсуждаем в реальном времени
Threat Intel →
💼 Вакансии и заказы в ИБ
Pentest, SOC, DevSecOps, bug bounty — работа и проекты от проверенных компаний
Карьера в ИБ →

HackerLab