Металлическая планка кукловода с надписью «WormGPT T1588.007 WEAPONIZED LLM» держит на нитях марионетку в виде говорящего чат-пузыря, освещённую тёплой настольной лампой на тёмном фоне.


По данным Kaspersky Digital Footprint Intelligence, за 2023 год на underground-форумах зафиксировано 249 предложений по продаже jailbreak-промптов для языковых моделей. Продавец FraudGPT заявлял о 3000+ продажах при годовой подписке до $1700. Мониторя закрытые площадки и Telegram-каналы, вижу чёткий тренд: рынок weaponized LLM для кибератак проходит ту же эволюцию, что прошёл рынок RaaS пятью годами ранее - от кустарных поделок к коммерческим продуктам с тикет-системой и Telegram-ботом поддержки. Про сами инструменты пишут все. А вот как детектировать AI-генерируемые атаки на уровне SOC - тишина. Этот разрыв закрываем здесь.

Бизнес-логика атаки: зачем хакерам weaponized LLM​

Перед тем как лезть в архитектуру, зафиксируем: какую конкретную задачу злоумышленника решают WormGPT-подобные AI-инструменты в даркнете? Подробнее - в нашем подробном разборе безопасность llm атаки.

Они закрывают три узких места в цепочке атаки.

Языковой барьер. BEC-атаки (Business Email Compromise) традиционно требовали носителя языка или хорошего копирайтера. Генерация фишинговых писем с помощью AI убирает эту проблему - модель выдаёт грамматически чистый текст на любом языке, имитируя стиль конкретной компании. Исследователи SlashNext, тестировавшие WormGPT на задаче BEC-генерации, описали результаты как "unsettling" - пугающе убедительные (данные по InfoSecurity Europe). И тут я с ними согласен: когда модель за 30 секунд выдаёт письмо, неотличимое от реального CFO - это уже не игрушки.

Порог входа в разработку малвари. По данным Unit 42 (Palo Alto Networks), AI-инструменты для взлома позволяют low-skill атакующим генерировать функциональные скрипты на Python без глубокой экспертизы. Unit 42 вводит термин "AI-empowered script kiddies" - и это не гипербола. Скрипт-кидди с ChatGPT опаснее скрипт-кидди с форумным туториалом, просто потому что скорость итерации выросла на порядок.

Компрессия времени. Цикл подготовки атаки - исследование цели, создание фишинговой приманки, генерация tooling-кода - сжимается с дней до минут промптинга. По данным экспертов SecPost, подготовка кибернападений уже исчисляется часами, а не днями.

В терминах MITRE ATT&CK это соответствует тактике Resource Development: техника Artificial Intelligence (T1588.007) для получения AI-capabilities и Generate Content / Written Content (T1683, T1683.001) для производства контента атаки.

Три архитектуры нелегальных ChatGPT-аналогов для хакеров​

1788082344850.webp

Русскоязычные источники обычно сваливают все "даркнет-нейросети" в одну кучу. На практике - три принципиально разных подхода, и различие между ними критично для выбора стратегии детекции.

Fine-tuned модели: от WormGPT до KawaiiGPT​

Оригинальный WormGPT - канонический пример. По данным Unit 42, он построен на базе GPT-J 6B (open-source модель от EleutherAI, 2021 год) и дообучен на специализированных датасетах: код вредоносных программ, описания эксплойтов, шаблоны фишинга. Этические ограничения не снимались - они просто никогда не устанавливались, потому что fine-tuning шёл изначально на вредоносных данных.

Что отличает fine-tuned вредоносные модели:
  • Модель "из коробки" заточена под криминальные задачи
  • Не требует jailbreak-промптов - отказа от вредоносных запросов нет в её поведении
  • Качество выходных данных выше, чем у jailbroken mainstream-моделей, потому что модель обучена именно на этом домене
  • Затраты на создание значительные: нужны GPU-ресурсы, датасеты и ML-экспертиза
KawaiiGPT (описан в том же исследовании Unit 42) - ещё один представитель этого класса. Заявленные возможности: генерация скриптов для social engineering, lateral movement и data exfiltration, создание ransom note. Звучит как рекламный буклет, но сам факт специализации - показателен.

Wrapper-сервисы: jailbroken LLM как услуга​

Второй подход проще технически: оператор не обучает собственную модель, а проксирует запросы через mainstream LLM (ChatGPT, Gemini) с предустановленным jailbreak-промптом. По данным dexpose.io, такие сервисы используют prompt injection для обхода safety-фильтров, а не строят модель заново. На выходе - тот же ассистент без контентной модерации, только под капотом чужой API.

С точки зрения OWASP LLM Top 10 (2025), это прямая эксплуатация риска LLM01 - Prompt Injection: специально сформированный ввод изменяет поведение модели, обходя контроли безопасности.

Для SOC-инженера различие между fine-tuned и wrapper критично. Трафик wrapper-сервиса идёт к API легитимного провайдера (api.openai.com), что затрудняет блокировку на уровне сети. Fine-tuned модель живёт на собственной инфраструктуре злоумышленника - другой профиль трафика и другие IoC. Два разных зверя - два разных подхода к охоте.

Open-source модели без ограничений: Llama и Mixtral для атак​

Третий и самый неприятный тренд. По данным dexpose.io, примерно через шесть месяцев после хайпа WormGPT и FraudGPT threat intelligence команды зафиксировали сдвиг: злоумышленники переходили на бесплатные uncensored-версии open-source моделей вместо оплаты подписки на брендированные продукты. По информации SecPost, Nytheon AI построен на Llama и Gemma с предварительно снятыми этическими ограничениями. По данным Cato Networks (упомянутых SecurityLab), такие модификации не являются уязвимостью самих моделей Grok или Mixtral - речь идёт о злоупотреблении открытостью архитектуры.

Почему это опаснее всего:
  • Нулевая стоимость входа (модели доступны на HuggingFace)
  • Локальный запуск на consumer-grade GPU
  • Полное отсутствие логирования и телеметрии
  • Невозможность takedown - модель уже скачана
Отдельно стоит PoisonGPT - демонстрационный проект французской Mithrill Security. По данным InfoSecurity Europe, они модифицировали GPT-J с помощью алгоритма ROME (rank-one model editing) для инъекции ложных фактов. Разница в точности между оригинальной и "отравленной" моделью - всего 0.1% на бенчмарке ToxiGen. Отравление практически неотличимо от нормального поведения. Это не атакующий инструмент, а proof-of-concept, но он показывает: supply chain атаки через модели - не фантастика, а вопрос времени.

Экосистема darknet AI marketplace: FraudGPT WormGPT сравнение​

1788082456525.webp

Ценообразование и коммерческая модель​

Рынок AI-инструментов для взлома в даркнете работает по модели CaaS (Crime-as-a-Service). Верифицированные данные о ценообразовании (по материалам LevelBlue, InfoSecurity Europe и dexpose.io):

ПродуктБазовая модельЦена (месяц)Цена (год)Заявленный функционал
WormGPT v1GPT-J 6B60-100 EUR550 EURBEC, генерация малвари, фишинг
WormGPT v2Не раскрытаТолько годовая550 EUR (private build 5000 EUR)Улучшенная приватность, переключение моделей
FraudGPTНе раскрыта90-200 USD800-1700 USDФишинг-страницы, вредоносный код, поиск утечек, карты без VBV
WolfGPTPython-basedНет данныхНет данныхКриптографическая малварь, фишинг
XXXGPTНе раскрытаНет данныхНет данныхБотнеты, RAT, ATM-малварь, криптостилеры

FraudGPT позиционируется как инструмент "for fraudsters, hackers, scammers and like-minded individuals". По данным SecureOps, продавец заявлял о 3000+ подтверждённых продажах. Исследователи Netenrich (по InfoSecurity Europe) предполагали, что за FraudGPT и WormGPT может стоять одна группа. FraudGPT при этом фокусировался на краткосрочных high-volume атаках (фишинг), WormGPT - на долгосрочных (AI малварь на основе языковых моделей, ransomware).

Форум XSS, по данным LevelBlue, имеет выделенную секцию AI/ML, где обсуждаются способы атак на AI-модели, методы построения собственных GPT-систем и ресурсы по теме, включая ссылки на раздел MITRE, посвящённый атакам на AI.

Жизненный цикл и ротация брендов​

Момент, который упускают русскоязычные источники: рынок malicious AI крайне волатилен. По данным dexpose.io, брендированные подписочные инструменты живут около шести месяцев - после чего привлекают внимание правоохранителей или теряют клиентов из-за бесплатных open-source альтернатив.

Оригинальный разработчик WormGPT свернул проект в середине 2023 года, сославшись на негативную публичность. Но бренд продолжил жить: по данным Unit 42, WormGPT 4 продвигается через отдельный Telegram-канал и собственный сайт. Разработчики WormGPT 4 скрывают архитектуру и не раскрывают, используют ли fine-tuning или persistent jailbreaking. Позиционирование прямолинейное: "WORMGPT is your key to an AI without boundaries""WORMGPT - ваш ключ к ИИ без границ." (Unit 42).

EvilGPT, VenomGPT, MalwareGPT - многие из них, по данным dexpose.io, являются ребрендами или реселлерами, а не самостоятельными моделями. Часть инструментов - откровенный scam, нацеленный на самих злоумышленников: "tools that underdeliver on their marketing or are outright scams targeting the criminals who buy them""инструменты, которые не оправдывают ожиданий, заявленных в рекламе, или являются откровенными мошенническими схемами, нацеленными на преступников, которые их покупают." (dexpose.io). Скамят скамеров - ирония рынка.

AI-powered кибератаки в контексте MITRE ATT&CK​

Использование вредоносных LLM укладывается в конкретные техники MITRE ATT&CK. Этот маппинг - основа для построения детект-правил и threat hunting гипотез.

Resource Development (подготовка ресурсов):
Initial Access (первоначальный доступ):
Ключевое наблюдение: AI-powered кибератаки не создают новых TTP. Они ускоряют и масштабируют существующие. Модель угроз не меняется принципиально, но скорость генерации контента и объём атак растут на порядки. Существующие detection-фреймворки применимы - нужно адаптировать пороговые значения и добавить AI-специфичные индикаторы.

Как детектировать вредоносные LLM и AI-генерируемые атаки

📚 Часть контента скрыта. Этот материал доступен участникам сообщества с рангом One Level или выше
Получить доступ просто — достаточно зарегистрироваться и проявить активность на форуме

На что обращать внимание при анализе подозрительных email:

Статистические аномалии текста. LLM генерируют текст с более стабильной статистикой, чем человек. Неестественно равномерная длина предложений, отсутствие опечаток и стилистических "шумов", характерных для конкретного отправителя, высокая лексическая density при low perplexity - текст "слишком гладкий" для этого автора. Если ваш CFO обычно пишет "ок, сделай" и вдруг пришло письмо на три абзаца с идеальной пунктуацией - это повод задуматься.

Метаданные email. Несоответствие часового пояса отправки и рабочего расписания предполагаемого отправителя. Нетипичный X-Mailer или его отсутствие. Всплеск отправки однотипных, но лексически разнообразных писем с одного источника за короткий период.

Контентные паттерны. Отсутствие характерных для конкретного человека речевых паттернов: привычный сленг, устойчивые обороты, формат подписи. Deepfake BEC атаки с использованием AI характеризуются высокой формальностью при попытке имитировать неформальный стиль CEO или CFO - модель "знает" как должен звучать руководитель, но не знает конкретных привычек конкретного человека.

Поведенческая аналитика и UEBA для защиты от AI-генерируемых атак​

По рекомендациям Rapid7, эффективная защита требует visibility across identity, endpoint, network и cloud environments. На практике:
  • UEBA (User and Entity Behavior Analytics) - фиксация аномалий в паттернах email-коммуникации. Сотрудник, обычно отправляющий 10 писем в день, вдруг шлёт 200 уникальных - повод для расследования, даже если каждое письмо выглядит легитимным
  • Корреляция с TI-фидами - мониторинг появления новых malicious LLM через MISP или коммерческие платформы (Recorded Future, Kaspersky DFI). Новый инструмент = новые IoC: домены, IP-адреса, Telegram-каналы распространения. Обсуждение свежих IoC по malicious LLM и обмен Sigma-правилами ведётся в профильных сообществах - в тематических тредах на форуме codeby.net такие разборы появляются регулярно
  • Мониторинг underground-площадок - отслеживание упоминаний вашей компании, домена или ключевых сотрудников в контексте AI-powered таргетинга

Практический чеклист: защита от AI-powered кибератак 2026​

Чеклист построен на синтезе рекомендаций Unit 42, Rapid7 и практики мониторинга darknet AI marketplace.

Немедленные меры:
  • Настройте мониторинг DNS-запросов к доменам LLM-провайдеров из неожиданных сегментов сети
  • Обновите правила email-security: добавьте анализ статистики текста (перплексия, burstiness) помимо традиционного content filtering
  • Проведите обучение сотрудников с примерами AI-генерированного фишинга - по данным Rapid7, тренинг должен включать образцы, отличающиеся от традиционного фишинга именно лингвистической точностью, а не кривизной
Стратегические меры:
  • Внедрите DMARC/DKIM/SPF в enforce-режиме. AI генерирует идеальный текст, но не подделывает криптографические подписи
  • Сегментируйте сеть так, чтобы обращения к AI API из production-сегментов проходили через прокси с полным логированием
  • Интегрируйте TI по darknet AI marketplace в SIEM: новый домен клона WormGPT = IoC для блокировки
  • Рассмотрите AI-powered email security решения с модулями AI-detection (Abnormal Security, Proofpoint) и UEBA-платформы с кастомизацией baseline
Когда подход НЕ работает:
  • Если атакующий использует locally-hosted open-source модель (Llama, Mixtral без RLHF) - сетевых индикаторов нет, обращений к внешним API нет. Единственная линия детекции - анализ самого контента (email, код) на признаки AI-генерации
  • Если wrapper-сервис ротирует API-ключи и IP - стандартные IoC устаревают быстро
  • Если фишинговое письмо доставлено через скомпрометированную легитимную учётку - email authentication (SPF/DKIM/DMARC) не спасёт, нужна именно поведенческая аналитика на уровне содержания
Основная проблема с WormGPT, FraudGPT и всем этим зоопарком - не сами инструменты. Мониторя underground-площадки, вижу: значительная часть darknet AI marketplace - это scam. Ребренды, реселлеры, wrapper'ы поверх jailbroken ChatGPT с красивой страницей и Telegram-ботом для оплаты. По данным dexpose.io, рынок содержит "a substantial share of tools that underdeliver on their marketing or are outright scams targeting the criminals who buy them""Значительная часть инструментов не оправдывает ожиданий, заявленных в рекламе, или является откровенным мошенничеством, направленным против преступников, которые их покупают." - scam, нацеленный на самих же преступников.

Но расслабляться рано. Реальная угроза в том, что любая 7B-параметровая open-source модель с убранным RLHF-слоем выдаёт ровно тот же результат - бесплатно, локально, без логов и телеметрии. Рынок брендированных dark LLM сдуется так же, как сдулись первые RaaS-платформы, уступив место более зрелым операторам. А open-source AI-powered атаки никуда не денутся, потому что не требуют централизованной инфраструктуры для takedown.

Для SOC это значит одно: хватит охотиться за конкретными инструментами - начинайте детектировать паттерны. Статистику текста, аномалии в email-трафике, нехарактерные обращения к API. Signature-based подход к AI-powered атакам мёртв по определению - каждый output модели уникален. Побеждает только поведенческая аналитика. Если хотите отработать детект AI-генерируемого фишинга и разбор malicious LLM на практике - на курсе WAPT эту цепочку проходят в модуле по social engineering с реальными лабами.
 
Последнее редактирование модератором:
Мы в соцсетях:

Взломай свой первый сервер и прокачай скилл — Начни игру на HackerLab

🚀 Первый раз на Codeby?
Гайд для новичков: что делать в первые 15 минут, ключевые разделы, правила
Начать здесь →
🧭 Навигатор · ИБ 2026
Не знаешь, какой трек твой?
5 направлений ИБ, реальные зарплаты и точка входа для каждого — в одном треде.
JuniorSenior+
100K → 600K+ ₽ /мес
Открыть навигатор →
🔴 Свежие CVE, 0-day и инциденты
То, о чём ChatGPT ещё не знает — обсуждаем в реальном времени
Threat Intel →
💼 Вакансии и заказы в ИБ
Pentest, SOC, DevSecOps, bug bounty — работа и проекты от проверенных компаний
Карьера в ИБ →

HackerLab