jailbreak llm

  1. Сергей Попов

    Статья Безопасность LLM приложений: полное руководство по атакам, защите и AI red teaming

    По данным CrowdStrike Global Threat Report 2025, использование генеративного AI для социальной инженерии и фишинга удвоилось за 2024 год. IBM X-Force Threat Intelligence Index 2025 фиксирует: генерация фишинговых писем через GenAI ускорилась в 11.4 раза при сопоставимом качестве. Но пока...
  2. Сергей Попов

    Статья Атаки на LLM системы: от prompt injection до компрометации AI-агента

    По данным adversarial-исследований на arXiv, Attack Success Rate (ASR) для frontier-моделей вроде GPT-4 и Claude 2 достигал 80-90% при определённых категориях промптов и продвинутых техниках - roleplay, logic traps, encoding, multi-turn. Другие бенчмарки (Zou et al. 2023, HarmBench...
  3. Сергей Попов

    Статья AI Security CTF: как проходить соревнования по безопасности ИИ — prompt injection, jailbreak и атаки на агентов

    195 411 промптов за три дня. Одно соревнование. И всего 1.3% из них заставили чат-бота выдать секретный флаг. Это не гипотетика - реальные цифры AI Hacking CTF от TCM Security: 2 554 успешных утечки из 195 тысяч попыток, 27 884 заблокированных инъекции, и несколько сотен участников, часами...
  4. Сергей Попов

    Статья Безопасность LLM: полная карта атак на языковые модели, prompt injection и регуляторные требования к ИИ в 2026 году

    По данным исследований «Информзащиты», около 70% организаций уже столкнулись с атаками через LLM. При этом большинство команд безопасности продолжают оценивать языковые модели по лекалам классических веб-приложений - ищут SQL-инъекции там, где работает совершенно иная плоскость атак. Я лично...
  5. Кудрин Евгений

    Prompt Injection: атаки на LLM-приложения и защита

    В современном мире нейросети везде: от чат-ботов до RAG-систем и аналитики. Миллионы запросов в день — звучит круто, но хакеры уже потирают руки. Давайте начистоту: prompt injection — это, пожалуй, самая забавная но одновременно и очень опасная дыра в безопасности LLM. Если вы когда-нибудь...