prompt injection атака

  1. Сергей Попов

    Статья Атаки на AI-системы в пентесте: prompt injection, jailbreak и adversarial ML

    По данным JailbreakBench и HarmBench, ASR jailbreak-атак на flagship-модели - GPT-4, Claude - превышает 80%. Тестировали на корпусах из сотен adversarial промптов, собранных с GitHub, Reddit, Discord и из академических датасетов. Production-конфигурации, safety-фильтры включены. Эти цифры -...
  2. Сергей Попов

    Статья Пентест LLM и AI-систем: от OWASP LLM Top 10 до регуляторного маппинга находок

    На проекте по тестированию банковского чат-бота, построенного на RAG-архитектуре, системный промпт и API-ключи к трём внутренним микросервисам удалось вытащить за сорок минут - через комбинацию прямой prompt injection и манипуляции контекстным окном. Ни Burp Suite, ни Nuclei, ни OWASP ZAP ничего...
  3. Сергей Попов

    Статья Атаки на LLM системы: от prompt injection до компрометации AI-агента

    По данным adversarial-исследований на arXiv, Attack Success Rate (ASR) для frontier-моделей вроде GPT-4 и Claude 2 достигал 80-90% при определённых категориях промптов и продвинутых техниках - roleplay, logic traps, encoding, multi-turn. Другие бенчмарки (Zou et al. 2023, HarmBench...