уязвимости языковых моделей

  1. Сергей Попов

    Статья Пентест LLM и AI-систем: от OWASP LLM Top 10 до регуляторного маппинга находок

    На проекте по тестированию банковского чат-бота, построенного на RAG-архитектуре, системный промпт и API-ключи к трём внутренним микросервисам удалось вытащить за сорок минут - через комбинацию прямой prompt injection и манипуляции контекстным окном. Ни Burp Suite, ни Nuclei, ни OWASP ZAP ничего...
  2. Сергей Попов

    Статья Атаки на LLM системы: от prompt injection до компрометации AI-агента

    По данным adversarial-исследований на arXiv, Attack Success Rate (ASR) для frontier-моделей вроде GPT-4 и Claude 2 достигал 80-90% при определённых категориях промптов и продвинутых техниках - roleplay, logic traps, encoding, multi-turn. Другие бенчмарки (Zou et al. 2023, HarmBench...