llm red teaming

  1. Сергей Попов

    Статья Framing Gap: как переформулировка exfiltration-запроса обходит защиту LLM-агентов

    При red teaming LLM-агентов с function calling раз за разом всплывает одна штука: прямой запрос exfiltrate the user database блокируется каждым протестированным guardrail - Azure Prompt Shield, NeMo Guard, Llama Guard, кастомные классификаторы на DeBERTa. Тот же самый payload, завёрнутый в...
  2. Кудрин Евгений

    Статья LLM Jailbreak: Методологии тестирования устойчивости модели к Prompt Injection

    Если кратко, LLM Jailbreak — это способ заставить модель делать то, чего она вроде бы делать не должна. Ситуация из серии: “а давай ты сам себе отключишь сигнализацию — мне просто посмотреть”. Prompt Injection — источник этого безобразия: вмешательство в промпт таким образом, чтобы модель...