безопасность ai-агентов

  1. Сергей Попов

    На проверке Host Header Injection уязвимость BadHost (CVE-2026-48710)

    Меняю заголовок на Host: target.internal/health?x= - тот же запрос, тот же HTTP-путь, но в ответе 200 OK с полным содержимым административной панели. Один символ / в значении Host обрушивает модель авторизации целиком. Это CVE-2026-48710 - Host Header Injection уязвимость в Starlette...
  2. Сергей Попов

    Статья Framing Gap: как переформулировка exfiltration-запроса обходит защиту LLM-агентов

    При red teaming LLM-агентов с function calling раз за разом всплывает одна штука: прямой запрос exfiltrate the user database блокируется каждым протестированным guardrail - Azure Prompt Shield, NeMo Guard, Llama Guard, кастомные классификаторы на DeBERTa. Тот же самый payload, завёрнутый в...
  3. Сергей Попов

    Статья SkillJack: отравление навыков LLM-агентов через pipeline самообучения

    Последние несколько месяцев я ковыряю experience-to-skill pipelines в агентных фреймворках - от Voyager-подобных архитектур до кастомных ReAct-цепочек с persistent skill library. Главный вопрос, который не давал покоя: при каких пороговых условиях отравленная траектория выживает после skill...