атаки на self-evolving agents

  1. Сергей Попов

    На проверке SkillJack: отравление навыков LLM-агентов через pipeline самообучения

    Последние несколько месяцев я ковыряю experience-to-skill pipelines в агентных фреймворках - от Voyager-подобных архитектур до кастомных ReAct-цепочек с persistent skill library. Главный вопрос, который не давал покоя: при каких пороговых условиях отравленная траектория выживает после skill...