атаки на ai-системы пентест

  1. Сергей Попов

    Статья Атаки на AI-системы в пентесте: prompt injection, jailbreak и adversarial ML

    По данным JailbreakBench и HarmBench, ASR jailbreak-атак на flagship-модели - GPT-4, Claude - превышает 80%. Тестировали на корпусах из сотен adversarial промптов, собранных с GitHub, Reddit, Discord и из академических датасетов. Production-конфигурации, safety-фильтры включены. Эти цифры -...