jailbreak llm пентест
Всё по теме «jailbreak llm пентест» на форуме Codeby.net. Обсуждений: 1. Разборы, инструменты и практика по информационной безопасности.
-
Статья Атаки на AI-системы в пентесте: prompt injection, jailbreak и adversarial ML
По данным JailbreakBench и HarmBench, ASR jailbreak-атак на flagship-модели - GPT-4, Claude - превышает 80%. Тестировали на корпусах из сотен adversarial промптов, собранных с GitHub, Reddit, Discord и из академических датасетов. Production-конфигурации, safety-фильтры включены. Эти цифры -...- Сергей Попов
- Тема
- adversarial machine learning ai red teaming jailbreak llm пентест llm security тестирование owasp llm top 10 prompt injection атака атаки на ai-системы пентест тестирование безопасности llm
- Ответы: 0
- Раздел: Безопасность ИИ и LLM