model stealing атаки на llm

  1. Сергей Попов

    На проверке Кража inference-time harness в мультиагентных LLM-системах: методология извлечения и PoC

    Одна и та же frontier-модель. Идентичный payload. 0% Attack Success Rate на одном канале инъекции, 100% - на другом. Этот результат (воспроизводимый в нескольких препринтах 2024–2025 годов по kill-chain анализу prompt injection в мультиагентных системах) ломает привычную картину: реальная...