model extraction attack

  1. Сергей Попов

    Статья Кража inference-time harness в мультиагентных LLM-системах: методология извлечения и PoC

    Одна и та же frontier-модель. Идентичный payload. 0% Attack Success Rate на одном канале инъекции, 100% - на другом. Этот результат (воспроизводимый в нескольких препринтах 2024-2025 годов по kill-chain анализу prompt injection в мультиагентных системах) ломает привычную картину: реальная...
  2. Сергей Попов

    Статья CTF и машинное обучение: разбор атак на ML-модели в соревнованиях

    На PHDays 9 организаторы запустили AI CTF из шести задач - из 130 зарегистрировавшихся хотя бы один флаг сдали только 14 человек. Четырнадцать. Одна из задач, Prediction Challenge, предлагала загрузить модель в формате pickle на сервер-аналог Kaggle и набрать 1.0 точности на случайно...