cot hijacking

  1. Сергей Попов

    На проверке EchoCoT: извлечение цепочек рассуждений LLM из black-box reasoning-моделей через API

    CoT Hijacking - атака из препринта 2025 года на arXiv - выдаёт 99% attack success rate на Gemini 2.5 Pro, 100% на Grok 3 mini и 94% на Claude 4 Sonnet (цифры из препринта, независимая верификация пока не проведена). Вектор один: длинные последовательности безобидных рассуждений перед вредоносным...