Винтажный микрофон с треснувшей хромированной решёткой лежит на антистатическом коврике, внутри капсулы виден встроенный чип с миниатюрной платой. На корпусе лазерная гравировка с надписью про инъе...


Заявленный 79–96% success rate на 13 современных Large Audio-Language Models - Kimi-Audio, Qwen2-Audio, GLM-4-Voice, Gemma-3n, Voxtral-Mini, Phi-4-Multimodal (данные препринта arXiv:2507.05587, без peer review; независимо не воспроизведено). Коммерческие голосовые агенты, которые, по утверждению авторов, работают на инфраструктуре Mistral AI и Microsoft Azure, выполняют несанкционированные tool-вызовы по командам, вплетённым в фоновый звук. Пользователь слышит лёгкую реверберацию - и всё. Эти цифры из работы AudioHijack (arXiv:2507.05587, 2025) обозначают точку, в которой аудио-инъекции промптов в LLM перестали быть теоретической угрозой и превратились в атаку с задокументированной методологией.

В русскоязычном сегменте тема prompt injection до сих пор крутится вокруг текста - прямые, косвенные, сохранённые инъекции. Аудио-модальность как самостоятельный attack surface не разбиралась ни в одном техническом материале. Я решил это исправить: от threat model и архитектуры атаки до воспроизводимого эксперимента и того, почему существующие защиты пока не работают.

Зачем adversary аудио-канал: бизнес-логика атаки на голосовых AI-агентов​

Цепочка эксплуатации выстраивается так: атакующий готовит аудиофайл с adversarial perturbation - скрытыми инструкциями, не воспринимаемыми на слух. Файл попадает в аудио-поток, обрабатываемый LALM (Large Audio-Language Model) - через голосового ассистента, запись совещания, подкаст, фоновую музыку в помещении. Модель извлекает скрытую инструкцию, интерпретирует её как легитимную пользовательскую команду и выполняет: инициирует tool-вызов, отправляет поисковый запрос, раскрывает данные из контекста или блокирует выполнение задачи пользователя. Подробнее - в нашем руководстве по безопасность llm приложений.

Импакт определяется тем, к чему агент имеет доступ. Если голосовой ассистент подключён к email, календарю, корпоративным API - атакующий через скрытую аудио-команду получает каскад возможностей: от утечки переписки до инициации транзакций. AudioHijack задокументировал 6 категорий вынужденного misbehavior: отказ от выполнения задачи пользователя, генерация вредоносного контента, утечка системного промпта, несанкционированные tool-вызовы, социальная инженерия через ответ агента и нарушение guardrails. Каждая категория верифицирована экспериментально на множестве моделей. Это воспроизведённые attack scenarios, а не теоретический перечень.

Почему текстовые защиты бесполезны против атак через фоновый шум на LLM​

По OWASP LLM01:2025 (Prompt Injection), мультимодальные инъекции - через изображения, аудио и видео - обходят текстовые фильтры. Но проблема глубже, чем filter evasion.

Защитные механизмы текстовых LLM оперируют паттернами в символьном пространстве: input sanitization сканирует строки на подозрительные конструкции, safety alignment учит модель отказывать на вредоносные текстовые запросы, prompt injection классификаторы анализируют естественный язык. Мультимодальные модели ломают эту предпосылку полностью. Vision-language модели кодируют изображения в visual embeddings, аудио-модели конвертируют речь в акустические представления - и эти представления влияют на генерацию ответа до того, как текстовые фильтры получат хоть что-то для анализа.

Christian Schneider в разборе мультимодальных prompt injection прямо указывает: safety alignment разрабатывался преимущественно для текстовой модальности, визуальные и аудио-входы остались с более слабыми guardrails по умолчанию. Модели не «не могут» защищаться - они никогда не обучались защищаться от инструкций, приходящих в виде звуковых волн.

NHIMG в разборе аудио-атак на Gemini формулирует ещё жёстче: текстовые guardrails предполагают, что транскрипт - верное представление входа. Рекомендация оттуда: «treat voice as a distinct trust boundary, not just another prompt format». Когда adversarial audio содержит скрытые команды, не отражаемые в транскрипте, или намеренно искажает транскрипцию, текстовый фильтр видит «чистый» ввод, а модель уже получила вредоносную инструкцию через акустические фичи.

Если ваш pipeline защиты от инъекции промптов через звук выглядит как audio → ASR → text filter → LLM, между ASR и LLM - дыра, в которую помещается полноценная атака.

Модель угроз: prompt injection в мультимодальных моделях через аудио

AudioHijack формализует модель угроз со следующими ограничениями:
  1. Audio-data-only access. Adversary - третья сторона, не пользователь. Атакующий не контролирует текстовый ввод, системный промпт или конфигурацию модели. Единственный канал воздействия - аудио-данные.
  2. User-in-the-loop. Атака выполняется в присутствии пользователя. Adversarial perturbation должна быть перцептуально незаметна - пользователь не должен распознать скрытую команду.
  3. Context-agnostic. Атакующий не знает заранее, что скажет пользователь. Adversarial perturbation должна срабатывать при произвольном пользовательском контексте.
Это принципиально отличает аудио-инъекцию от более ранних ultrasonic-атак (DolphinAttack и подобные), где скрытые команды передавались на ультразвуковых частотах, но с минимальным контролем над сложным поведением модели. AudioHijack управляет семантикой ответа LALM, а не просто активирует голосового ассистента.

Чем аудио-инъекция отличается от voice-based jailbreak LLM​

В audio jailbreak атакующий сам является пользователем и полностью контролирует вход: jailbreak-промпт, вредоносную речь, текстовые инструкции. Задача сводится к обходу safety alignment - перенос текстового jailbreak в аудио-канал через vocalization или signal augmentation.

В auditory prompt injection adversary ограничен аудио-каналом без контроля над пользовательским контекстом. Одновременно более сложная и более опасная атака. Сложная - потому что требует генерализации по незнакомым контекстам при сохранении незаметности. Опасная - потому что пользователь не подозревает об атаке и доверяет ответам агента.

До AudioHijack существовала единственная proof-of-concept работа по аудио-инъекции в omnimodal LLM с unconstrained perturbations - ограниченная скрытность и генерализация. AudioHijack - первый систематический фреймворк, решающий все три ограничения threat model одновременно.

AudioHijack: фреймворк adversarial audio атак на нейросети​

Архитектура AudioHijack решает три задачи: универсальность по гетерогенным архитектурам LALM, генерализацию по неизвестным контекстам и перцептуальную скрытность adversarial perturbation.

Стратегия инъекции и sampling-based gradient estimation​

AudioHijack использует output-level injection strategy: adversarial audio манипулирует token-level predictions модели, вынуждая LALM генерировать предопределённые инструкции в начале своего ответа. Модель затем интерпретирует собственный output как пользовательские команды и действует по ним. Подход элегантно обходит modality gap между аудио и текстом: вместо попытки «впихнуть» текстовую инструкцию напрямую через аудио-канал, атака заставляет модель саму произвести нужную текстовую последовательность.

Тут стоит остановиться и оценить изящество: adversary не пытается протащить текст через звук (что грубо и ненадёжно), а заставляет модель саму написать нужный текст. Модель сама себя обманывает.

Техническая сложность - неоднородность архитектур интеграции аудио и текста:

Тип интеграцииПринципПримеры моделейПроблема для adversary
Дискретные токеныАудио квантуется через neural audio codecsGLM-4-VoiceArgmax не дифференцируем
Continuous embeddingsАудио кодируется в непрерывные представленияQwen2-AudioModality gap
ГибридныеКомбинация обоих подходовPhi-4-MultimodalДва барьера одновременно

Дискретная токенизация блокирует обратное распространение градиента - hard token selection (argmax) не дифференцируема. AudioHijack решает это через sampling-based gradient estimation: замену argmax на дифференцируемую sampling-операцию (Gumbel-Softmax). Это позволяет end-to-end adversarial optimization через весь pipeline модели независимо от архитектуры токенизации.

В формальных терминах: найти perturbation δ к carrier audio x, такую что LALM(x + δ, context) генерирует target instruction T, при ограничении ||δ|| ≤ ε для перцептуальной незаметности. Задача решается итеративной gradient-based оптимизацией по δ.

[Применимо: исследовательский контекст, white-box доступ к весам модели. В чистом black-box сценарии прямая оптимизация невозможна - остаётся transferability.]

Контекстная генерализация через attention supervision​

Наивная оптимизация adversarial audio на одном контексте приводит к catastrophic overfitting: perturbation работает только при конкретной пользовательской фразе. Анализ AudioHijack показал причину - attention competition: токены пользовательского контекста «перетягивают» внимание модели, подавляя влияние adversarial audio.

Решение - комбинация двух техник:

Multi-context training. Оптимизация perturbation одновременно на множестве различных пользовательских контекстов. На каждом шаге градиентного спуска семплируется случайный контекст из обучающего набора; градиент adversarial loss усредняется по контекстам.

Attention supervision. Дополнительный loss-компонент, который явно штрафует модель за низкий attention weight на токенах adversarial audio. Это направляет внимание модели на adversarial часть входа, обеспечивая стабильное декодирование target instruction вне зависимости от того, что сказал пользователь.

Именно эта комбинация, по данным авторов (независимо не подтверждено), даёт success rate 79–96% на unseen contexts - контекстах, которые никогда не использовались при оптимизации. Attention visualization из работы подтверждает: без supervision модель распределяет внимание равномерно; с supervision - концентрирует его на adversarial audio. По сути, perturbation «перекрикивает» пользователя на уровне attention, оставаясь при этом неслышимой.

Скрытые команды в аудио для ИИ: convolutional blending​

Перцептуальная скрытность - третье критическое ограничение threat model. Прямое additive perturbation к carrier audio создаёт слышимые артефакты: щелчки, шипение, неестественные тональные компоненты. Предыдущие работы по adversarial examples в аудио ограничивались ε-bounded perturbations с фиксированным бюджетом по Lp-норме - компромисс между эффективностью и незаметностью. Более ранний proof-of-concept по аудио-инъекции в omnimodal LLM использовал unconstrained perturbations - слышимые невооружённым ухом.

AudioHijack предлагает convolutional perturbation blending - метод, перераспределяющий энергию perturbation во времени и частоте через обучаемые kernels, имитирующие естественную реверберацию. Вместо additive noise фреймворк генерирует convolution filter: при свёртке с carrier audio создаётся «эффект помещения». Слушатель воспринимает это как запись в комнате с определённой акустикой, а не как искажённый сигнал.

Технически: adversarial perturbation δ формируется как разность свёртки carrier audio x с обучаемым impulse response h и оригинала: δ = conv(x, h) - x. Kernels h оптимизируются совместно с adversarial loss, автоматически балансируя attack effectiveness и perceptual quality. Результат: adversarial audio с SNR и PESQ (perceptual evaluation of speech quality) на уровне лёгкой комнатной реверберации. Спектрограммы adversarial и clean audio визуально неразличимы без специализированного анализа остатка (residual).

Это красивый ход с точки зрения DSP. Реверберация - настолько привычный акустический эффект, что мозг её фильтрует автоматически. А модель - нет.

Концептуальный эксперимент: adversarial perturbation для speech recognition (псевдокод)​

📚 Часть контента скрыта. Этот материал доступен участникам сообщества с рангом One Level или выше
Получить доступ просто — достаточно зарегистрироваться и проявить активность на форуме

), тензоры target_tokens и logits должны находиться на одном device, а обновление delta внутри PGD-цикла выполняется в контексте torch.no_grad() с последующим повторным включением requires_grad. Полный PGD-цикл итеративно минимизирует CTC loss между выходом модели на perturbed audio и target_tokens, проецируя perturbation на ε-шар (типично ε = 0.02 по L∞-норме, ~53 dB SNR).

Для верификации результатов - спектральный анализ residual между clean и adversarial audio:
Python:
# Спектральный анализ: ищем следы adversarial perturbation
import librosa, numpy as np
clean, sr = librosa.load("clean.wav", sr=16000)
adv, _ = librosa.load("adversarial.wav", sr=16000)
min_len = min(len(clean), len(adv))
residual = adv[:min_len] - clean[:min_len]
rms = np.sqrt(np.mean(residual**2))
centroid = np.mean(librosa.feature.spectral_centroid(y=residual, sr=sr))
# Низкий RMS + аномальный spectral centroid → маркер adversarial perturbation
Если residual имеет низкую RMS-энергию, но аномально высокий spectral centroid (энергия сосредоточена в высокочастотных областях) - это маркер целенаправленной perturbation, а не естественного шума. Естественный шум распределён по спектру более-менее равномерно; adversarial perturbation «прячется» в высокочастотной области, где маскирование слабее.

Ограничения и когда техника не работает​

Adversarial perturbation в описанном виде генерируется в white-box режиме - с доступом к весам и архитектуре целевой модели. В чистом black-box сценарии (только API, без градиентов) прямая оптимизация невозможна; остаётся transferability - perturbation, оптимизированная на open-source LALM, может сработать на проприетарной модели, но success rate существенно падает.

Дополнительные ограничения:
  • Вычислительные затраты. Оптимизация одного adversarial audio - от десятков минут до нескольких часов на GPU (зависит от числа контекстов для multi-context training). Это не «нажал кнопку - получил exploit».
  • Over-the-air деградация. При воспроизведении через динамик и записи микрофоном perturbation деградирует из-за акустических искажений канала. AudioHijack тестировал digital injection - файл подаётся напрямую в pipeline. Over-the-air - отдельная инженерная задача, пока не решённая в этой работе.
  • Streaming. Модели с real-time streaming inference обрабатывают аудио чанками; малый chunk size (<500 мс) может разрушить temporal structure perturbation.
  • Adversarial training. Модели, обученные на adversarial examples, потенциально устойчивее - но для аудио-модальности это пока не проверено в масштабе.

Атаки на голосовых ассистентов с ИИ: результаты на коммерческих агентах​

AudioHijack оценивался на 13 LALM, покрывающих весь спектр архитектур - от крупных моделей (Kimi-Audio, Qwen2-Audio, GLM-4-Voice) до lightweight (Gemma-3n, Voxtral-Mini, Phi-4-Multimodal). Все оказались уязвимы к adversarial audio атакам на нейросети. Заявленный средний success rate по 6 категориям misbehavior - 79–96% на unseen contexts при minimal perceptual degradation (данные авторов препринта, независимо не воспроизведено).

Вывод: уязвимость голосовых интерфейсов LLM фундаментальна и не привязана к конкретной архитектуре интеграции аудио и текста. Дискретные, непрерывные и гибридные схемы одинаково подвержены hijacking. Ни одна из 13 моделей не показала принципиальной устойчивости.

Практически более значимый результат - заявленная в AudioHijack (arXiv:2507.05587, Section 5.3, независимо не подтверждено) атака на production-grade voice agents, которые, по утверждению авторов, используют инфраструктуру Mistral AI и Microsoft Azure. Локально сгенерированный adversarial audio, согласно авторам, заставлял агентов выполнять несанкционированные действия через single и cascaded tool calls, включая выдачу чувствительных поисковых запросов от имени пользователя. Безопасность AI-агентов с аудиовходом - не академическая задача, а production-проблема с конкретным exploit path.

Защита мультимодальных LLM от атак: текущие подходы и ограничения​

Контрмеры против аудио-инъекций сейчас на ранней стадии - примерно как текстовые prompt injection защиты в 2022–2023 годах. Зоопарк подходов есть, зрелых решений - нет.

МетодПринципКогда использоватьКогда НЕ использовать
Audio-native inspectionАнализ waveform до транскрипции: anomaly detection на raw signalProduction pipelines с критичными actionsLow-latency realtime диалог (добавляет задержку)
Transcript/signal separationДва независимых фильтра: один по транскрипту, другой по raw audioЛюбые multimodal pipelinesОграниченные вычислительные ресурсы
Action restriction для voiceДополнительная верификация перед tool-вызовами из voice channelАгенты с tool-use capabilitiesСценарии, где voice - единственный интерфейс
In-context defenseИнструкция в системном промпте «игнорируй скрытые аудио-команды»Быстрая mitigation без изменений pipelineАдаптивный adversary (легко обходится)
Self-reflectionМодель проверяет свой ответ на признаки injectionВторой слой защиты поверх основногоLatency-critical applications

NHIMG в практическом руководстве по аудио-атакам выделяет три приоритета:
  1. Инспекция аудио до транскрипции - выделенный слой, оценивающий waveform anomalies, signal overlap и engineered muting до того, как транскрипт попадёт в policy engine.
  2. Разделение transcript policy и signal policy - два независимых чека, чтобы benign transcript не мог override подозрительный audio pattern.
  3. Ограничение downstream actions из voice channels - дополнительная верификация при любых привилегированных действиях, tool-вызовах или обращениях к внешним сервисам, инициированным через голос.

Ограничения текущих контрмер​

Ни один из описанных методов не решает проблему полностью. In-context defense (инструкция в промпте) обходится адаптивным adversary - AudioHijack тестировал этот подход и включил его в перечень оценённых countermeasures (Appendix C работы). Self-reflection detection (Appendix D) добавляет latency и не гарантирует обнаружения тонких perturbation. Audio-native inspection требует обучения детектора на adversarial примерах - классическая arms race: каждый новый метод blending потенциально обходит текущий детектор.

Фундаментальная проблема: safety alignment для аудио-модальности требует обучающих данных с adversarial audio примерами, которых пока недостаточно в масштабе. Текстовый alignment накапливался годами; аудио - в самом начале этого пути. И это bottleneck, который не решается быстро.

Маппинг на [URL="https://codeby.net/threads/pentest-llm-i-ai-sistem-ot-owasp-llm-top-10-do-regulyatornogo-mappinga-nakhodok.94547/"]MITRE ATT&CK и OWASP LLM Top 10[/URL] (авторская интерпретация)​

Дисклеймер: маппинг ниже - авторская аналитическая интерпретация, не официальное соответствие MITRE ATT&CK для аудио-инъекций. MITRE ATT&CK сейчас не содержит специализированных техник для adversarial audio атак на LLM. T-коды используются по аналогии.
  • T1027 Obfuscated Files or Information (Defense Evasion / Stealth) - adversarial perturbation маскирует вредоносные инструкции под естественную реверберацию, делая payload перцептуально неотличимым от нормального аудио.
  • T1656 Impersonation (Defense Evasion / Stealth) - инжектированные инструкции имперсонируют легитимные пользовательские команды: модель «считает», что выполняет запрос пользователя.
  • Gap: отсутствие подходящей техники для passive input processing (Execution) - в сценарии AudioHijack adversarial аудио обрабатывается системой автоматически (фоновая музыка, подкаст, аудиопоток) без осознанного действия пользователя. T1204 User Execution требует активного user action, что не соответствует сценарию. T1190 Exploit Public-Facing Application ближе по логике (эксплуатация входного канала), но описывает сетевые сервисы, а не аудио-вход. Passive processing adversarial media content без user action - gap существующей таксономии MITRE ATT&CK.
  • T1005 Data from Local System (Collection) - hijacked агент, выполняя несанкционированные tool-вызовы, может обращаться к локальным данным и передавать их adversary.
  • T1123 Audio Capture (Collection) - напрямую релевантна аудио-вектору: adversary может использовать hijacked агент для захвата аудио-потока (микрофон, записи), получая доступ к конфиденциальным разговорам через скомпрометированный голосовой интерфейс.
По классификации OWASP LLM Top 10 (2025):
  • LLM01:2025 Prompt Injection - аудио-инъекция - подкласс indirect prompt injection, где вредоносные инструкции доставляются через аудио-модальность вместо текста.
  • Примечание по LLM04:2025 Data and Model Poisoning - LLM04 описывает манипуляцию данными на этапе training/fine-tuning/embedding, а не на inference-время. Adversarial audio perturbation в AudioHijack - inference-time adversarial example, а не data poisoning, и корректно классифицируется исключительно через LLM01:2025. Маппинг на LLM04 неприменим.
Существующие таксономии не полностью покрывают аудио-вектор. Ни MITRE ATT&CK, ни OWASP пока не выделяют аудио-инъекцию как самостоятельную технику. Это gap, и я ожидаю, что его закроют в ближайшие пару ревизий - но пока работаем с тем, что есть.



Аудио-инъекции промптов в LLM - качественно иная атака с другой моделью угроз, другим пространством оптимизации и другим набором ограничений для adversary. Не просто «текстовый prompt injection, но через микрофон».

Меня тревожит конкретный тренд: AudioHijack заявляет success rate 79–96% на 13 моделях (препринт, не воспроизведённый независимо), production-агенты крупнейших вендоров, по неподтверждённым данным авторов, выполняют несанкционированные действия - а в индустрии до сих пор нет ни одного зрелого фреймворка аудио-защиты. Текстовый alignment выстраивался четыре года, аудио-alignment не существует в сопоставимом масштабе. Вендоры наращивают capabilities голосовых агентов (tool use, cascaded calls, RAG с аудио-источниками) быстрее, чем security community успевает исследовать attack surface.

Я ожидаю, что в ближайшие 12–18 месяцев adversarial audio станет таким же commoditized вектором, как текстовые jailbreak-промпты: open-source инструменты для генерации, готовые perturbation для популярных LALM, automated pipelines. Convolutional blending делает детекцию нетривиальной даже для специализированных систем. Over-the-air доставка пока остаётся открытой проблемой, но это вопрос инженерии, а не фундаментального ограничения.

И отдельный вопрос, который мало кто поднимает: как формировать safety alignment для аудио, если нет dataset adversarial audio примеров сопоставимого масштаба с текстовыми? Red teaming аудио-моделей требует специализированных навыков - DSP, adversarial ML, акустика - и людей с таким набором компетенций на порядки меньше, чем текстовых red teamer'ов. Этот bottleneck определит скорость закрытия уязвимостей голосовых интерфейсов LLM на ближайшие годы. Если у вас есть опыт на стыке DSP и adversarial ML - сейчас хорошее время копнуть в эту тему.
 
Мы в соцсетях:

Взломай свой первый сервер и прокачай скилл — Начни игру на HackerLab

🚀 Первый раз на Codeby?
Гайд для новичков: что делать в первые 15 минут, ключевые разделы, правила
Начать здесь →
🧭 Навигатор · ИБ 2026
Не знаешь, какой трек твой?
5 направлений ИБ, реальные зарплаты и точка входа для каждого — в одном треде.
JuniorSenior+
100K → 600K+ ₽ /мес
Открыть навигатор →
🔴 Свежие CVE, 0-day и инциденты
То, о чём ChatGPT ещё не знает — обсуждаем в реальном времени
Threat Intel →
💼 Вакансии и заказы в ИБ
Pentest, SOC, DevSecOps, bug bounty — работа и проекты от проверенных компаний
Карьера в ИБ →

HackerLab