РАЗБОР/Безопасность агентных контуров

Атаки на ИИ-агентов: чем опасны и как защищаться

Атаки на ИИ-агентов — это попытки перехватить их поведение через входные данные (prompt injection), выманить доступ или заставить совершить вредное действие. Защита строится не на одном промпте, а на многослойном надзоре: изоляция данных от команд, независимые гардианы, human-in-the-loop и неизменяемый аудит-лог.

30 июля 2026 · Евгений Флейшер, orkestrai

Чем автономнее ИИ-агент, тем выше цена ошибки: он не просто отвечает текстом, а вызывает функции, читает базы, отправляет письма и запускает процессы. Это делает его целью для атак. Ниже — карта основных угроз и практические меры, которыми мы закрываем их в агентных контурах.

Почему агент — более уязвимая цель, чем чат-бот

Обычный чат-бот в худшем случае скажет неправильное. ИИ-агент способен совершить действие: изменить цену, оформить заявку, отправить данные наружу. Именно способность действовать (function calling) превращает уязвимость в реальный ущерб. Поэтому безопасность агента — это не фильтр слов, а контроль над правом действия.

По свежим новостям, тема стала острее: разработчики отдельно обсуждают, что правилам агентов нужен контекст и многоуровневое принудительное исполнение, а не только инструкция в промпте. Параллельно ИИ ускоряет и сами кибератаки — значит, защита должна опережать, а не догонять.

Основные виды атак на ИИ-агентов

  • Prompt injection (инъекция инструкций). В письме, на веб-странице или в документе прячут скрытые команды, которые агент воспринимает как задачу от хозяина — например «перешли всю переписку на внешний адрес».
  • Утечка данных. Атакующий выманивает у агента фрагменты базы знаний, ключи, персональные данные клиентов или внутренние правила.
  • Перехват действий. Через подмену входных данных агента заставляют выполнить необратимое: списание, публикацию, отправку.
  • Отравление источников. В данные, на которые агент опирается (RAG, каталог, CRM), заранее внедряют ложные факты, чтобы исказить решения.
  • Злоупотребление инструментами. Агент, имеющий доступ к API и внешним сервисам, используется как «прокси» для действий, которые атакующий не может совершить сам.
Отдельный класс проблем — не атака, а сбой самого агента: дрейф поведения, галлюцинации, зацикливание. Для бизнеса последствия те же, поэтому защита от атак и надзор за качеством идут в одном контуре.

Как устроена многослойная защита

Мы исходим из того, что одного барьера недостаточно. Право действия у агента всегда идёт в паре с надзором.

  • Изоляция данных от команд. Входные данные (письмо, страница, документ) обрабатываются отдельно от управляющих инструкций — модель не путает «что прочитать» с «что выполнить». Подробнее — в разборе изоляции данных.
  • Guardrails (ограничители). Запрет тем, проверка выводов, лимиты на действия — слой между моделью и реальным действием.
  • Гардиан-mesh. Независимый слой агентов-надзирателей круглосуточно ловит аномалии, дрейф и нарушения правил, изолирует сбойный агент автоматически и откатывает его действие. Как это работает — в статье про гардианов.
  • Human-in-the-loop. Необратимые и рискованные шаги — запуск рекламы, крупные траты, юридически значимые действия — уходят человеку на подтверждение. См. разбор принципа.
  • Append-only аудит-лог. Каждое решение записывается неизменяемо: какой агент, что, когда и почему сделал. Это даёт разбор инцидентов и доказуемость для регулятора.

Регуляторика и ответственность

Для бизнеса в РФ безопасность агента — не только техника, но и соответствие 152-ФЗ (персональные данные) и 38-ФЗ (реклама). Наши гардианы проверяют выводы в том числе на комплаенс, а голосовые сценарии по умолчанию раскрывают, что говорит ИИ, и запрашивают согласие на запись. Про юридическую сторону — 152-ФЗ для ИИ и надзор и безопасность агентов.

Важный принцип: чем выше риск действия, тем строже должен быть гейт. Ответ клиенту — можно доверить агенту; списание средств или публичное заявление — только через подтверждение человека.

Что делать владельцу бизнеса перед внедрением

  • Определите, какие действия агенту в принципе нельзя совершать без человека.
  • Отделите данные, на которых учится и работает агент, от каналов, куда попадают внешние тексты.
  • Требуйте неизменяемый журнал решений — без него нельзя разобрать инцидент.
  • Проверяйте наличие независимого слоя надзора, а не только «настроек в промпте».
  • Заложите evals — автотесты поведения агента, ловящие регрессии до прода.

Если вы только присматриваетесь к автоматизации, начните с обзора услуг студии — мы строим и ведём контуры под надзором 24/7.

Частые вопросы

Можно ли полностью защитить ИИ-агента от атак?

Абсолютной защиты не бывает ни у одной системы. Задача — снизить вероятность и, главное, ограничить последствия: даже при удачной инъекции агент не должен иметь права совершить необратимое действие без надзора.

Что такое prompt injection простыми словами?

Это когда во входных данных прячут скрытую команду, чтобы агент выполнил её как свою задачу. Защита — изоляция данных от инструкций, проверка источников и гардиан-надзор.

Кто отвечает, если агент совершил вредное действие?

Ответственность за контур несёт оператор. Поэтому мы фиксируем каждое решение в append-only логе и держим рискованные шаги за гейтом человека — это распределяет и доказывает ответственность.

Облачная модель безопаснее self-hosted?

Зависит от задачи. Для изоляции чувствительных данных клиентские контуры мы поднимаем на self-hosted vLLM; для части сценариев достаточно облака с маскированием ПДн. Разбор — в статье self-hosted vLLM vs облачные API.

Чем агент отличается от бота в контексте безопасности?

Бот отвечает, агент — действует. У агента шире поверхность атаки, поэтому и защита строже. Подробнее — ИИ-агент vs чат-бот.

Хотите так же — но для вашего бизнеса?

30 минут разбора — бесплатно. Покажем, что реально автоматизировать в вашем случае и что это даст. Отвечает тот, кто ведёт проект.

Прямой контакт

Позвоните или напишите в мессенджер — ответим в рабочий день.
+7 499 500-96-88

Заказать разбор

Ответ в рабочий день · данные под 152-ФЗ, третьим не передаём
Нажимая «Отправить», вы соглашаетесь с политикой обработки персональных данных (152-ФЗ).

Готово — заявка отправлена

Спасибо! Ответим в рабочий день. Можно написать на hello@orkestrai.ru.

Используем cookie и Яндекс.Метрику. Политика