РАЗБОР/Безопасность агентных контуров

Атаки на ИИ-агентов: чем опасны и как защищаться

Атаки на ИИ-агентов — это попытки перехватить их поведение через входные данные (prompt injection), выманить доступ или заставить совершить вредное действие. Риск снижают несколькими слоями: изоляцией данных от команд, независимыми проверками, human-in-the-loop и защищённым журналированием. Ни один слой сам по себе не гарантирует безопасность.

30 июля 2026 · Евгений Флейшер, orkestrai

Слушать статью6 мин

Чем автономнее ИИ-агент, тем выше цена ошибки: он не просто отвечает текстом, а вызывает функции, читает базы, отправляет письма и запускает процессы. Это делает его целью для атак. Ниже — карта основных угроз и практические меры, которыми мы закрываем их в агентных контурах.

Что расширяет поверхность атаки

Риск определяет не ярлык «бот» или «агент», а выданные контуру права и связи: доступ к данным, function calling, запись в CRM, изменение цены, отправка сообщений и сохранённое состояние. Чат-интерфейс с такими инструментами имеет ту же поверхность атаки. Поэтому защита начинается не с фильтра слов, а с минимальных прав, изоляции, подтверждения рискованных действий и наблюдаемости каждого доступного маршрута.

По свежим новостям, тема стала острее: разработчики отдельно обсуждают, что правилам агентов нужен контекст и многоуровневое принудительное исполнение, а не только инструкция в промпте. Параллельно ИИ ускоряет и сами кибератаки — значит, защита должна опережать, а не догонять.

Основные виды атак на ИИ-агентов

  • Prompt injection (инъекция инструкций). В письме, на веб-странице или в документе прячут скрытые команды, которые агент воспринимает как задачу от хозяина — например «перешли всю переписку на внешний адрес».
  • Утечка данных. Атакующий выманивает у агента фрагменты базы знаний, ключи, персональные данные клиентов или внутренние правила.
  • Перехват действий. Через подмену входных данных агента заставляют выполнить необратимое: списание, публикацию, отправку.
  • Отравление источников. В данные, на которые агент опирается (RAG, каталог, CRM), заранее внедряют ложные факты, чтобы исказить решения.
  • Злоупотребление инструментами. Агент, имеющий доступ к API и внешним сервисам, используется как «прокси» для действий, которые атакующий не может совершить сам.
Отдельный класс проблем — не атака, а сбой самого агента: дрейф поведения, галлюцинации, зацикливание. Для бизнеса последствия те же, поэтому защита от атак и надзор за качеством идут в одном контуре.

Как устроена многослойная защита

Мы исходим из того, что одного барьера недостаточно, и проектируем доступ агента к действиям вместе с ограничениями, мониторингом и стоп-условиями.

  • Изоляция данных от команд. Входные данные (письмо, страница, документ) обрабатываются отдельно от управляющих инструкций — модель не путает «что прочитать» с «что выполнить». Подробнее — в разборе изоляции данных.
  • Guardrails (ограничители). Запрет тем, проверка выводов, лимиты на действия — слой между моделью и реальным действием.
  • Гардиан-mesh. Независимый слой проверяет доступные сигналы на аномалии, дрейф и известные нарушения правил. При предусмотренном отклонении он может остановить или изолировать агент и запустить настроенный откат; неизвестные сбои и необратимые внешние действия этим не исключаются. Как это работает — в статье про гардианов.
  • Human-in-the-loop. Необратимые и рискованные шаги — запуск рекламы, крупные траты, юридически значимые действия — уходят человеку на подтверждение. См. разбор принципа.
  • Append-only аудит-лог. Штатный путь только добавляет записи о том, какой агент, что, когда и почему сделал. Для защиты от подмены нужны отдельные права доступа, резервирование и контроль целостности; сам формат не защищает записи от обходного изменения и не доказывает соответствие требованиям.

Регуляторика и ответственность

Для бизнеса в РФ безопасность агента — не только техника: конкретный контур проверяют на применимые требования к персональным данным и рекламе, включая 152-ФЗ и 38-ФЗ. Гардианы могут отмечать заранее формализованные нарушения, но не заменяют юридическую квалификацию. В голосовых сценариях мы предусматриваем прозрачное сообщение об ИИ; необходимость записи, правовое основание, уведомление и порядок хранения определяют для конкретного процесса. Про юридическую сторону — 152-ФЗ для ИИ и надзор и безопасность агентов.

Важный принцип: чем выше риск действия, тем строже должен быть гейт. Ответ клиенту — можно доверить агенту; списание средств или публичное заявление — только через подтверждение человека.

Что делать владельцу бизнеса перед внедрением

  • Определите, какие действия агенту в принципе нельзя совершать без человека.
  • Отделите данные, на которых учится и работает агент, от каналов, куда попадают внешние тексты.
  • Требуйте журнал решений с разграничением прав, резервированием и проверкой целостности — без достаточной телеметрии разбор инцидента будет неполным.
  • Проверяйте наличие независимого слоя надзора, а не только «настроек в промпте».
  • Заложите evals — автотесты поведения агента, ловящие регрессии до прода.

Если вы только присматриваетесь к автоматизации, начните с обзора услуг студии — мы строим и сопровождаем контуры под мониторингом; режим, доступность и покрытие надзора задаются для проекта.

Частые вопросы

Можно ли полностью защитить ИИ-агента от атак?

Абсолютной защиты не бывает ни у одной системы. Задача — снизить вероятность и, главное, ограничить последствия: даже при удачной инъекции агент не должен иметь права совершить необратимое действие без надзора.

Что такое prompt injection простыми словами?

Это когда во входных данных прячут скрытую команду, чтобы агент выполнил её как свою задачу. Защита — изоляция данных от инструкций, проверка источников и гардиан-надзор.

Кто отвечает, если агент совершил вредное действие?

Роли и ответственность определяют договор, применимое право и фактическая работа участников контура. Append-only журнал и гейт человека помогают восстановить ход событий и подтвердить отдельные действия, но сами по себе не распределяют ответственность и не являются исчерпывающим доказательством.

Облачная модель безопаснее self-hosted?

Зависит от задачи. Для изоляции чувствительных данных клиентские контуры мы поднимаем на self-hosted vLLM; для части сценариев достаточно облака с маскированием ПДн. Разбор — в статье self-hosted vLLM vs облачные API.

Чем агент отличается от бота в контексте безопасности?

Само название интерфейса ничего не говорит о риске. Поверхность атаки растёт вместе с доступами, инструментами, состоянием и возможностью необратимых внешних действий; эти свойства могут быть и у системы с чат-интерфейсом. Подробнее — ИИ-агент vs чат-бот.

Хотите так же — но для вашего бизнеса?

30 минут разбора — бесплатно. Покажем, что реально автоматизировать в вашем случае и что это даст. Отвечает тот, кто ведёт проект.

Прямой контакт

Позвоните или напишите в мессенджер — ответим в рабочий день.
+7 499 500-96-88

Заказать разбор

Ответ в рабочий день · данные обрабатываем только для ответа на заявку
Нажимая «Отправить», вы соглашаетесь с политикой обработки персональных данных (152-ФЗ).

Готово — заявка отправлена

Спасибо! Ответим в рабочий день. Можно написать на hello@orkestrai.ru.