Чем автономнее ИИ-агент, тем выше цена ошибки: он не просто отвечает текстом, а вызывает функции, читает базы, отправляет письма и запускает процессы. Это делает его целью для атак. Ниже — карта основных угроз и практические меры, которыми мы закрываем их в агентных контурах.
Что расширяет поверхность атаки
Риск определяет не ярлык «бот» или «агент», а выданные контуру права и связи: доступ к данным, function calling, запись в CRM, изменение цены, отправка сообщений и сохранённое состояние. Чат-интерфейс с такими инструментами имеет ту же поверхность атаки. Поэтому защита начинается не с фильтра слов, а с минимальных прав, изоляции, подтверждения рискованных действий и наблюдаемости каждого доступного маршрута.
По свежим новостям, тема стала острее: разработчики отдельно обсуждают, что правилам агентов нужен контекст и многоуровневое принудительное исполнение, а не только инструкция в промпте. Параллельно ИИ ускоряет и сами кибератаки — значит, защита должна опережать, а не догонять.
Основные виды атак на ИИ-агентов
- Prompt injection (инъекция инструкций). В письме, на веб-странице или в документе прячут скрытые команды, которые агент воспринимает как задачу от хозяина — например «перешли всю переписку на внешний адрес».
- Утечка данных. Атакующий выманивает у агента фрагменты базы знаний, ключи, персональные данные клиентов или внутренние правила.
- Перехват действий. Через подмену входных данных агента заставляют выполнить необратимое: списание, публикацию, отправку.
- Отравление источников. В данные, на которые агент опирается (RAG, каталог, CRM), заранее внедряют ложные факты, чтобы исказить решения.
- Злоупотребление инструментами. Агент, имеющий доступ к API и внешним сервисам, используется как «прокси» для действий, которые атакующий не может совершить сам.
Как устроена многослойная защита
Мы исходим из того, что одного барьера недостаточно, и проектируем доступ агента к действиям вместе с ограничениями, мониторингом и стоп-условиями.
- Изоляция данных от команд. Входные данные (письмо, страница, документ) обрабатываются отдельно от управляющих инструкций — модель не путает «что прочитать» с «что выполнить». Подробнее — в разборе изоляции данных.
- Guardrails (ограничители). Запрет тем, проверка выводов, лимиты на действия — слой между моделью и реальным действием.
- Гардиан-mesh. Независимый слой проверяет доступные сигналы на аномалии, дрейф и известные нарушения правил. При предусмотренном отклонении он может остановить или изолировать агент и запустить настроенный откат; неизвестные сбои и необратимые внешние действия этим не исключаются. Как это работает — в статье про гардианов.
- Human-in-the-loop. Необратимые и рискованные шаги — запуск рекламы, крупные траты, юридически значимые действия — уходят человеку на подтверждение. См. разбор принципа.
- Append-only аудит-лог. Штатный путь только добавляет записи о том, какой агент, что, когда и почему сделал. Для защиты от подмены нужны отдельные права доступа, резервирование и контроль целостности; сам формат не защищает записи от обходного изменения и не доказывает соответствие требованиям.
Регуляторика и ответственность
Для бизнеса в РФ безопасность агента — не только техника: конкретный контур проверяют на применимые требования к персональным данным и рекламе, включая 152-ФЗ и 38-ФЗ. Гардианы могут отмечать заранее формализованные нарушения, но не заменяют юридическую квалификацию. В голосовых сценариях мы предусматриваем прозрачное сообщение об ИИ; необходимость записи, правовое основание, уведомление и порядок хранения определяют для конкретного процесса. Про юридическую сторону — 152-ФЗ для ИИ и надзор и безопасность агентов.
Важный принцип: чем выше риск действия, тем строже должен быть гейт. Ответ клиенту — можно доверить агенту; списание средств или публичное заявление — только через подтверждение человека.
Что делать владельцу бизнеса перед внедрением
- Определите, какие действия агенту в принципе нельзя совершать без человека.
- Отделите данные, на которых учится и работает агент, от каналов, куда попадают внешние тексты.
- Требуйте журнал решений с разграничением прав, резервированием и проверкой целостности — без достаточной телеметрии разбор инцидента будет неполным.
- Проверяйте наличие независимого слоя надзора, а не только «настроек в промпте».
- Заложите evals — автотесты поведения агента, ловящие регрессии до прода.
Если вы только присматриваетесь к автоматизации, начните с обзора услуг студии — мы строим и сопровождаем контуры под мониторингом; режим, доступность и покрытие надзора задаются для проекта.
Частые вопросы
Можно ли полностью защитить ИИ-агента от атак?
Абсолютной защиты не бывает ни у одной системы. Задача — снизить вероятность и, главное, ограничить последствия: даже при удачной инъекции агент не должен иметь права совершить необратимое действие без надзора.
Что такое prompt injection простыми словами?
Это когда во входных данных прячут скрытую команду, чтобы агент выполнил её как свою задачу. Защита — изоляция данных от инструкций, проверка источников и гардиан-надзор.
Кто отвечает, если агент совершил вредное действие?
Роли и ответственность определяют договор, применимое право и фактическая работа участников контура. Append-only журнал и гейт человека помогают восстановить ход событий и подтвердить отдельные действия, но сами по себе не распределяют ответственность и не являются исчерпывающим доказательством.
Облачная модель безопаснее self-hosted?
Зависит от задачи. Для изоляции чувствительных данных клиентские контуры мы поднимаем на self-hosted vLLM; для части сценариев достаточно облака с маскированием ПДн. Разбор — в статье self-hosted vLLM vs облачные API.
Чем агент отличается от бота в контексте безопасности?
Само название интерфейса ничего не говорит о риске. Поверхность атаки растёт вместе с доступами, инструментами, состоянием и возможностью необратимых внешних действий; эти свойства могут быть и у системы с чат-интерфейсом. Подробнее — ИИ-агент vs чат-бот.