Чем автономнее ИИ-агент, тем выше цена ошибки: он не просто отвечает текстом, а вызывает функции, читает базы, отправляет письма и запускает процессы. Это делает его целью для атак. Ниже — карта основных угроз и практические меры, которыми мы закрываем их в агентных контурах.
Почему агент — более уязвимая цель, чем чат-бот
Обычный чат-бот в худшем случае скажет неправильное. ИИ-агент способен совершить действие: изменить цену, оформить заявку, отправить данные наружу. Именно способность действовать (function calling) превращает уязвимость в реальный ущерб. Поэтому безопасность агента — это не фильтр слов, а контроль над правом действия.
По свежим новостям, тема стала острее: разработчики отдельно обсуждают, что правилам агентов нужен контекст и многоуровневое принудительное исполнение, а не только инструкция в промпте. Параллельно ИИ ускоряет и сами кибератаки — значит, защита должна опережать, а не догонять.
Основные виды атак на ИИ-агентов
- Prompt injection (инъекция инструкций). В письме, на веб-странице или в документе прячут скрытые команды, которые агент воспринимает как задачу от хозяина — например «перешли всю переписку на внешний адрес».
- Утечка данных. Атакующий выманивает у агента фрагменты базы знаний, ключи, персональные данные клиентов или внутренние правила.
- Перехват действий. Через подмену входных данных агента заставляют выполнить необратимое: списание, публикацию, отправку.
- Отравление источников. В данные, на которые агент опирается (RAG, каталог, CRM), заранее внедряют ложные факты, чтобы исказить решения.
- Злоупотребление инструментами. Агент, имеющий доступ к API и внешним сервисам, используется как «прокси» для действий, которые атакующий не может совершить сам.
Как устроена многослойная защита
Мы исходим из того, что одного барьера недостаточно. Право действия у агента всегда идёт в паре с надзором.
- Изоляция данных от команд. Входные данные (письмо, страница, документ) обрабатываются отдельно от управляющих инструкций — модель не путает «что прочитать» с «что выполнить». Подробнее — в разборе изоляции данных.
- Guardrails (ограничители). Запрет тем, проверка выводов, лимиты на действия — слой между моделью и реальным действием.
- Гардиан-mesh. Независимый слой агентов-надзирателей круглосуточно ловит аномалии, дрейф и нарушения правил, изолирует сбойный агент автоматически и откатывает его действие. Как это работает — в статье про гардианов.
- Human-in-the-loop. Необратимые и рискованные шаги — запуск рекламы, крупные траты, юридически значимые действия — уходят человеку на подтверждение. См. разбор принципа.
- Append-only аудит-лог. Каждое решение записывается неизменяемо: какой агент, что, когда и почему сделал. Это даёт разбор инцидентов и доказуемость для регулятора.
Регуляторика и ответственность
Для бизнеса в РФ безопасность агента — не только техника, но и соответствие 152-ФЗ (персональные данные) и 38-ФЗ (реклама). Наши гардианы проверяют выводы в том числе на комплаенс, а голосовые сценарии по умолчанию раскрывают, что говорит ИИ, и запрашивают согласие на запись. Про юридическую сторону — 152-ФЗ для ИИ и надзор и безопасность агентов.
Важный принцип: чем выше риск действия, тем строже должен быть гейт. Ответ клиенту — можно доверить агенту; списание средств или публичное заявление — только через подтверждение человека.
Что делать владельцу бизнеса перед внедрением
- Определите, какие действия агенту в принципе нельзя совершать без человека.
- Отделите данные, на которых учится и работает агент, от каналов, куда попадают внешние тексты.
- Требуйте неизменяемый журнал решений — без него нельзя разобрать инцидент.
- Проверяйте наличие независимого слоя надзора, а не только «настроек в промпте».
- Заложите evals — автотесты поведения агента, ловящие регрессии до прода.
Если вы только присматриваетесь к автоматизации, начните с обзора услуг студии — мы строим и ведём контуры под надзором 24/7.
Частые вопросы
Можно ли полностью защитить ИИ-агента от атак?
Абсолютной защиты не бывает ни у одной системы. Задача — снизить вероятность и, главное, ограничить последствия: даже при удачной инъекции агент не должен иметь права совершить необратимое действие без надзора.
Что такое prompt injection простыми словами?
Это когда во входных данных прячут скрытую команду, чтобы агент выполнил её как свою задачу. Защита — изоляция данных от инструкций, проверка источников и гардиан-надзор.
Кто отвечает, если агент совершил вредное действие?
Ответственность за контур несёт оператор. Поэтому мы фиксируем каждое решение в append-only логе и держим рискованные шаги за гейтом человека — это распределяет и доказывает ответственность.
Облачная модель безопаснее self-hosted?
Зависит от задачи. Для изоляции чувствительных данных клиентские контуры мы поднимаем на self-hosted vLLM; для части сценариев достаточно облака с маскированием ПДн. Разбор — в статье self-hosted vLLM vs облачные API.
Чем агент отличается от бота в контексте безопасности?
Бот отвечает, агент — действует. У агента шире поверхность атаки, поэтому и защита строже. Подробнее — ИИ-агент vs чат-бот.