РАЗБОР

Гардианы: как ИИ-агенты контролируют друг друга

Кто проверяет автономного агента, если он ошибается уверенно. Разбираем гардиан — независимого агента-надзирателя: что он проверяет, чем отличается от статических ограничений и где проходит граница его возможностей.

Гардиан — это агент-надзиратель, единственная задача которого проверять действия других агентов до того, как они вступят в силу. Он сверяет подготовленное действие с правилами, требованиями закона и фактами и блокирует то, что не проходит проверку. Ключевое свойство — независимость: гардиан работает по отдельным правилам и часто на отдельной модели, поэтому ловит ошибку, которую сам исполнитель уверенно не замечает.

Что такое гардиан

В мультиагентной системе рабочие агенты выполняют задачу, а гардианы следят, чтобы они делали это в рамках. Гардиан не участвует в самой работе — он стоит между решением агента и его исполнением и отвечает на один вопрос: «можно ли это действие выпустить наружу?». Если нет — возвращает агенту на переделку с указанием причины.

Название прижилось потому, что роль именно охранная: гардиан не улучшает результат и не ускоряет процесс, он предотвращает вред. В нашей терминологии несколько таких проверяющих агентов на разные классы рисков образуют гардиан-mesh — сетку надзора поверх рабочего слоя.

Зачем отдельный агент для проверки

Возникает резонный вопрос: почему бы не попросить самого агента перепроверить себя? Потому что модель, ошибившись, повторит ошибку с той же уверенностью — у неё нет внешней точки опоры. Самопроверка ловит опечатки, но не системные заблуждения: если агент «уверен», что скидка существует, то и на проверке он её подтвердит.

Гардиан решает это независимостью. Он работает по другим правилам, смотрит на действие с другой стороны — «соответствует ли закону», «не противоречит ли фактам из источника правды», «безопасен ли ввод» — а иногда и запускается на другой модели. Независимый проверяющий ловит то, что исполнитель структурно не видит. Это тот же принцип, что разделение автора и ревьюера в командах людей.

Что именно проверяет гардиан

Гардианы делятся по классам рисков — под каждый тип угрозы свой проверяющий:

  • Факты и цифры. Сверяет утверждения агента с источником правды (каталог, реквизиты, прайс) — не выдумал ли он скидку, срок или характеристику.
  • Соответствие правилам и закону. Проверяет тексты и действия на требования площадок и законодательства — например, рекламу по 38-ФЗ до публикации.
  • Безопасность ввода. Ловит prompt injection — попытки внешнего текста перехватить инструкции агента.
  • Персональные данные. Следит, чтобы ПДн не уходили туда, где им быть не положено, и были замаскированы до вызова модели.
  • Границы полномочий. Проверяет, не выходит ли действие за разрешённую агенту зону — и не пора ли передать его человеку.

Набор гардианов подбирается под контур: чат-ассистенту важнее факт-чек и безопасность ввода, агенту-маркетологу — комплаенс рекламы, оператору с доступом к данным — контроль ПДн и полномочий.

Гардиан-mesh: сетка надзора

Один гардиан — это одна линия проверки. В реальном контуре их несколько, и вместе они образуют гардиан-mesh: каждое действие проходит через применимые к нему проверки, прежде чем вступить в силу. Mesh, а не цепочка, потому что проверки независимы и могут идти параллельно — факт-чек не ждёт проверку на ПДн.

Действие, не прошедшее любую из проверок, не исполняется, а возвращается агенту с причиной — тот переделывает и отправляет снова. Всё это фиксируется в append-only аудит: видно не только финальное действие, но и то, что гардиан отбраковал по пути. Так надзор становится ещё и материалом для улучшения системы.

Гардиан vs guardrails

Термины путают, но это разные вещи. Guardrails — статические ограничения, заданные заранее: инструкции в промпте, белые и чёрные списки, лимиты. Они дёшевы, срабатывают мгновенно и хороши как первый барьер, но не понимают контекста конкретного действия.

Гардиан — активная проверка в моменте: он анализирует именно это подготовленное действие с учётом данных и ситуации. Guardrails говорят «сюда нельзя никогда», гардиан говорит «вот это конкретное действие сейчас — нельзя, потому что…». В зрелом контуре они работают вместе: guardrails отсекают очевидное дёшево, гардианы разбирают спорное содержательно.

Пределы гардиана

Гардиан снижает риск, но не обнуляет его — и честно признать это важнее, чем обещать «100% контроль». Гардиан сам построен на правилах и, возможно, на модели, а значит имеет свои слепые зоны: проверку на факт он сделает настолько хорошо, насколько полон источник правды, а новую, не предусмотренную угрозу может пропустить.

Поэтому гардиан-mesh не отменяет human-in-the-loop на необратимых действиях и не заменяет аудит. Правильная картина такая: guardrails ловят очевидное, гардианы — содержательное, человек держит необратимое, аудит фиксирует всё для разбора. Убрать любой слой — оставить дыру.

Как это делаем мы

Гардиан-mesh — часть каждого нашего мультиагентного контура, а не опция. Состав гардианов мы подбираем под задачу и обкатываем на собственных бизнесах: половина наших кейсов — свои, и надзорный слой сначала проверяется на них. На этом сайте роль гардиана по ПДн выполняет маскирование телефонов и почты в чате до вызова модели.

Как гардианы встроены в полный надзорный контур — в обзоре «Надзор и безопасность ИИ-агентов»; состав работ по автономным контурам — на странице ИИ-операторы. Ориентир по деньгам — от 150 000 ₽ за проект и от 50 000 ₽ в месяц за сопровождение; точная смета — по бесплатному разбору.

Частые вопросы

Чем гардиан отличается от guardrails?

Guardrails — статические ограничения, заданные заранее (инструкции, списки, лимиты): дёшевы и мгновенны, но не понимают контекста. Гардиан — отдельный агент, который активно проверяет конкретное подготовленное действие с учётом данных и ситуации. Guardrails говорят «так нельзя никогда», гардиан — «это действие сейчас нельзя, потому что...». В зрелом контуре они работают вместе.

Почему нельзя, чтобы агент проверял себя сам?

Потому что, ошибившись, модель повторит ошибку с той же уверенностью — у неё нет внешней точки опоры. Самопроверка ловит опечатки, но не системные заблуждения. Гардиан ловит их за счёт независимости: он работает по другим правилам, смотрит на действие с другой стороны, иногда на другой модели — как отдельный ревьюер в команде людей.

Гардиан гарантирует, что агент не ошибётся?

Нет, и обещать это было бы нечестно. Гардиан существенно снижает риск, но сам построен на правилах и модели и имеет слепые зоны: новую, непредусмотренную угрозу он может пропустить. Поэтому он не отменяет human-in-the-loop на необратимых действиях и аудит — это слои, которые дополняют друг друга, а не заменяют.

Сколько гардианов нужно в контуре?

Столько, сколько у контура классов рисков. Чат-ассистенту важны факт-чек и защита от prompt injection, агенту-маркетологу — комплаенс рекламы, оператору с доступом к данным — контроль ПДн и полномочий. Набор подбирается под задачу; вместе проверяющие образуют гардиан-mesh, через который проходит каждое действие.

Гардиан замедляет работу агента?

Проверка добавляет шаг, но независимые гардианы работают параллельно, а не в очередь, поэтому задержка невелика. Для необратимых действий эта задержка оправдана ценой ошибки; для рутинных и обратимых часть проверок можно упростить. Баланс скорости и контроля настраивается под конкретный процесс.

Хотите так же — но для вашего бизнеса?

30 минут разбора — бесплатно. Покажем, что реально автоматизировать в вашем случае и что это даст. Отвечает тот, кто ведёт проект.

Прямой контакт

Позвоните или напишите в мессенджер — ответим в рабочий день.
+7 499 500-96-88

Заказать разбор

Ответ в рабочий день · данные под 152-ФЗ, третьим не передаём
Нажимая «Отправить», вы соглашаетесь с политикой обработки персональных данных (152-ФЗ).

Готово — заявка отправлена

Спасибо! Ответим в рабочий день. Можно написать на hello@orkestrai.ru.

Используем cookie и Яндекс.Метрику. Политика