Гардианы: как ИИ-агенты контролируют друг друга
Кто проверяет автономного агента, если он ошибается уверенно. Разбираем гардиан — независимого агента-надзирателя: что он проверяет, чем отличается от статических ограничений и где проходит граница его возможностей.
Гардиан — агент-надзиратель для проверки заданных классов действий до исполнения. В исправном fail-closed пути отрицательный результат блокирует действие, но полнота правил, обходы и отказ самого гейта тестируются отдельно. Независимые правила или модель могут снизить коррелированный риск, но не гарантируют обнаружение ошибки.
Что такое гардиан
В мультиагентной системе рабочие агенты выполняют задачу, а гардианы проверяют охваченные действия по заданным правилам до исполнения. В исправном fail-closed пути отрицательный результат возвращает действие на переделку; классификацию, bypass, гонки и отказ гейта тестируют отдельно.
Несколько независимых проверок для разных классов риска образуют гардиан-mesh. Такой слой может снизить вероятность или ущерб предусмотренных ошибок, но не предотвращает вред детерминированно: качество подтверждают evals и данными об инцидентах.
Зачем отдельный агент для проверки
Самопроверка и независимая проверка покрывают разные ошибки, но обе имеют слепые зоны. Та же модель может повторить исходную ошибку; отдельные правила или модель уменьшают корреляцию, не устраняя её.
Гардиан смотрит на охваченные признаки — факты из заданного источника, правила, безопасность ввода. Фактическое качество измеряют на размеченных кейсах: precision, recall, ложные блокировки и пропуски, включая новые угрозы.
Что именно проверяет гардиан
Гардианы делятся по классам рисков — под каждый тип угрозы свой проверяющий:
- Факты и цифры. Сопоставляет настроенные поля с выбранным источником правды (каталогом, реквизитами, прайсом). Полнота источника и доля пропусков проверяются отдельно.
- Правила и правовые риски. Отмечает настроенные признаки несоответствия до публикации. Такая проверка не доказывает соблюдение 38-ФЗ и не заменяет юридическую оценку.
- Безопасность ввода. Ищет предусмотренные признаки prompt injection; покрытие и обходы измеряют на атакующих наборах.
- Персональные данные. Проверяет распознаваемые типы ПДн до внешнего вызова. Маскирование снижает риск, но может пропустить данные в свободном тексте.
- Границы полномочий. Сопоставляет охваченные действия с заданной политикой и маршрутизирует предусмотренные исключения человеку; bypass проверяется отдельно.
Набор гардианов подбирается под контур: чат-ассистенту важнее факт-чек и безопасность ввода, агенту-маркетологу — комплаенс рекламы, оператору с доступом к данным — контроль ПДн и полномочий.
Гардиан-mesh: сетка надзора
Несколько проверяющих на разные классы рисков образуют гардиан-mesh. Через него маршрутизируют охваченные действия; проверки могут идти параллельно, если зависимости это допускают. Полнота маршрутизации и bypass-пути проверяются отдельно.
В исправном fail-closed пути действие с отрицательным результатом возвращается на переделку. Журнал фиксирует предусмотренные решения и отказы, но не обещает запись каждого события; сбои журналирования и полнота схемы мониторятся отдельно.
Гардиан vs guardrails
Термины путают, но это разные вещи. Guardrails — статические ограничения: инструкции, списки и лимиты. Их задержку и качество также измеряют; статическое правило обычно использует меньше контекста, чем отдельная проверка действия.
Гардиан — отдельная проверка подготовленного действия с доступным ей контекстом. Статические правила и модельная проверка могут дополнять друг друга, но задержку, стоимость, precision, recall и общие слепые зоны измеряют для конкретной реализации.
Пределы гардиана
Гардиан снижает риск, но не обнуляет его — и честно признать это важнее, чем обещать «100% контроль». Гардиан сам построен на правилах и, возможно, на модели, а значит имеет свои слепые зоны: проверку на факт он сделает настолько хорошо, насколько полон источник правды, а новую, не предусмотренную угрозу может пропустить.
Поэтому гардиан-mesh не отменяет human-in-the-loop и не заменяет аудит. Guardrails, гардианы, человек и журнал покрывают разные классы рисков; ни один слой и их сочетание не гарантируют полноту.
Как это делаем мы
Для мультиагентного контура мы проектируем надзор под выбранные классы риска и фиксируем его состав в критериях приёмки. Собственные сценарии используем для ранних проверок, а на проекте отдельно измеряем precision, recall, ложные срабатывания, пропуски и обходные пути. На этом сайте перед облачным вызовом чат маскирует распознаваемые телефоны и email, но фильтр не охватывает все возможные ПДн.
Как гардианы встроены в полный надзорный контур — в обзоре «Надзор и безопасность ИИ-агентов»; состав работ по автономным контурам — на странице ИИ-операторы. Ориентир по деньгам — от 150 000 ₽ за проект и от 50 000 ₽ в месяц за сопровождение; точная смета — по бесплатному разбору.
Частые вопросы
Чем гардиан отличается от guardrails?
Guardrails — заранее заданные инструкции, списки и лимиты; гардиан — отдельная проверка подготовленного действия с доступным контекстом. Они могут дополнять друг друга, но скорость, стоимость, качество и общие слепые зоны измеряют на конкретной реализации.
Почему нельзя, чтобы агент проверял себя сам?
Та же модель может повторить исходную ошибку. Отдельные правила или модель снижают коррелированный риск, но тоже имеют слепые зоны; качество обеих проверок измеряют на размеченных кейсах, включая ложные блокировки и пропуски.
Гардиан гарантирует, что агент не ошибётся?
Нет. Гардиан может снизить риск на охваченных классах, но сам построен на правилах или модели и имеет слепые зоны: новую угрозу он способен пропустить. Эффект измеряют по precision, recall, инцидентам и обходным тестам; HITL и аудит тоже не гарантируют полноту.
Сколько гардианов нужно в контуре?
Набор выбирают по модели угроз и цене ошибки. Через mesh маршрутизируют заданные классы действий, а не обещают охват каждого шага; полноту маршрутизации, слепые зоны и bypass проверяют тестами.
Гардиан замедляет работу агента?
Проверка добавляет задержку. Часть независимых проверок можно выполнять параллельно, но фактическую latency измеряют под нагрузкой и сверяют с SLO конкретного процесса; заранее называть её небольшой нельзя.
Хотите так же — но для вашего бизнеса?
30 минут разбора — бесплатно. Покажем, что реально автоматизировать в вашем случае и что это даст. Отвечает тот, кто ведёт проект.