Human-in-the-loop: какие решения не отдают ИИ-агенту
Разбираем, как задать границу между автономными и подтверждаемыми действиями и проверить, что охваченный путь действительно проходит через человека.
Human-in-the-loop (человек в контуре) — политика, по которой заданные высокорисковые действия маршрутизируются на подтверждение. В исправном fail-closed пути без подтверждения они не исполняются; полноту классификации, bypass, гонки и отказ самого гейта проверяют отдельно. HITL снижает риск, но не делает его нулевым.
Что такое human-in-the-loop
Human-in-the-loop (HITL, «человек в контуре») — схема, в которой заданные решения требуют подтверждения человека. Агент может подготовить данные и предлагаемое действие, а человек подтверждает, отклоняет или исправляет его.
HITL — проектное решение, а не гарантия: классификатор может ошибиться, путь можно случайно обойти, а гейт — отказать. Поэтому покрытие проверяют тестами и журналом, а фактические задержки и пропуски измеряют.
Зачем оставлять человека
Границу HITL проводят по обратимости и цене ошибки. Черновик или сортировку часто можно переделать; платёж, доставленное письмо, удаление или отправленный договор могут иметь необратимые последствия. Конкретные классы задают политикой, а полноту классификации проверяют отдельно.
Вторая причина — распределение ответственности. Конкретные ответственные роли и правовой смысл подтверждения определяют по сценарию, договорам и применимым нормам вместе с юристом, а не выводят из наличия модели. HITL задаёт техническую точку подтверждения; журнал может показать охваченную запись, но его полноту и доказательную силу оценивают отдельно.
Какие решения оставляют человеку
Граница проводится по обратимости и размеру ставки. На стороне человека обычно остаётся:
- Деньги. Платежи, возвраты, изменение цен, запуск рекламного бюджета — всё, что напрямую тратит или двигает средства.
- Публикации от имени бизнеса. Посты, рассылки, ответы в публичных каналах — то, что становится лицом компании и не отзывается назад.
- Юридически значимые действия. Договоры, официальные письма, обязательства перед клиентом или контрагентом.
- Удаление и необратимые изменения данных. Всё, после чего нет чистого отката.
- Эскалации и нестандартные случаи. Настроенные признаки могут направить ситуацию человеку; recall и пропущенные случаи проверяются на размеченной выборке.
Для черновиков, разметки, сортировки, триажа, подготовки данных и типовых ответов можно проверить путь без предварительного гейта, но под заданными политиками и наблюдаемостью. Фактическое изменение нагрузки человека, качество и пропуски измеряют на пилоте; гардиан не гарантирует корректность сам по себе.
Где ставят гейт
Гейт human-in-the-loop проектируют на границе исполнения. В охваченном fail-closed пути агент должен остановиться перед действием и предъявить человеку решение с контекстом. Что это действительно происходит при обычной работе, гонках, повторе и отказе зависимостей, подтверждают интеграционными и fault-injection тестами.
Хороший гейт даёт человеку три опции: подтвердить, отклонить или поправить и подтвердить. Плохой гейт — это либо «подтвердить всё» без контекста (человек штампует не глядя), либо гейт на каждую мелочь (человек тонет в подтверждениях и перестаёт вникать). И то и другое возвращает риск обратно — поэтому важно, где именно проведена граница.
HITL против полной автономии
Полная автономия — режим без точек предварительного подтверждения. Его можно рассматривать для конкретных обратимых действий с ограниченной ценой ошибки, а допустимость, качество и отказные пути подтверждать тестами. Для необратимых действий границу задают по сценарию и применимым требованиям; универсальной рекомендации нет.
HITL — настройка границы автономии. Часть гейтов можно пересматривать после измерения качества на конкретном классе действий, но одного аудита недостаточно: нужны evals, данные об инцидентах и проверка отказных путей. Остаточный риск фиксируют после изменения политики.
Баланс скорости и контроля
Каждый гейт — это задержка: действие ждёт человека. Слишком много гейтов — и автономия теряет смысл, процесс идёт со скоростью человека. Слишком мало — и растёт риск необратимой ошибки. Точка баланса у каждого процесса своя, и её находят не на глаз, а по цене ошибки: чем дороже необратимый сбой, тем больше он заслуживает гейта.
На старте можно выбрать более узкие границы автономии и расширять их после evals на конкретном классе, анализа пропусков и инцидентов. Аудит — лишь один источник данных; стоимость гейтов и поздней переделки сравнивают для проекта, не предполагая заранее, какой вариант дешевле.
Как это делаем мы
На старте проекта вместе с заказчиком задаём список действий для подтверждения. В исправном fail-closed пути агент не должен исполнять их без человека; фактическое покрытие, bypass и сбои проверяем тестами, а предусмотренные решения и подтверждения — по журналу.
Как HITL встроен в полный надзорный контур — в обзоре «Надзор и безопасность ИИ-агентов»; состав работ — на странице ИИ-операторы. Ориентир по деньгам — от 150 000 ₽ за проект и от 50 000 ₽ в месяц за сопровождение; точная смета — по бесплатному разбору.
Частые вопросы
Human-in-the-loop — это признак того, что ИИ ещё слабый?
Нет. Это проектное решение для заданных классов риска. Его влияние на задержку измеряют, а покрытие и отказные пути тестируют; сам HITL не гарантирует, что любой рискованный шаг будет распознан и остановлен.
Какие решения нельзя отдавать агенту без подтверждения?
Кандидаты на подтверждение — платежи, публикации от имени бизнеса, юридически значимые коммуникации, удаление данных и нестандартные эскалации. Границу задают по цене ошибки; автономный путь для рутины тоже ограничивают политиками, тестируют и наблюдают, а аудит не гарантирует отсутствие пропусков.
Не убивает ли постоянное подтверждение всю пользу автоматизации?
Каждый гейт добавляет задержку, поэтому точки подтверждения выбирают по цене ошибки и измеряют нагрузку на человека. Рутинные шаги можно выполнять автономно только в заданных границах; классификацию и bypass проверяют отдельно.
Можно ли со временем убрать человека из контура?
Частично — после измерения качества на конкретном классе действий и пересмотра цены ошибки. Сам аудит показывает только записанные события и не доказывает отсутствие пропусков; решение о снятии гейта требует evals, инцидентов и проверки отказных путей.
Как human-in-the-loop связан с гардианами?
Это разные слои: гардиан проверяет предусмотренные признаки, а HITL маршрутизирует заданные классы решений человеку. Они дополняют покрытие, но сохраняют общие слепые зоны; полноту маршрутизации, ложные блокировки и пропуски измеряют.
Хотите так же — но для вашего бизнеса?
30 минут разбора — бесплатно. Покажем, что реально автоматизировать в вашем случае и что это даст. Отвечает тот, кто ведёт проект.