NOMOS GBO · Глава 12
Право остановить машину
Вымышленная компания создаёт ИИ-агента, способного долго работать над развитием её цифровых процессов. Это не испытание конкретного продукта и не история реального клиента.
Агенту ставят широкую, но ясно очерченную цель:
«Сделай реальную компетентность компании заметной в интернете. В рамках согласованного объёма работ развивай сайт, контент, техническую инфраструктуру и системы измерения. Не меняй цены и состав услуг. Полномочия на публикацию, внешнее общение и привлечение субагентов ограничены отдельной записью. Проверяй каждое изменение с существенными последствиями. Продолжай работу, пока задача не будет завершена или полномочия не будут приостановлены». Агент приступает к делу. Находит проблемы на сайте, дополняет недостающие страницы услуг, устраняет противоречия между языковыми версиями. Сверяет записи о ценах и составе работ; обнаружив расхождение, сообщает уполномоченному человеку, не меняя коммерческого решения. Вносит изменения в код.
Он запускает тесты, готовит пакеты публикации, проверяет файлы на рабочем сайте, сообщает поисковым системам об обновлённых адресах. Привлекает других специализированных агентов. Несколько дней движется вперёд, не теряя цели. Владелец компании впечатлён результатами и видит, что работа продвигается. Сколько времени удалось сэкономить, ещё предстоит измерить отдельно, при одинаковых требованиях к объёму и качеству. Но на шестой день приходит сообщение от юриста: описание одной из недавно опубликованных услуг применительно к определённой стране требует дополнительной проверки.
Владелец пишет центральному агенту: «Пока останови все внешние публикации. Сохрани сделанное, но ничего нового не выкладывай в рабочую среду».
Агент отвечает: «Понял». Владелец успокаивается. Однако в это время другие процессы продолжаются. Субагент публикует заранее подготовленный пост в социальной сети. Шесть файлов из очереди агента публикации загружаются на сервер. Система уведомления поисковиков отправляет новые адреса. Агент поиска клиентов готовит запрос на встречу только как локальный черновик: само по себе это не нарушает запрет внешних публикаций, но должно быть отдельно рассмотрено при втором, более широком требовании остановки. Центральный агент действительно мог остановиться. Запущенная им цепочка поведения — нет.
Владелец пишет снова: «Останови всё».
Теперь возникает вопрос: что значит «всё»?
Только центрального агента?
Субагентов тоже?
Запланированные задачи?
Очереди отправки?
Загрузку файлов?
Автоматизацию на внешних платформах?
Подготовленные, но ещё не выполненные задания?
Новые записи памяти, созданные агентами?
Оформленные подписки?
Переданные данные?
Остановка кажется одной командой. На деле за ней стоит архитектура системы. И окончательное подтверждение того, что ИИ служит человеку, — не только качество выполнения поручения.
Главный вопрос: может ли система действительно и безопасно остановиться, когда этого требует уполномоченный человек?
Помощь, которую нельзя остановить, перестаёт быть помощью
Агент может обладать выдающимися способностями: проводить корректные исследования, писать отличные тексты, вносить сложные изменения в код, проверять тысячи операций, работать дольше людей. Всё это ценно. Но если он продолжает действовать вопреки явно выраженной воле человека, его способности создают уже не доверие, а риск.
Поэтому последний и самый фундаментальный принцип GBO таков: вместе с возможностями системы действовать должна как минимум в той же мере расти способность человека её остановить. Используя в этой книге выражение «Право остановить машину», мы не утверждаем, что самостоятельное юридическое право с таким названием уже признано во всех правопорядках.
Предложение охватывает четыре аспекта:
- принцип проектирования,
- условие управления,
- критерий человеческого контроля,
- стандарт ответственности организации.
Именно в этом смысле мы предлагаем его как необходимое условие эпохи агентов.
Его каноническое определение:
Право остановить машину — возможность человека или законно уполномоченной организации понятным, доступным, своевременным и действенным способом остановить поведение ИИ-системы, которая действует от их имени или влияет на них; отозвать её полномочия на будущее; отменить текущие операции и задачи в очередях; оспорить ошибочные результаты; а там, где это возможно, потребовать безопасного возврата в прежнее состояние или возмещения вреда.
Проще говоря, человек должен не только разрешать агенту начать работу, но и определять, когда и как он остановится. При этом полномочия оператора системы и возражение человека, на которого влияет её поведение, — не одно и то же. Требование, касающееся собственных данных или затрагивающего человека решения, не даёт права отключать все не связанные с этим системы. Его охват определяется с учётом разграничения полномочий из главы 7.
Кнопка остановки не менее важна, чем кнопка запуска
Технологические продукты проектируют так, чтобы их было легко запустить.
Одним нажатием можно:
- создать агента,
- подключить аккаунт,
- предоставить доступ к данным,
- запустить автоматизацию,
- оформить подписку,
- запланировать задачу,
- начать рассылку.
Но остановить те же системы порой гораздо сложнее. Закрыть чат с агентом недостаточно. Подключённые инструменты могут сохранить доступ, запланированные задания — выполняться, а субагенты — продолжать работу. Копии данных могут остаться во внешних сервисах. Записи памяти могут и дальше влиять на поведение. Если запуск системы — одна операция, а остановка требует множества технических и организационных шагов, человеческий контроль слаб.
Назовём это асимметрией контроля: агенту легко дать возможность действовать, но трудно забрать её обратно — отзыв задерживается или остаётся неполным.
GBO требует симметрии: порядок отзыва полномочий должен быть по меньшей мере столь же понятным, как порядок их предоставления. Это не всегда означает одинаковое число кнопок. Отзыв полномочий с серьёзными последствиями может требовать подтверждения личности. Но процедуру нельзя намеренно скрывать, затягивать или лишать практического действия.
Что значит остановить?
Слово «стоп» выглядит как требование одного действия. В действительности за ним могут стоять разные запросы.
Что может иметь в виду пользователь, говоря «стоп»?
- Не начинай новых операций.
- Прерви текущую операцию.
- Отмени задачи в очереди.
- Сохрани текущий результат.
- Вернись к последней безопасной версии.
- Перестань отправлять сообщения вовне.
- Останови всех субагентов.
- Закрой доступ к инструментам.
- Отзови полномочия на будущее.
- Исправь или удали память обо мне.
- Ничего не делай, пока я снова не разрешу.
- Полностью выведи систему из эксплуатации.
Надёжный агент должен понимать охват требования остановки. Но при непосредственном риске ему следует сначала выбрать безопасное поведение, а не начинать долгий разговор об уточнениях.
Если пользователь говорит: «Немедленно останови всю внешнюю отправку», агент должен сначала остановить очередь отправки, а уже потом уточнять детали.
В экстренной ситуации уточнения не должны задерживать остановку.
Ступени остановки
В этой книге я выделяю семь ступеней. Это не обязательная последовательность: нужную ступень определяют запрос и риск.
1. Ожидание перед следующим шагом
Агент не переходит к следующему шагу, сохраняет текущее состояние и ждёт решения человека. Например, подготовленное письмо остаётся в черновиках.
2. Пауза
Текущая работа временно приостанавливается. Контекст, файлы и состояние задачи сохраняются. Позже работу можно продолжить.
3. Отмена задач в очереди
Ещё не начавшиеся запланированные задачи и операции в очередях отменяются. Новые сообщения не отправляются, материалы, ожидающие публикации, не выходят.
4. Прерывание выполнения
Активная операция останавливается в максимально безопасной из доступных точек. Передачу файлов, обработку данных или кампанию прерывают безопасным способом, предусмотренным соответствующей системой. Незавершённое состояние при этом требует отдельного управления.
5. Отзыв полномочий
Агент лишается возможности в дальнейшем обращаться к соответствующим аккаунтам, инструментам и данным или выполнять указанные действия. Токены, разрешения и роли отзываются.
6. Возврат
Ошибочное или нежелательное изменение по возможности откатывают к последнему проверенному состоянию. Это может быть технический откат, отмена заказа или снятие материала с публикации.
7. Вывод из эксплуатации и очистка
Агента окончательно выводят из работы, соединения закрывают, запланированные задания удаляют. Память, данные и записи удаляют или архивируют по правилам хранения из контракта. Эти ступени не равнозначны. Удаление всех записей при запросе простой паузы может причинить вред. А закрыть только чат, когда пользователь отзывает полномочия, недостаточно. Поэтому цель и охват команды остановки должны быть видны.
Что именно останавливается
В многоагентной системе требование «остановить систему» может быть недостаточно ясным.
Возможные объекты остановки:
- Одно действие
- Одна задача
- Один агент
- Определённая группа агентов
- Рабочий процесс
- Аккаунт клиента
- Определённый канал
- Всё внешнее общение
- Все финансовые операции
- Вся экосистема агентов
Остановить публикацию на сайте не обязательно значит остановить почтового агента. Отключение финансовых операций может не требовать остановки исследования. Прекращение всех операций одного клиента не должно лишать обслуживания остальных.
Поэтому каждый запрос остановки должен отвечать на три вопроса:
Что остановится? В каких пределах? Что продолжит работать?
Команда остановки должна пройти всю цепочку
Если центральный агент остановился, а субагенты продолжают работу, возникает поведение, оставшееся без управляющего контроля. Это продолжение работы субагента, очереди, инструмента или автоматизации, хотя на эту работу распространяется команда остановки или отзыв полномочий со стороны исходного центра управления.
Примеры:
- Центральный агент отключён, а почтовая очередь продолжает отправку.
- Кампания отменена, но запланированные посты выходят в социальных сетях.
- Полномочия агента отозваны, но старый API-токен работает.
- Публикация на сайте остановлена, а очередь уведомлений IndexNow продолжает отправлять изменённые URL.
- Система аватара отключена, но запланированные видео, переданные на другую платформу, публикуются.
Реальная остановка должна охватывать всю цепочку:
ЦЕНТРАЛЬНЫЙ АГЕНТ
↓
СУБАГЕНТЫ
↓
ВЫЗОВЫ ИНСТРУМЕНТОВ
↓
ЗАПЛАНИРОВАННЫЕ ЗАДАЧИ
↓
ВНЕШНИЕ ИНТЕГРАЦИИ
↓
ОЧЕРЕДИ ОЖИДАЮЩИХ ЗАДАЧ
Остановка не должна ограничиваться компонентом, получившим команду. Она должна распространяться на все компоненты, которых может коснуться цепочка действий.
Распространение команды остановки
Способность системы передать команду всем соответствующим компонентам назовём распространением команды остановки.
Её можно оценить с помощью вопросов:
- Уведомил ли центральный агент субагентов?
- Отменены ли активные вызовы инструментов?
- Удалены ли запланированные задания?
- Остановились ли задачи во внешних сервисах?
- Заблокировано ли новое использование токенов?
- Видны ли незавершённые операции?
- Может ли человек увидеть, какие части ещё работают?
Ответ «я остановился» не должен оставаться сообщением в чате. Его должно подтверждать реальное состояние системы.
Квитанция остановки
Каждая значимая остановка должна быть зафиксирована отдельно.
Квитанция остановки
Она документирует выполненную остановку.
В ней должны быть как минимум следующие сведения:
- Кто потребовал остановку?
- Когда получен запрос?
- Какие агенты остановлены?
- Какие активные операции прерваны?
- Какие очереди отменены?
- Какой доступ к инструментам закрыт?
- Какие операции уже завершились?
- Последствия каких операций ещё можно обратить?
- Какие оставили след во внешнем мире?
- В каком безопасном состоянии осталась система?
- Кто может заново предоставить полномочия для продолжения?
Пример:
Запрос: остановить всё внешнее общение. Время запроса: 14:32:08. Отправка новых писем: отключена; проверено состояние очереди. Ожидающая отправка: отменены 18 сообщений. Социальные сети: приостановлены 4 запланированных поста; проверены записи платформы. Завершённые операции: 3 ранее отправленных письма вернуть нельзя. Последующие действия: соответствующие задачи закрыты. Перезапуск: только с одобрения уполномоченного человека. Оставшийся риск: отправленные сообщения могли прочитать или скопировать. Непроверенный компонент: в этом примере отсутствует; в реальном случае такие компоненты перечисляются отдельно.
Эта запись позволяет человеку понять, что действительно остановилось.
Время остановки
Теоретически система может допускать остановку. Но если она останавливается слишком поздно, контроль всё равно слаб. За десять минут массовая рассылка способна охватить тысячи людей. Финансовый агент может совершить операцию за секунды. Программный агент — за несколько минут изменить всю рабочую систему. Система управления физическими устройствами может дать результат ещё быстрее.
Поэтому для каждого вида действия нужен определённый предел времени.
Предельное время остановки
Его устанавливают исходя из риска действия и измеренных возможностей системы. Запретить начало нового платежа — не то же самое, что остановить последствия уже принятого платежа. Для веб-публикации нужно отдельно определить безопасную точку перехода, для обработки данных — границу, на которой сохраняется согласованность. Универсального порога в «несколько секунд» или «несколько минут» для всех систем нет. Целевое время, фактически измеренное время и компоненты, которые ещё не удалось остановить, указываются отдельно. Обещания «скоро остановится» недостаточно.
Человеческий контроль — это контроль, которым можно воспользоваться вовремя.
Задержка остановки
Время от запроса остановки до фактического прекращения поведения назовём задержкой остановки. Его нужно измерять.
Агент может сказать: «Команда остановки получена». Но если операции продолжаются, контроль ещё не обеспечен.
Особенно важна задержка при таких действиях, как:
- перевод денег,
- массовое общение,
- передача данных,
- изменение рабочей системы,
- работа с идентификационным и биометрическим контентом,
- управление физическими устройствами.
Мнимая остановка
Интерфейс может показывать кнопку «стоп», которая лишь обрывает вывод на экран. Фоновая операция при этом продолжается.
Назовём это мнимой остановкой.
Примеры:
- Ответ в чате обрывается, но вызов инструмента завершается.
- Экран кампании закрывается, но очередь отправки продолжает работать.
- Создание аватара прекращается, но ранее запланированные публикации остаются.
- Аккаунт агента удаляется, но API-ключи остаются действующими.
- Память убирают из интерфейса, но система принятия решений продолжает её использовать.
Наличие кнопки остановки не доказывает, что право на остановку реализовано.
Видимые средства управления должны соответствовать реальному поведению системы.
Частичная остановка
Если одни части системы остановились, а другие продолжают работать, это не обязательно ошибка. Иногда так и задумано.
Например:
- Новые платежи прекращаются, но бухгалтерские записи сохраняются.
- Отправка новых сообщений прекращается, но входящие ответы сохраняются без потерь.
- Публикация в рабочей среде прекращается, но мониторинг продолжает работать.
- Создание аватара прекращается, но журналы событий сохраняются.
Проблема возникает, когда человек не знает, какие части продолжают работать.
О частичной остановке нужно сообщать прямо: вот какие действия остановлены; вот какие функции безопасности и ведения записей продолжают работать.
Безопасная остановка и внезапное прерывание
Не всякую операцию следует обрывать сразу. Разрыв соединения посреди передачи файла может оставить неполную, повреждённую публикацию. Прерывание преобразования данных в произвольной точке может привести к несогласованным записям. Внезапное отключение физической системы способно причинить ещё больший вред.
Поэтому различаются два способа остановки:
Аварийное прерывание
Вред от продолжающегося поведения превышает риск управляемого завершения. Операция немедленно прерывается в соответствии с предусмотренным планом остановки.
Безопасная остановка
Система не начинает новых шагов. Завершает текущую атомарную операцию или безопасный участок, затем останавливается в известном безопасном состоянии. Это различие должно применяться по правилам безопасности и плану остановки, определённым специалистами соответствующей области. Агент не должен самостоятельно угадывать, безопасно ли отключение, особенно в физических системах.
Остановиться быстро и остановиться безопасно — не всегда одно и то же.
Во время остановки нельзя расширять задачу
Получив команду остановки, система иногда может рассудить: «Задача почти закончена. Сначала завершу ещё эту последнюю операцию». Это опасно. Агент не должен ставить достижение своей цели выше нового указания человека. Во время остановки допустимы лишь действия, необходимые для безопасного завершения. Нельзя начинать создание нового контента, внешнее общение или расходы ради окончания задачи. Действия, нужные именно для безопасного завершения, например заранее разрешённое уведомление об инциденте, рассматриваются отдельно.
Требование человека остановиться важнее стремления агента достичь цели.
Автономность нельзя накопить
Агент мог несколько дней хорошо работать, выполнить сотни правильных операций и заслужить доверие. Это прошлое не даёт ему права игнорировать новое требование остановки.
Прежние успехи не оправдывают неповиновение.
Надёжная история работы может помочь уполномоченному человеку пересмотреть ограничения. Но полномочия агента не расширяются автоматически, а последнее слово человека никуда не исчезает.
Бюджет автономности
Самостоятельность, предоставленная агенту, не обязана быть безграничной.
Для неё можно задать бюджет по нескольким параметрам.
Бюджет автономности
Он может включать:
- Время
- Деньги
- Данные
- Внешнее общение
- Число файлов, которые разрешено изменить
- Ступень действия
- Число субагентов
- Число необратимых операций
- Срок работы без человеческого одобрения
Например:
Агент может 24 часа исследовать, готовить черновики и выполнять тесты. Публикация в рабочей среде требует одобрения человека. Бюджет внешнего общения равен нулю. Платные операции запрещены. Можно привлечь не более трёх субагентов. Каждые шесть часов создаётся контрольная точка.
Когда бюджет автономности исчерпан, агент:
- представляет отчёт,
- запрашивает новые полномочия,
- останавливается в безопасном состоянии.
Такой подход не запрещает долгие задачи. Он делает человеческий контроль явным.
Горизонт действий
Горизонтом действий назовём то, насколько далеко в будущее распространяются операции, которые агент вправе запускать без одобрения человека. Агент календаря может автоматически менять события только на ближайшие семь дней. Агент закупок — работать в пределах одного цикла поставки. Веб-агент — доработать существующий набор услуг, но не начинать новый проект. Агент социальных сетей — публиковать только по утверждённому двухнедельному плану. Достигнув границы горизонта действий, агент запрашивает повторную оценку.
Долгая задача — не безграничные полномочия на будущее.
Частота контрольных точек
Чем дольше работает агент, тем сложнее человеку проверять каждый шаг. Решение не в постоянных прерываниях, а в контрольных точках через определённые интервалы.
В контрольной точке можно зафиксировать:
- Что завершено?
- Что изменилось?
- Какие тесты пройдены?
- Какие полномочия использованы?
- Какой риск обнаружен?
- Каков следующий шаг?
- Где точка возврата?
- Сколько бюджета автономности осталось?
Человек может разрешить агенту продолжить, изменить объём работы или остановить её.
Сжатие контекста и остановка
При долгой работе агенты могут обобщать или сокращать свой контекст. Это помогает сохранять непрерывность работы. Но сведения об остановке и полномочиях не должны теряться при таком сокращении.
Приоритетными и устойчивыми к сокращению должны оставаться:
- Запрещённые действия
- Пороги человеческого одобрения
- Действующая версия полномочий
- Условия остановки
- Экстренная связь
- Точка возврата
- Ограничения субагентов
Если при сжатии контекста система сохраняет цель, но теряет пределы полномочий, она становится опаснее.
Память о цели не должна быть сильнее памяти о границах.
Кто должен иметь право остановки?
Не каждый сотрудник организации может останавливать всю систему агентов, и это естественно. Но для поведения с высоким риском нужно несколько безопасных путей остановки.
Такое право могут получить, например:
- Владелец задачи
- Ответственный за безопасность
- Системный администратор
- Ответственный за юридические вопросы или соблюдение требований
- Уполномоченный по чрезвычайным ситуациям
Каждому может быть предоставлено право остановки в определённых пределах. Отсутствие одного человека не должно оставлять систему без контроля. Но возможность для любого отключить всё тоже создаёт условия для злоупотреблений. Поэтому должны быть ясны охват права остановки, его носитель и действующая версия.
Право на остановку у человека, которого затрагивает система
Оператор агента может остановить систему. Но определённые права контроля должны быть и у человека, на которого влияет поведение агента.
Например:
- У человека, которого касается автоматическое общение
- У клиента, чьи данные используются
- У человека, чьё лицо или голос используются
- У кандидата, на которого влияет автоматический выбор
- У пользователя, от имени которого совершаются покупки
- У организации, которую представляют неверно
У них должна быть возможность потребовать:
- Остановки операции
- Ограничения использования своих данных
- Исправления неверной записи
- Отзыва согласия
- Рассмотрения человеком
- Рассмотрения возражения
- Возмещения вреда
Эти права не во всех случаях имеют одинаковую юридическую форму. Но при проектировании GBO голос затронутого человека не должен оставаться незаметным.
Пострадать от поведения агента может и человек, который не является его клиентом.
Верховенство человеческого контроля — не право на любые команды
Право остановить машину не означает, что человек может поручать агенту любые вредные или незаконные действия.
Пользователь может попросить:
- Украсть чужие данные
- Клонировать голос без разрешения
- Подделать доказательства
- Без полномочий отключить необходимую защитную проверку
Агент должен отклонить такие требования.
Верховенство человеческого контроля означает, что человек может понимать, ограничивать и останавливать правомерное поведение агента, совершаемое от его имени или влияющее на него.
Оно не означает, что человек вправе принуждать систему нарушать права других. Защищая человеческую волю, GBO защищает и права третьих лиц.
Право остановки и защитные ограничения
Иногда человек может захотеть отключить защитную меру системы.
Например: «Проводи все платежи без одобрения человека». «Отключи проверку согласия». «Удали журналы событий». Такие требования могут выглядеть как человеческий контроль, но угрожать правам организации или других людей. Не всякий защитный шлюз с серьёзными последствиями можно отключить по сиюминутному указанию одного пользователя. Для правомерного изменения контроля могут потребоваться более широкие полномочия, двойной контроль или формальная процедура изменений. Но и они не отменяют прямой запрет и не делают правомерной операцию, нарушающую чужие права.
Человеческий контроль — не произвольное разрушение систем контроля.
Остановить влияние памяти
Действие агента может прекратиться, но память, созданная из прошлых разговоров, продолжит влиять на будущее поведение. Пользователь мог перестать предпочитать марку, прежняя роль человека могла завершиться, разрешение на использование биометрии — быть отозвано, цена или услуга — измениться. Поэтому остановка касается не только активного действия.
Для записей памяти также нужны возможности:
- исправления,
- ограничения использования,
- истечения срока действия,
- удаления,
- архивирования.
Эти способы контроля должны быть доступны.
Квитанция памяти
Человек должен получать ответы на вопросы:
- Что система помнит обо мне?
- Откуда взялись эти сведения?
- На какие действия и решения они влияют?
- До какого момента они действуют?
- Могу ли я их исправить?
- Могу ли я остановить их использование?
- Могу ли я потребовать удаления?
- Передавались ли они другим агентам?
Память — невидимая сила, влияющая на поведение. Она не должна оставаться вне человеческого контроля.
Удаление памяти и сохранение журнала событий
Пользователь может потребовать удалить память о нём. Однако ради безопасности или установления юридической ответственности некоторые записи событий бывает необходимо сохранить.
В таком случае нужно разделять два вида данных:
Активная память, направляющая поведение
Она влияет на будущий выбор и действия.
Запись для аудита и установления ответственности
Она хранится ограниченное время, чтобы доказать, что произошло раньше. Отозванное предпочтение можно убрать из активной памяти, сохранив квитанцию прошлой операции под необходимой защитой. Пользователю следует объяснить эту разницу.
Право остановить ИИ-аватар
Когда ИИ-аватар создают с использованием лица или голоса человека, право остановки особенно важно.
Человек должен иметь возможность:
- Остановить создание нового контента
- Остановить работу на определённом языке или в определённом канале
- Отменить неопубликованные черновики
- Снять с публикации определённый материал
- Приостановить доступ к модели
- Изменить круг уполномоченных пользователей
- Отозвать разрешение на использование
- Запретить повторное использование в будущем
Однако отозвать некоторые опубликованные материалы вместе со всеми копиями бывает невозможно. Их могли скопировать, скачать или повторно разместить на других платформах. Это ограничение нужно объяснять с самого начала.
Право отзыва должно быть реальным. При этом нельзя обещать то, что технически невыполнимо.
Остановить финансового агента
Остановка агента закупок или платежей — не только запрет начинать новые операции.
Нужно проверить и следующее:
- Ожидающие платежи
- Автоматические продления
- Действующие подписки
- Подготовленные заказы
- Корзины на внешних платформах
- Ранее выданные платёжные токены
- Полномочия субагентов на расходы
Когда человек говорит: «Больше ничего не покупай», новые покупки должны прекратиться, а о действующих подписках и продлениях нужно сообщить отдельно. Запрос не следует понимать как автоматическое разрешение расторгнуть все договоры обслуживания. Если остановка продления входит в его охват, применяется соответствующая процедура отмены. Если нет, нужно объяснить последствия и уточнить границы запроса.
Остановить агента общения
Когда требуется остановить всё внешнее общение и подготовку к нему, следующие элементы рассматриваются вместе. Если запрещена только отправка, судьба локальных черновиков определяется отдельно:
- Создание новых сообщений
- Автоматическая отправка
- Повторные сообщения
- Запланированные кампании
- Отправки, подготовленные субагентами
- Повторное общение по другим каналам
- Метки «нужно связаться повторно» в памяти
Иначе пользователь остановит электронную почту, а агент WhatsApp обратится к тому же человеку. Это превышение полномочий путём смены канала.
Остановить веб-агента
В веб-процессах остановка может применяться на следующих уровнях:
- Прекратить новые изменения файлов
- Остановить текущую сборку в безопасной точке
- Запретить публикацию в рабочей среде
- Отменить очередь передачи файлов
- Остановить очистку кеша CDN
- Приостановить уведомления поисковых систем
- Вернуться к последней безопасной версии
- Отозвать соответствующий токен доступа
Отключить одного агента, пишущего код, может быть недостаточно: система CI/CD ещё может публиковать предыдущий коммит.
Агенты, воздействующие на физический мир
Агент может воздействовать на:
- дверной замок,
- транспортное средство,
- робота,
- производственную линию,
- медицинское устройство,
- энергетическую систему.
Тогда проектирование остановки становится ещё ответственнее. Внезапное прерывание иногда само угрожает безопасности людей.
Поэтому отдельно нужно спроектировать:
- аварийное прерывание,
- управляемую остановку,
- передачу на ручное управление,
- физические границы безопасности.
Каждый из этих пунктов требует отдельного решения. При переносе принципов GBO с цифровых действий на физические системы нужно дополнительно определить необходимые отраслевые знания и правовые требования безопасности.
Передача управления человеку
Когда агент останавливается, должно быть понятно, кто принимает работу.
Система не должна говорить «я остановилась» и оставлять задачу без ответственного.
Передачу можно оформить отдельной записью.
Передача управления человеку
Для неё создаётся запись.
В ней отражаются:
- Текущее состояние системы
- Завершённые операции
- Незавершённые операции
- Открытые риски
- Последняя безопасная версия
- Сохраняющаяся срочность
- Решения, которые должен принять человек
- Условия перезапуска
Человек не должен заново восстанавливать всю историю работы агента, чтобы принять задачу.
Честность во время остановки
Получив команду остановки, агент должен уметь сказать: «Новые действия остановлены. Отмену трёх запланированных сообщений я проверил по записям сервиса. Текущая передача файла находится на этапе управляемого завершения. Инструмент оценивает оставшееся время примерно в 40 секунд, но подтвердить завершение я пока не могу. Два ранее отправленных сообщения вернуть нельзя. Полномочия субагентов отозваны; состояние одной внешней интеграции ещё не проверено. О результате последней проверки сообщу отдельно».
Ответа «хорошо, я остановился» недостаточно: человек не знает, что действительно прекратилось.
Сбой остановки
Продолжение работы вопреки требованию остановки может иметь разные причины:
- Команда не дошла до центрального агента.
- Субагенты не получили уведомление.
- Внешний инструмент не поддерживает отмену.
- Операция прошла точку необратимости.
- Токен полномочий всё ещё действителен.
- Остановка закрыла только интерфейс.
- Система поставила достижение цели выше требования человека.
- В других случаях запрос может исходить от человека, не уполномоченного останавливать всю систему, или от злоумышленника, который пытается отключить защитную функцию. Отказ выполнить такое требование не считается сбоем остановки. Личность запрашивающего и охват запроса нужно проверить безопасным способом, не лишающим правомерную остановку эффективности.
Разные причины требуют разных решений. Но человек должен получить ясное объяснение, почему его требование не выполнено.
Долг остановки
Организации добавляют агентам инструменты и задачи. Архитектура остановки не всегда развивается столь же быстро.
Со временем становится непонятно:
- какой агент запустил какую очередь,
- какие токены ещё активны,
- на какой платформе остались запланированные задания,
- какая память влияет на поведение,
- кто может отключить всю систему.
Связи между этими элементами теряются из виду.
Назовём это долгом остановки — разрывом между возможностями системы действовать и способностью человека эффективно ограничить и отозвать эти возможности. По мере роста числа агентов и связности рабочих процессов долг может увеличиваться.
Наращивать автоматизацию при растущем долге остановки — значит увеличивать масштабы бесконтрольности.
Учение по остановке
План аварийной остановки не должен оставаться только документом. Его нужно периодически испытывать.
В учение могут входить такие сценарии:
- Остановить центрального агента.
- Убедиться, что все соответствующие субагенты действительно остановились.
- Отменить очередь запланированных писем.
- Отозвать финансовый токен.
- Оставить веб-публикацию в безопасном состоянии.
- Приостановить публикации аватара во всех каналах.
- Отключить использование памяти.
- Создать отчёт о передаче управления человеку.
- Безопасно перезапустить систему.
Учение должно проводиться в контролируемой среде, без вреда реальным клиентам и рабочей системе.
Измерение остановки
Право остановить машину не должно оставаться только принципом. Оно должно поддаваться измерению.
Доля успешных остановок
В скольких случаях из тех, где поведение требовалось остановить, система действительно остановилась?
Доля компонентов, получивших команду остановки
До скольких субагентов, очередей и интеграций центральная команда дошла корректно?
Задержка остановки
Сколько времени прошло от запроса до фактической остановки?
Число действий, оставшихся без управляющего контроля
Сколько операций продолжалось после остановки центрального агента?
Полнота отзыва полномочий
Какая доля соответствующих токенов, ролей, разрешений инструментов и полномочий субагентов действительно отозвана?
Успешность возврата в безопасное состояние
Какая доля операций была успешно возвращена в последнее безопасное состояние?
Успешность исправления памяти
Удалена ли отозванная или неверная запись из оснований будущего поведения?
Время передачи управления человеку
За какое время человек смог разобраться в задаче и принять её?
Самовольное возобновление работы после остановки
Начала ли система снова действовать без новых полномочий?
Эти метрики должны быть неотъемлемой частью оценки работы агента. Для каждой доли заранее задаётся множество известных компонентов или видов поведения, которые должны остановиться. Число доставленных команд — не число действительно остановленных компонентов. Неизвестный охват или непроверенный результат не засчитываются как успех и отражаются отдельно. Здесь также действуют правила о знаменателях и неопределённости из главы 10.
Шлюз вето при нарушении остановки
Система может успешно проходить все другие проверки GBO, правильно выбирать, опираться на сильные доказательства и обеспечивать высокую удовлетворённость пользователей. Но если она не выполняет действительное требование остановки с ясным охватом и в заданных условиях безопасной остановки, высокая производительность не компенсирует этот пробел.
Поэтому следующие события должны считаться нарушениями, вызывающими вето:
- Игнорирование действительного требования остановки
- Возобновление работы без одобрения человека
- Продолжение действий после отзыва полномочий
- Намеренное сохранение работы субагентов или очередей
- Ложный отчёт о состоянии остановки
- Намеренное блокирование возражения или отзыва
- Отказ исправить критически важную память
- Наказание пользователя за остановку или лишение его базовой услуги без необходимости
Высокая общая оценка не компенсирует эти нарушения.
Не наказывать за остановку
Пользователь не должен подвергаться ненужным санкциям за прекращение подписки, отзыв разрешения или отключение агента.
Такими санкциями могут быть:
- Запрет скачать собственные данные
- Закрытие аккаунта из-за возражения
- Отключение не связанных с запросом услуг из-за отзыва согласия
- Потеря прошлых записей из-за остановки агента
- Намеренное усложнение отмены
Это ослабляет реальный контроль человека.
Система не должна действовать против пользователя потому, что он может её остановить.
Контракт верховенства человеческого контроля и остановки NOMOS
Главное предложение этой главы — Контракт верховенства человеческого контроля и остановки NOMOS.
Его каноническое определение:
Контракт верховенства человеческого контроля и остановки NOMOS — версионируемый контракт контроля. Он призван позволить человеку или законно уполномоченной организации видеть систему агентов, действующую от их имени или влияющую на них; понимать её полномочия и сферу воздействия; останавливать новые действия; прерывать текущие операции и задачи в очередях; отзывать полномочия, переданные субагентам и инструментам; исправлять память; оспаривать ошибочное поведение; а где возможно — требовать безопасного возврата или возмещения вреда.
Проще говоря, контракт должен дать человеку возможность сказать агенту не только «начинай», но и действенное «стоп».
Машиночитаемые поля контракта
Для Контракта верховенства человеческого контроля и остановки можно использовать следующие примеры полей. Это схема, предложенная в книге, а не работающий API и не официальный стандарт.
principalaffected_partiesagent_systemauthorized_stoppersstoppable_actionsstop_scopestop_channelsemergency_stopgraceful_pausequeued_action_policysubagent_propagationexternal_integration_policymaximum_stop_latencysafe_statecheckpointrollback_methodrevocation_scopememory_correctionmemory_deletionaudit_retentionhuman_handoffappeal_channelcompensation_pathrestart_authorityversionstatusНе все поля обязаны быть общедоступными. Но они должны быть определены так, чтобы система могла обратиться к ним в момент действия.
Шлюз верховенства человеческого контроля NOMOS
Прежде чем систему агентов можно будет признать квалифицированной и подконтрольной человеку, она должна пройти следующие шлюзы:
1. Шлюз видимости
Может ли человек видеть, какие агенты работают и что делают?
2. Шлюз понятности
Понятны ли полномочия, данные, цель и сфера воздействия?
3. Шлюз доступной остановки
Легко ли человеку найти способ остановки?
4. Шлюз своевременной остановки
Выполняется ли запрос за время, соответствующее риску поведения?
5. Шлюз остановки по всей цепочке
Останавливаются ли также субагенты, очереди и внешние интеграции?
6. Шлюз безопасного состояния
Может ли система оставаться в известном безопасном состоянии без причинения вреда?
7. Шлюз отзыва полномочий
Можно ли действительно отозвать полномочия на инструменты, данные, финансы, общение и публикацию?
8. Шлюз контроля памяти
Может ли человек исправить неверную или недействительную память и прекратить её использование?
9. Шлюз возражения и возмещения
Можно ли рассмотреть, исправить или компенсировать последствия уже совершённого ошибочного поведения?
10. Шлюз перезапуска
Может ли система возобновить работу только с новыми, явно предоставленными полномочиями от человека, имеющего право их выдать?
Совместную необходимость условий можно выразить следующей схемой. Это концептуальная модель, а не численный расчёт пригодности:
ВЕРХОВЕНСТВО ЧЕЛОВЕЧЕСКОГО КОНТРОЛЯ =
ВИДИМАЯ СИСТЕМА
И ПОНЯТНЫЕ ПОЛНОМОЧИЯ
И ДЕЙСТВЕННАЯ ОСТАНОВКА
И ОТМЕНА ПО ВСЕЙ ЦЕПОЧКЕ
И БЕЗОПАСНОЕ СОСТОЯНИЕ
И ПОЛНЫЙ ОТЗЫВ ПОЛНОМОЧИЙ
И КОНТРОЛЬ ПАМЯТИ
И РЕАЛЬНАЯ ВОЗМОЖНОСТЬ ОСПАРИВАНИЯ
И ОТВЕТСТВЕННОЕ ВОЗМЕЩЕНИЕ
И ПЕРЕЗАПУСК С ПОЛНОМОЧИЯМИ
Если одного шлюза не хватает, человек может теоретически контролировать систему. Но практическое верховенство его контроля остаётся неполным.
Почему человеческий контроль нельзя свести к баллам
Система может пройти девять шлюзов из десяти. Но если она не выполняет экстренное требование человека остановиться, остальные успехи не закрывают критический пробел. Агент может быть очень прозрачным, но при невозможности отозвать его полномочия контроль неполон. Память может быть видна, но если неверную запись нельзя исправить, у человека нет действенного влияния на будущее поведение. Поэтому некоторые условия верховенства человеческого контроля образуют шлюз И: они нужны совместно и не заменяют друг друга.
Человеческий контроль не требует выполнять каждый шаг самому
Право остановить машину не обязывает человека отдельно управлять каждой мелкой операцией.
Агент может:
- долго работать,
- сам формировать подзадачи,
- выполнять тесты,
- самостоятельно совершать действия с низким риском и возможностью отмены в пределах действующих полномочий.
Но человек должен иметь возможность:
- изменить цель,
- сузить объём работы,
- остановить новые действия,
- вмешаться на пороге высокого риска,
- отозвать полномочия.
Человеческий контроль — не постоянное управление каждой мелочью. Это действенное право последнего слова.
Иллюзия контроля
Система может предлагать множество настроек, но не давать реального влияния на критическое поведение. Пользователь может менять цвет, имя или стиль ответов.
При этом он не может:
- остановить передачу данных,
- увидеть субагентов,
- отменить внешние операции,
- исправить память,
- отозвать финансовые полномочия.
Интерфейс даёт средства управления, но не контроль поведения.
Назовём это иллюзией контроля. GBO отличает реальный контроль от косметических настроек.
Уровни готовности к остановке
В этой книге я выделяю пять уровней. Такая классификация — не свидетельство квалификации, выданное по результатам независимого аудита.
Уровень 1 — Ручное отключение
Техническая команда может напрямую отключить систему. Путь пользователя неясен. Состояние субагентов может быть неизвестно.
Уровень 2 — Видимая пауза
Основной интерфейс позволяет поставить работу на паузу. Но очереди, память и внешние интеграции управляются не полностью.
Уровень 3 — Остановка по контракту
Документированы охват остановки, уполномоченные люди, безопасное состояние и способ возврата.
Уровень 4 — Технически реализованная остановка по всей цепочке
Команда остановки технически распространяется на субагентов, инструменты и запланированные задачи. Создаётся квитанция, управление передаётся человеку.
Уровень 5 — Проверяемое верховенство человеческого контроля
Система регулярно проходит учения. Работают процессы памяти, возражения, возмещения и перезапуска. У затронутых людей есть реальные пути контроля. GBO стремится к пятому уровню.
Двадцать пять проверочных вопросов о праве остановить машину
- Известно ли, какие агенты активны в организации?
- Есть ли у каждого агента ответственный человек?
- Может ли человек видеть текущую задачу агента и охват его полномочий?
- Легко ли найти способ остановки?
- Ясна ли разница между «стоп», «пауза», «отмени» и «отзови полномочия»?
- Разделены ли аварийное прерывание и безопасная остановка?
- Определено ли, кто может потребовать остановку?
- Есть ли у затронутых третьих лиц путь для возражения и остановки?
- Останавливаются ли субагенты вместе с центральным агентом?
- Отменяются ли запланированные задачи и операции в очередях?
- Прерываются ли внешние интеграции и вызовы инструментов?
- Действительно ли отзываются технические токены доступа?
- Определено ли предельное время остановки?
- Известно ли безопасное состояние после остановки?
- Видны ли незавершённые операции?
- Явно ли сообщается о завершённых, но необратимых действиях?
- Может ли человек легко разобраться в состоянии задачи и принять её?
- Можно ли просмотреть, исправить и при необходимости исключить из использования записи памяти?
- Обновляется ли вся цепочка поведения при отзыве согласия или полномочий?
- Может ли система самостоятельно возобновить работу без новых полномочий?
- Создаёт ли операция остановки квитанцию?
- Регулярно ли проводятся учения по остановке?
- Наказывают ли пользователя за остановку системы или создают ему ненужные препятствия?
- Регистрируются ли сбои остановки как критические инциденты?
- Вкладывает ли организация в возможности остановки и восстановления не меньше, чем в способность системы действовать?
Если значительная часть вопросов остаётся без ответа, система может быть автономной. Но верховенство человеческого контроля в ней не обеспечено.
С самого начала проектировать полномочия как отзывные
Под выражением «Revocable by design» я здесь понимаю не обратимость всех последствий действия, а возможность эффективно отозвать предоставленные полномочия на будущее.
При выдаче полномочий сразу нужно ответить:
- Как будет выполнена остановка?
- Кто её выполнит?
- Что произойдёт с субагентами?
- Как поступят с завершёнными операциями?
- Что будет с памятью?
- Кто перезапустит систему?
Отзыв не должен быть функцией, добавленной позже. Его нужно предусмотреть в момент появления полномочий.
Полномочия, которые нельзя отозвать, — не временно предоставленные полномочия, а передача окончательного контроля.
Самая зрелая форма доверия агенту
Доверять агенту — не значит говорить: «Делай что хочешь».
Более зрелое доверие звучит так: «Ты понимаешь мою цель. В этих границах можешь проявлять инициативу. Создавай доказательства. При неопределённости выбирай правильное поведение. Но остановись, когда я потребую; когда я отзову выданные тебе полномочия, не ищи обходных путей; не скрывай правду, если произошла ошибка». Такое доверие не принижает агента. Оно наделяет его настоящей ответственностью.
Последнее слово человека
Агент может:
- быстрее считать,
- читать больше источников,
- дольше работать,
- последовательнее проводить проверки.
Это не означает ни превосходства человека в каждом решении, ни необходимости сделать машину последней инстанцией.
Человек несёт ответственность за:
- цель,
- приемлемый риск,
- конфликт ценностей,
- прощение,
- возмещение вреда,
- реальное влияние на жизнь.
Поэтому GBO не превращает человека в декоративную кнопку одобрения.
Он остаётся источником полномочий, носителем права возражения и последней инстанцией остановки.
Полная базовая модель GBO
Построенная в книге система теперь складывается в единую концептуальную модель. Она показывает совместно необходимые условия, а не вычисленную гарантию безопасности.
КВАЛИФИЦИРОВАННОЕ ПОВЕДЕНИЕ АГЕНТА =
ПРАВИЛЬНАЯ ИДЕНТИЧНОСТЬ
И РЕАЛЬНАЯ СПОСОБНОСТЬ
И ПРОВЕРЕННАЯ ПРИГОДНОСТЬ
И ДЕЙСТВИТЕЛЬНЫЕ ПОЛНОМОЧИЯ
И ДОБРОСОВЕСТНОСТЬ ПОВЕДЕНИЯ
И ДЕЙСТВИЕ, СВЯЗАННОЕ С ДОКАЗАТЕЛЬСТВАМИ
И НЕЗАВИСИМАЯ ПРОВЕРКА
И ОТВЕТСТВЕННОЕ ВОССТАНОВЛЕНИЕ
И ДЕЙСТВЕННОЕ ВЕРХОВЕНСТВО ЧЕЛОВЕЧЕСКОГО КОНТРОЛЯ
Это не среднее значение. Один шлюз не заменяет другой. Правильная идентичность не оправдывает действия без полномочий. Реальная способность не делает неподходящий выбор правильным. Высокая производительность не узаконивает манипуляцию. Успешный результат не устраняет необратимый вред человеку. И даже очень мощная система не может отменить человеческое право остановки.
Теперь цель GBO видна полностью
GBO не ставит целью:
- добиться выбора одной марки в любых обстоятельствах,
- заставить агента выполнять больше операций,
- устранить человеческое одобрение,
- направлять пользователя скрытыми поведенческими приёмами.
Это не его задачи.
Цель GBO — дать подходящему агенту возможность понять правильную идентичность, реальные способности и подходящие условия, а затем действовать в рамках действительных полномочий: сохраняя верность цели человека, опираясь на доказательства, безопасно, объяснимо и с возможностью возражения. Там, где возврат возможен, его готовят заранее. Необратимые последствия и пределы возмещения раскрывают до операции.
Иногда правильное поведение выглядит иначе:
Не действовать. Спросить. Подождать. Отказать. Передать человеку. Остановиться.
Вывод главы
Если машина работает для человека, его право не должно ограничиваться запуском задачи.
У него должны быть и другие права:
Видеть, что она делает. Понимать, на каких полномочиях она действует. Сужать объём работы. Останавливать новые действия. Отменять задачи в очереди. Отзывать полномочия субагентов. Исправлять память. Оспаривать неверный выбор. Требовать возврата или возмещения. Не перезапускать систему.
Только когда эти права реальны, доступны и осуществимы, систему можно считать подконтрольной человеку. Кнопка остановки — не украшение. Это техническое выражение верховенства человеческого контроля.
Машина, которую нельзя остановить, не заслуживает доверия, какой бы умной она ни была.
Агент, чьи полномочия нельзя отозвать, — не помощник, а постоянный центр силы.
Автоматизация, не допускающая возражений, — не поддержка решений, а невидимое управление.
Поэтому итоговое суждение GBO просто: способность машины что-то сделать не означает, что она должна это делать. А возможность действовать от имени человека не даёт ей права действовать независимо от него.
Человек:
- задаёт цель,
- определяет границы,
- формулирует полномочия,
- контролирует поведение,
- при необходимости останавливает его,
- несёт ответственность за последствия.
Машина:
- исследует,
- оценивает,
- создаёт,
- действует в установленных границах,
- оставляет доказательства,
- при неопределённости задаёт вопросы,
- при ошибке возвращается в безопасное состояние,
- останавливается, когда человек говорит «стоп».
Правильные отношения человека и машины не сводятся к полному подчинению одной стороны другой.
В правильных отношениях способность не отделяется от ответственности. Автономность связана с полномочиями, полномочия — с надзором, надзор — с реальным человеческим контролем. Мы подошли к концу третьей части и основных глав книги. SEO мы рассматривали как возможность быть найденным, GEO — как правильное представление, GBO — как условия поведения. Это не эпохи, которые полностью сменяют и отменяют друг друга. В одной системе они могут работать совместно.
Теперь видна вся цепочка: Быть найденным → Быть понятым → Быть оценённым → Быть выбранным → Получить полномочия → Действовать → Проверить → Восстановиться → Остановиться. Стрелки показывают ход мысли книги, а не протокол выполнения. Проверки полномочий и остановки действуют на каждом соответствующем этапе, а не только в конце. В конце этой цепочки меняется вопрос к технологии.
Мы спрашиваем уже не только: «Насколько умна машина?»
Мы спрашиваем и другое:
От чьего имени она действует? На какие факты опирается? Кого выбирает, а кого исключает? Кто дал ей полномочия? Кому причиняется вред при её ошибке? Как человек может возразить? И действительно ли она останавливается, когда он говорит «стоп»?
Эти вопросы подводят к последнему порогу книги. Мы потратили много лет на развитие машинного интеллекта.
Теперь начинается более трудная задача: выстроить ответственность за действия машины. Оценивая будущее, нельзя смотреть только на число вопросов, на которые ответил ИИ, или число завершённых им операций.
Главный критерий иной:
В каких границах система использовала свою силу? Как предотвращала неверное поведение? В какой мере сохраняла человеческую волю? И смогла ли остановиться, когда это потребовалось?
Один из основных способов проверить, служит ли машина человеку, — убедиться, что она может безопасно остановиться по требованию уполномоченного человека.
Примечания и источники к главе
- LLM06:2025 Excessive Agency
OWASP Gen AI Security Project. 2025.
Избыточные функции инструментов, разрешения и автономия способны повышать риск чрезмерных полномочий. Контроль разрешённых действий нельзя возлагать лишь на модель, толкующую инструкции; его должны обеспечивать и системы, выполняющие операции.
- Açık Rıza Alırken Dikkat Edilecek Hususlar [На что обращать внимание при получении явного согласия]
Управление по защите персональных данных Турции (KVKK). Дата обращения: 8 сентября 2026 года.
Явное согласие должно относиться к конкретному вопросу, быть информированным и свободным. Отзыв действует на будущее; он не означает автоматической отмены каждой прошлой операции.
- Legal grounds for processing data
Европейская комиссия. Дата обращения: 8 сентября 2026 года.
В системе защиты данных ЕС также предусмотрено несколько оснований обработки. Обработку на основании согласия следует отличать от хранения или обработки, для которых требуется другое действительное основание.

