AI-агенты без контроля человека: как бизнес управляет рисками
Rubrik, публичная компания в сфере защиты данных, запустила эксперимент: AI-агенты получили право действовать без подтверждения каждого шага со стороны человека. Вместо человека решения одобряет другая AI-модель, которая в реальном времени проверяет каждое действие агента на соответствие политикам компании.
Этот эксперимент поставил перед бизнесом вопрос, который до сих пор не имеет однозначного ответа: можно ли доверить надзор за AI-агентами другому AI — и как измерить, насколько этот надзор надёжен?
Почему «человек в петле» перестал работать
Когда Rubrik внедряла пилоты Claude Code и Cowork, каждый запрос агента требовал подтверждения от сотрудника. Разработчики быстро начали игнорировать эти запросы — в корпоративном Slack появился тред из 120 сообщений с жалобами на то, что одобрение превратилось в формальность, сравнимую с принятием пользовательского соглашения iTunes.
Rubrik Zero Labs провела исследование среди более 1600 IT- и security-руководителей. Результат: у 80% организаций мониторинг и одобрение действий агентов отнимает больше времени, чем агенты экономят. Это означает, что модель «человек одобряет каждый шаг» не масштабируется: чем больше агентов, тем выше нагрузка на людей и тем менее реальным становится контроль.
Параллельная проблема — сами политики. Внутреннее правило Rubrik гласило, что агенты обязаны соблюдать политику использования данных клиентов. Но эта политика — трёхстраничный юридический документ. Перевести его в набор машиночитаемых правил оказалось невозможным. Аналогичная ситуация с Salesforce: правило «агент не должен редактировать поля выручки» не работает, потому что Salesforce не маркирует поля как «поля выручки» — администраторам приходилось одобрять все действия в системе вручную.
Как устроен AI-надзор внутри Rubrik
Ответом стал SAGE — Semantic AI Governance Engine, арбитражный слой внутри Rubrik Agent Cloud. SAGE читает семантическое намерение за каждым действием агента и сверяет его с политиками, написанными на естественном языке. Вместо списков «разрешить / запретить» система понимает контекст: безобидный запрос к Salesforce она отличает от попытки изменить финансовые данные.
Чтобы экономика решения работала, SAGE построен на малой языковой модели. По словам GM по AI Rubrik Dev Rishi, она работает на порядок дешевле и быстрее, чем фронтирные LLM. Удвоение стоимости и задержки ради безопасности неприемлемо для большинства компаний — это условие было заложено в архитектуру изначально.
SAGE представляет собой набор специализированных судей, каждый из которых обучен на конкретную задачу: один отслеживает галлюцинации при использовании инструментов, другой блокирует утечку персональных данных до того, как они покинут периметр. Security- и GRC-команды начали добавлять в тот же слой финансовые правила — в том числе запрет на использование AI-бюджета в личных целях.
Rubrik Agent Cloud вышел в общий доступ в феврале 2026 года. Часть функций, описанных Rishi, ещё находится в процессе развёртывания. В частности, бэктестинг — возможность проиграть исторические действия агентов против новой политики и увидеть, где политика бы сработала, а где действие прошло бы незамеченным — только начинает выходить.
Угрозы, которые не видны в отдельном действии
Особую тревогу у Rishi вызывает то, что исследователь в области безопасности Саймон Уиллисон в июне 2025 года назвал «летальной триадой»: агент, имеющий доступ к приватным данным, обрабатывает непроверенный внешний контент и при этом располагает каналом для передачи данных наружу.
Опасность не в каждом отдельном разрешении, а в их комбинации. Агент с доступом к Salesforce и корпоративной почте не сделал ничего запрещённого — до тех пор, пока не начнёт автоматически пересылать данные клиентов во внешний адрес. Традиционные системы управления доступом (IAM) создавались в расчёте на то, что человек, которому выданы права, использует их осознанно. Агент этого суждения лишён.
Отдельный опрос VentureBeat среди 107 корпоративных респондентов показал: 69% компаний используют общие API-ключи где-то в своём парке агентов. Компании с общими учётными данными фиксировали инцидент безопасности или близкий промах в 63,5% случаев — против 40,9% у тех, где каждый агент работает со своими учётными данными.
Ещё одна категория угроз — атаки, невидимые на уровне одного шага. Ни одно отдельное действие агента не нарушало правил, но полная трассировка сессии указывала на проблему. Rubrik Agent Cloud запускает пакетный анализ целых сессий каждый час или каждый день и выявляет то, что не поймал ни один отдельный контроль. Согласно тому же отчёту Zero Labs, 88% организаций не могут откатить действия агентов без нарушения работы систем — это разрыв, который напрямую касается восстановительных возможностей бизнеса.
Исследование VentureBeat, представленное на той же конференции, фиксирует разрыв между декларациями и реальностью: две трети предприятий (66%) уже допускают или строят путь к продуктивному развёртыванию без проверки человеком, однако лишь 5% полностью доверяют автоматизированным оценкам, которые делают это решение возможным. 82% компаний по-прежнему называют встроенные защитные механизмы основного AI-провайдера своим главным слоем безопасности агентов, и 59% планируют за следующие 12 месяцев внедрить, добавить или заменить инструменты безопасности агентов.
При этом открытым остаётся принципиальный вопрос: SAGE — недетерминированная модель, надзирающая за другими недетерминированными моделями. Данных о частоте ложных срабатываний и пропущенных угроз публично не представлено. Единственный механизм подотчётности сейчас — аудиторский след: бэктестинг и пакетные инсайты сохраняют историю каждого решения SAGE, доступную для просмотра людьми. До появления независимого бенчмарка AI-надзор остаётся операционной ставкой, а не верифицированным контролем.
Для руководителей, принимающих решения об автоматизации прямо сейчас, имеет смысл задать три конкретных вопроса своим командам: сколько из действующих контролей зависит от того, что человек нажимает «одобрить», и что происходит с этой нагрузкой при росте числа агентов; есть ли в стеке что-то, что анализирует семантическое намерение действий агента, а не только списки разрешений; может ли команда проиграть действия агентов против новой политики и откатить многошаговую сессию без остановки систем.
Практический вывод: прежде чем расширять парк AI-агентов, проведите аудит того, как сочетаются выданные им разрешения — именно комбинация доступов к нескольким системам создаёт риски, невидимые при взгляде на каждое разрешение по отдельности.