AI-агенты в бизнесе: почему провал тестов не останавливает автоматизациюИИ-генерация видео для бизнеса: что уже работает, а что пока экспериментBackstage бизнеса как контент: почему показ процесса удерживает аудиторию сильнее результатаAI-агенты на DeepSeek: реальная эффективность и новые ценыКонверсия воронки продаж: где теряются деньги, которых никто не считаетGLM-5.3: новая модель Z.ai меняет подход к AI-агентамРучной контроль всего: как это выглядит и чем заканчиваетсяAI-агенты саботируют друг друга: риски для бизнесаДенежный поток важнее прибыли: почему прибыльный бизнес умираетDeepSeek Harness: открытый агентный фреймворк и новые цены APIAI-агенты в бизнесе: почему провал тестов не останавливает автоматизациюИИ-генерация видео для бизнеса: что уже работает, а что пока экспериментBackstage бизнеса как контент: почему показ процесса удерживает аудиторию сильнее результатаAI-агенты на DeepSeek: реальная эффективность и новые ценыКонверсия воронки продаж: где теряются деньги, которых никто не считаетGLM-5.3: новая модель Z.ai меняет подход к AI-агентамРучной контроль всего: как это выглядит и чем заканчиваетсяAI-агенты саботируют друг друга: риски для бизнесаДенежный поток важнее прибыли: почему прибыльный бизнес умираетDeepSeek Harness: открытый агентный фреймворк и новые цены API
MEDIA | SKRIPNIKOVA
MEDIA | SKRIPNIKOVA

Журнал о маркетинге, данных и управлении бизнесом

«Данные без системы — просто цифры»

Новости

AI-агенты в бизнесе: почему провал тестов не останавливает автоматизацию

18.08.2026 · Редакция СИСТЕМ · 5 мин

По данным исследования VentureBeat, проведённого в июле среди 108 компаний, 49% организаций зафиксировали ситуацию, когда AI-функция прошла внутреннее тестирование, но впоследствии создала проблему, заметную клиентам. Этот показатель практически не изменился по сравнению с июнем, когда он составлял 50%. Почти каждая четвёртая компания из числа пострадавших сообщила, что подобное происходило более одного раза.

Речь идёт не об отказе системы в техническом смысле — о сбое в логике вывода, который тестовая среда не уловила, но реальный пользователь ощутил. Это принципиальное различие, которое определяет, как бизнес должен выстраивать контроль над AI-решениями.

Что показывает расхождение между уверенностью и результатами

В июле доля компаний, полностью доверяющих автоматизированным проверкам AI-агентов, выросла с 5% до 13%. Одновременно доля тех, кто называл слабое соответствие тестов реальным условиям главной проблемой, снизилась с 29% до 19%. На первый взгляд — прогресс.

Однако ключевой показатель остался на прежнем уровне: половина компаний по-прежнему сталкивается с тем, что прошедший тесты AI-инструмент даёт сбой в реальной эксплуатации. Уверенность в инструментах оценки растёт, а число клиентски-видимых инцидентов не снижается. Это несоответствие — главный сигнал для руководителей, принимающих решения о внедрении AI.

Данные внутри выборки разделились показательно. Среди компаний, которые уже столкнулись с провалом прошедшего тесты агента, лишь 4% полностью доверяют автоматической проверке. Среди тех, у кого таких инцидентов не было, — 24%. Разница шестикратная. Иными словами, наибольшая уверенность в автоматических тестах наблюдается у тех, у кого меньше всего оснований её испытывать.

CTO платформы Raindrop.ai Бен Хилак, чья компания занимается мониторингом ошибок AI-агентов, зафиксировал: крупнейшие корпорации сокращают наборы тестов и снижают приоритет их поддержки. По его словам, по мере роста сложности систем полностью перечислить все возможные сбои становится невозможным, и компании переходят к инструментам обнаружения аномалий — как до, так и после выхода в продакшн.

Почему пострадавшие компании движутся к автоматизации быстрее, а не медленнее

Самый контринтуитивный вывод исследования касается поведения компаний после инцидента. Среди организаций, где тестирование уже пропустило дефект, 85% либо уже разрешают AI-агенту вносить изменения без участия человека, либо строят такой процесс на ближайший год. Среди тех, кто не пострадал, этот показатель составляет 61%.

Одновременно только 11% из числа пострадавших отвергают полную автоматизацию деплоя, тогда как среди «неожёгшихся» таких 24%. Парадокс: компании с доказанным опытом сбоев активнее всего убирают человека из цепочки принятия решений о выпуске.

Исследование предлагает консервативное объяснение: компании, запускающие больше агентов и с большей частотой, статистически чаще встречают инциденты — и одновременно располагают более зрелой инженерной инфраструктурой для автоматизированного деплоя. Впрочем, данные не позволяют установить, какое объяснение верно. Факт остаётся: пережитый инцидент не замедляет движение к автономии.

Есть и структурный риск: если частота сбоев на один деплой остаётся постоянной, а число деплоев растёт, абсолютное количество инцидентов будет увеличиваться, даже если доля компаний, пострадавших хотя бы однажды, не меняется. Июльские данные не измеряют объём инцидентов, поэтому это остаётся риском, вытекающим из паттерна, а не измеренным результатом.

Стратегия, которую выбирают пострадавшие компании, выглядит так: ускорить автоматизацию выпуска и одновременно усилить контроль на выходе. Среди тех, кто уже пережил тестовый провал, 38% назвали инвестиции в human-review приоритетом роста бюджета — против 24% среди компаний без инцидентов. То есть люди из цепочки деплоя уходят, но появляются на этапе проверки результатов после выпуска.

Где реально находится разрыв в контроле качества

Данные о подходах к мониторингу в продакшне объясняют, почему инциденты не снижаются. Среди 106 ответивших на этот вопрос компаний 26% используют инлайн-проверки качества вывода — автоматические судьи или защитные барьеры, анализирующие живой трафик на предмет ошибок в ответах агента. Ещё 26% ориентируются на трассировку транзакций (токены, сырые входы и выходы), 24% — на метрики шлюза (задержка, ошибки, стоимость).

Трассировка и метрики шлюза фиксируют технические сбои: падения, замедления, сломанные запросы. Они не обнаруживают ответ, который технически корректно сформирован, но фактически неверен. В совокупности половина компаний отслеживает, работает ли агент, и лишь чуть более четверти автоматически проверяет, правильно ли он отвечает.

Среди компаний, уже допускающих деплой без одобрения человека, только 28% автоматически проверяют смысл и корректность живых ответов. Большинство организаций, убравших человека из процесса выпуска, не установили семантический контроль качества в качестве компенсирующего механизма.

Рынок инструментов оценки при этом структурируется. Среди первичных платформ лидирует нативная оценка OpenAI — 18%, за ней DeepEval компании Confident AI — 17%, Braintrust — 15%. Доля компаний без специализированной платформы сократилась до 12%. Ключевым критерием выбора стала лёгкость интеграции — 39% против 23% у стоимости. Это говорит о том, что компании ищут инструменты, встраиваемые в существующие пайплайны, а не отдельно стоящие решения.

  • Предварительное тестирование отвечает на вопрос: готов ли агент к выпуску.
  • Мониторинг в продакшне отвечает на вопрос: что агент делает после выпуска и правильны ли его ответы.
  • Трассировка и метрики шлюза не заменяют семантическую проверку качества вывода.
  • Контроль человека смещается с точки деплоя на этап проверки результатов.
  • Рост числа деплоев при постоянной частоте сбоев увеличивает абсолютное число инцидентов.

Совокупность этих факторов формирует операционный разрыв, который не закрывается ни ростом уверенности в тестах, ни увеличением скорости выпуска. Предварительная оценка — это начало мониторинга, а не его конец. Пока большинство компаний не выстроили контроль качества на этапе реальной работы агента с клиентскими данными и сценариями, провалы будут продолжаться.

Практический вывод: прежде чем убирать человека из цепочки деплоя AI-агента, убедитесь, что в продакшне установлен автоматический контроль смысловой корректности ответов — не только технической работоспособности системы; именно этого компонента не хватает у большинства компаний, уже перешедших к автономному выпуску.

Источник: https://venturebeat.com/data/85-of-companies-burned-by-an-ai-mistake-are-racing-to-cut-the-humans-who-might-catch-the-next-one