Разрыв в оценке ИИ-агентов: половина компаний уже обожглась в проде
VentureBeat Pulse Research опросил 157 крупных компаний: половина уже деплоила ИИ-агента, который прошёл внутренние тесты и провалился у клиента. Только 5% полностью доверяют автоматической оценке. При этом две трети уже работают или движутся к деплою без человека в петле.
VentureBeat опубликовал волну Pulse Research по корпоративным ИИ-агентам - и цифры говорят об одном: компании дают агентам всё больше автономии, при этом всё меньше доверяя тестам, которые должны эту автономию контролировать.
Что за исследование
В опросе участвовали 157 предприятий. Исследователи разбирались, как технические лидеры измеряют производительность агентов, какие платформы для оценки и надёжности они используют, что ломается в продакшне и насколько далеко они готовы пустить агентов без участия человека.
Главная находка: evaluation gap
Центральный вывод исследования - «разрыв в оценке» (evaluation gap). Это расстояние между тем, сколько автономии компании дают своим агентам, и тем, насколько они доверяют тестам, призванным эту автономию контролировать.
Конкретные цифры:
- 50% организаций за последний год деплоили агента или LLM-фичу, которая прошла внутренние тесты и вызвала сбой на стороне клиента.
- Каждая четвёртая компания видела это больше одного раза.
- Лишь 5% (один из двадцати) говорят, что полностью доверяют автоматической оценке сегодня.
- Самая часто называемая слабость тестов - они не совпадают с тем, что происходит в реальном мире.
Две трети всё равно идут к деплою без человека
При всём этом две трети компаний уже разрешают или активно движутся к тому, чтобы деплоить изменения агентов в прод на основе одной только автоматической оценки - без человека в петле.
То есть компании знают, что тесты ненадёжны. Знают, что агенты уже подводили клиентов. И всё равно убирают человека из цикла согласования.
Проблема не в покрытии, а в выравнивании
Исследование явно называет это «проблемой выравнивания с реальностью» (reality-alignment problem), а не проблемой покрытия. Иными словами, компаниям не хватает не количества тестов - тесты просто проверяют не то, что важно в боевых условиях.
Именно поэтому агент может пройти все чекпоинты и при этом сделать что-то неприемлемое для реального пользователя.
Что это значит
Если ты строишь или эксплуатируешь ИИ-агентов в рабочих продуктах - это исследование стоит принять близко к сердцу. Проблема не в том, что у тебя нет тестов. Проблема в том, что твои тесты, скорее всего, не моделируют реальное поведение пользователей достаточно точно.
Два конкретных вопроса, которые стоит задать своей команде прямо сейчас:
- Когда последний раз тест-кейсы обновлялись на основе реальных инцидентов в проде?
- Есть ли у вас механизм, который фиксирует клиентские сбои и возвращает их в тестовый набор?
Пока эта петля не замкнута, разрыв между тестами и реальностью будет только расти - сколько бы автономии ты ни давал агенту.
Источник: VentureBeat Pulse Research, The agent evaluation gap, 16 июля 2025