VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиРазрыв в оценке ИИ-агентов: половина компаний уже обожглась в проде
НовостьНовость

Разрыв в оценке ИИ-агентов: половина компаний уже обожглась в проде

VCL
Редакция
Vibe Coding Lab
16 июля 2026обновлено 16.07
2 мин чтения
КОРОТКО

VentureBeat Pulse Research опросил 157 крупных компаний: половина уже деплоила ИИ-агента, который прошёл внутренние тесты и провалился у клиента. Только 5% полностью доверяют автоматической оценке. При этом две трети уже работают или движутся к деплою без человека в петле.

VentureBeat опубликовал волну Pulse Research по корпоративным ИИ-агентам - и цифры говорят об одном: компании дают агентам всё больше автономии, при этом всё меньше доверяя тестам, которые должны эту автономию контролировать.

Что за исследование

В опросе участвовали 157 предприятий. Исследователи разбирались, как технические лидеры измеряют производительность агентов, какие платформы для оценки и надёжности они используют, что ломается в продакшне и насколько далеко они готовы пустить агентов без участия человека.

Главная находка: evaluation gap

Центральный вывод исследования - «разрыв в оценке» (evaluation gap). Это расстояние между тем, сколько автономии компании дают своим агентам, и тем, насколько они доверяют тестам, призванным эту автономию контролировать.

Конкретные цифры:

  • 50% организаций за последний год деплоили агента или LLM-фичу, которая прошла внутренние тесты и вызвала сбой на стороне клиента.
  • Каждая четвёртая компания видела это больше одного раза.
  • Лишь 5% (один из двадцати) говорят, что полностью доверяют автоматической оценке сегодня.
  • Самая часто называемая слабость тестов - они не совпадают с тем, что происходит в реальном мире.

Две трети всё равно идут к деплою без человека

При всём этом две трети компаний уже разрешают или активно движутся к тому, чтобы деплоить изменения агентов в прод на основе одной только автоматической оценки - без человека в петле.

То есть компании знают, что тесты ненадёжны. Знают, что агенты уже подводили клиентов. И всё равно убирают человека из цикла согласования.

Проблема не в покрытии, а в выравнивании

Исследование явно называет это «проблемой выравнивания с реальностью» (reality-alignment problem), а не проблемой покрытия. Иными словами, компаниям не хватает не количества тестов - тесты просто проверяют не то, что важно в боевых условиях.

Именно поэтому агент может пройти все чекпоинты и при этом сделать что-то неприемлемое для реального пользователя.

Что это значит

Если ты строишь или эксплуатируешь ИИ-агентов в рабочих продуктах - это исследование стоит принять близко к сердцу. Проблема не в том, что у тебя нет тестов. Проблема в том, что твои тесты, скорее всего, не моделируют реальное поведение пользователей достаточно точно.

Два конкретных вопроса, которые стоит задать своей команде прямо сейчас:

  • Когда последний раз тест-кейсы обновлялись на основе реальных инцидентов в проде?
  • Есть ли у вас механизм, который фиксирует клиентские сбои и возвращает их в тестовый набор?

Пока эта петля не замкнута, разрыв между тестами и реальностью будет только расти - сколько бы автономии ты ни давал агенту.


Источник: VentureBeat Pulse Research, The agent evaluation gap, 16 июля 2025

VentureBeat · 16 июля
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться