NVIDIA DeepStream 9.1: 13 агентских навыков и кросс-камерный 3D-трекинг
NVIDIA выпустила DeepStream 9.1 с 13 агентскими навыками для видеоаналитики. Ключевые добавки: Multi-View 3D Tracking (MV3DT) удерживает единый ID объекта между камерами, AutoMagicCalib убирает ручную калибровку. Пайплайны строятся через Claude Code, Codex или Cursor по текстовому промпту. Добавлена поддержка JetPack 7.2 и единый GitHub-монорепозиторий.
NVIDIA обновила DeepStream до версии 9.1. Главное в релизе - два новых навыка, которые решают застарелую боль видеоаналитики: отслеживание одного объекта сразу через несколько камер.
Что такое DeepStream и зачем это нужно
DeepStream - стриминговый аналитический тулкит NVIDIA для обработки видео и изображений с помощью ИИ. Внутри - GStreamer-фреймворк для мультипотокового инференса на GPU: аппаратное декодирование, TensorRT-инференс, трекинг объектов, интеграция с брокерами сообщений.
До версии 9.1 отслеживание объекта между камерами требовало ручной калибровки (шахматные доски, простои) и нетривиальной математики. Теперь оба шага автоматизированы.
Multi-View 3D Tracking (MV3DT)
MV3DT проецирует детекции со всех откалиброванных камер в общую 3D-систему координат, связывает наблюдения одного объекта из разных видов и присваивает ему один глобально консистентный ID.
Дата-флоу состоит из четырёх этапов.
Детекция. Каждый поток обрабатывает один из трёх поддерживаемых детекторов:
- PeopleNetTransformer - трансформерный детектор людей, дефолт для пешеходных сцен.
- PeopleNet v2.6.3 - высокоэффективный детектор на архитектуре DetectNet_v2.
- RT-DETR 2D - мультиклассовый детектор для пешеходов, транспорта и вилочных погрузчиков.
Монокулярное 3D-восприятие. Каждая камера использует матрицу проекции 3x4 из YAML-файла калибровки. 2D-боксы обратно проецируются в 3D мировые координаты с допущением о плоской поверхности земли.
Мультивидовая ассоциация. Треклеты синхронизируются между камерами через MQTT (лёгкий pub/sub протокол). Когда две камеры видят одного человека, трекер сопоставляет треклеты по близости в 3D-пространстве.
Вывод результатов идёт тремя способами: OSD показывает тайловую сетку с 2D и 3D боксами, Bird’s-Eye View рендерит карту траекторий сверху, Kafka-мессаджинг отдаёт per-frame protobuf с sensor ID, object ID и 3D-боксом.
AutoMagicCalib (AMC)
МV3DT требует откалиброванных камер - и здесь подключается AMC. Вместо ручных шахматных досок он анализирует уже существующие видеофайлы или стримы и оценивает:
- внутренние параметры камеры (фокусное расстояние, главная точка, дисторсия линзы);
- внешние параметры (поворот, трансляция, позиция в мире).
Внутри AMC работает пятиэтапный пайплайн: извлечение траекторий на каждой камере, однокамерная ректификация, мультивидовое сопоставление треклетов, bundle adjustment и опциональное VGGT-уточнение (Visual Geometry Grounded Transformer - помогает при ограниченном движении объектов).
AMC запускается как микросервис с REST API и веб-интерфейсом. Пользователь подаёт только изображение схемы помещения и несколько точек выравнивания.
13 агентских навыков и работа через Claude Code и Codex
Вся функциональность упакована в 13 агентских навыков. Ты описываешь пайплайн в свободной форме - агент (Claude Code, Codex, Cursor) строит и деплоит его.
Порядок работы короткий: запустил агента, подал промпт с описанием сцены. MV3DT-навык сам:
- валидирует пресеты;
- подтягивает контейнер;
- устанавливает Kafka и Mosquitto;
- скачивает веса моделей;
- генерирует конфиг пайплайна;
- запускает трекинг.
Если файлы калибровки отсутствуют, AMC-навык запускается автоматически.
Остальное в релизе
- Поддержка JetPack 7.2 для Jetson Orin и Thor - edge-устройства NVIDIA теперь в игре.
- Единый open-source GitHub-монорепозиторий под двойной лицензией CC-BY-4.0 AND Apache-2.0.
Практические сценарии из документации
NVIDIA приводит конкретные кейсы:
- Складская безопасность: трекинг рабочего рядом с погрузчиком через несколько проходов с одним ID (RT-DETR 2D).
- Ритейл-аналитика: сопровождение покупателя между зонами камер без ошибок переидентификации, замер времени пребывания.
- Smart-building: подсчёт занятости по этажам, Kafka-метаданные на дашборды.
- Роботика и умные города: общие мировые координаты для навигации и разбора инцидентов.
Что это значит
Если ты занимаешься видеоаналитикой - строишь системы безопасности, считаешь трафик в пространстве, автоматизируешь склад - DeepStream 9.1 убирает два самых трудоёмких шага: ручную калибровку и сведение ID между камерами.
То, что пайплайн теперь можно описать текстом и доверить сборку Claude Code или Codex, снижает порог входа. Не нужно лезть в конфиги вручную.
Репозиторий уже открыт. Документация и демо с одним человеком в трёх полях зрения доступны на странице проекта.
Источник: Marktechpost, Asif Razzaq, 18 июля 2026