«Повесить нейросеть на камеры» — не всегда значит VLM. В видеоаналитике десятилетиями работает классическое компьютерное зрение: детекторы объектов, трекинг, геометрия зон. Vision-языковые модели (VLM) добавили понимание содержания кадра. Сравним честно.
Сравнение подходов
| Критерий | Классический CV | Vision-модели (VLM) |
|---|---|---|
| Принцип | детекторы, трекинг, разметка зон | понимание кадра текстовым запросом |
| Что даёт | счёт событий: пересечения, скопления, скорость | описание сцены, редкие и сложные случаи |
| Ресурсы | работает даже без GPU на умеренных потоках | требует GPU, дороже на поток |
| Гибкость | новая задача — новая настройка | новая задача — новый промпт |
| Предсказуемость | высокая, поведение детерминировано | вероятностная, нужны проверки фактов |
| Типовые задачи | подсчёт, периметр, СИЗ, потоки людей | инвентарь по фото, споры, описания событий |
Где выигрывает классика
Метрические задачи на стабильной сцене: сколько людей прошло, кто пересёк запретную линию, каска ли на голове. Детектор на потоке — копейки вычислений, миллисекунды реакции, ноль галлюцинаций.
Где выигрывают VLM
Длинный хвост: «опиши, что происходит на складе», «найди похоже на аварию», разбор спорного эпизода по запросу оператора. Платой являются вычисления и необходимость проверять факты — галлюцинации в кадровом контексте тоже возможны.
Чек-лист выбора
- Что именно считать — количества, пересечения и скорости — классика; «что происходит» — VLM.
- Стабильность сцен — фиксированные камеры и зоны отлично живут на детекторах, переустановки ломают разметку.
- Доля спорных случаев — если их меньше десяти процентов, гибрид дешевле сплошного прогона больших моделей.
- Требования к задержке — тревоги в реальном времени — лёгкие модели на потоке, разбор постфактум терпит VLM.
- Бюджет GPU — прогон каждого кадра через vision-модель дороже на порядок: считайте на пиковой нагрузке.
- Проверяемость — оператору нужен кадр-доказательство и понятное описание события, а не «модель так решила».
Начинайте с самого дешёвого работающего варианта: настроенный детектор со счётчиком событий нередко закрывает восемьдесят процентов задач заказчика, а VLM подключается позже и точечно. Экономика гибрида проверяется просто: умножьте число камер на частоту кадров и сравните со стоимостью GPU-часов — цифры сразу покажут, где нужен тяжёлый анализ, а где достаточно лёгкого детектора.
Гибрид на практике
Рабочая архитектура: классический CV считает события всех кадров, VLM подключается к эпизодам, помеченным как спорные, и готовит описание для человека. Так устроены контуры контроля СИЗ и опасных зон; цены рынка — в разборе «сколько стоит ИИ-видеоаналитика» (пилот от 480 000 ₽, контур 1,5–3,5 млн ₽). Смежное сравнение аналитических слоёв — «BI с ИИ или классическая аналитика»; услуга — ИИ-видеоаналитика.