Как работает компьютерное зрение для производства и АПК
Детекция, трекинг и автоматическое обнаружение событий по видео — механика CV-систем на примерах молочной фермы и производства.
TL;DR. CV-мониторинг — это система, которая смотрит видеопоток вместо человека. Она сообщает, когда в кадре произошло что-то важное: животное подало признак ключевого события, деталь на линии выехала за допуск, план помещения нужно превратить в цифры. Внутри — три шага: детекция объектов, трекинг по кадрам, распознавание события. На выходе — алерт вместо дежурства человека у монитора 24/7.
Что такое CV-мониторинг и зачем он бизнесу
Компьютерное зрение (CV, computer vision) в контексте мониторинга — это не «камера с искусственным интеллектом», а конвейер из нескольких моделей, каждая из которых решает свою узкую задачу: найти объект в кадре, проследить его между кадрами, распознать в его поведении признак события. Результат — не картинка с рамками, а сигнал: конкретное животное, конкретное время, конкретное событие.
Практический эффект — снятие нагрузки с человека там, где нужно непрерывное наблюдение. На молочной ферме ключевые поведенческие события у коров требуют круглосуточного дежурства персонала. Ночные смены, усталость, пропуски неизбежны. Система смотрит видео без перерывов и предупреждает зоотехника заранее, а не после факта.
Как это устроено технически
Четыре шага: детекция → трекинг → распознавание события → алерт.
- Детекция объектов. Модель класса YOLO (You Only Look Once) находит на кадре объекты интереса — животное, деталь, дефект — и обводит их рамкой в реальном времени. Это первый и самый быстрый слой: он отвечает на вопрос «что и где есть в этом конкретном кадре», без памяти о предыдущих кадрах.
- Трекинг. Детекция сама по себе не знает, что объект на кадре 100 — та же корова, что на кадре 99. Тут и нужен трекер: он присваивает каждому объекту устойчивый ID и ведёт его через последовательность кадров, даже когда объект на секунду заслонён другим или ушёл за край кадра. Без этого шага система видит набор несвязанных снимков, а не историю поведения одного объекта.
- Распознавание события. Здесь одной модели обычно недостаточно. Для событий, которые проявляются через позу и движение, к детекции добавляется анализ ключевых точек тела (поза) и модель временных паттернов, которая смотрит на последовательность поз за период, а не на один кадр. Событие — это не поза в моменте, а изменение поведения во времени.
- Алерт. Как только распознанный паттерн переходит порог уверенности, система формирует уведомление ответственному сотруднику — с указанием, какой объект, какое событие, насколько заранее. Дальше решение остаётся за человеком: система предупреждает, а не действует вместо него.
Отдельный вопрос — где это считается. Вариант с облаком проще развернуть, но зависит от связи. Вариант с обработкой на месте (edge, например на устройствах уровня NVIDIA Jetson) не требует канала в интернет и продолжает работать при обрыве связи. Плата за это — вычислительная мощность ограничена тем железом, которое туда поставили.
Где применимо
- Учёт поголовья и событий на ферме. Идентификация животных по фото или видеопотоку в реальном времени, обнаружение ключевых поведенческих событий с ранним предупреждением зоотехнику.
- Контроль на производственной линии. Тот же принцип детекции и трекинга применим к объектам на конвейере — там, где нужно заметить отклонение автоматически, а не по итогам смены.
- Обработка планов и чертежей. Не только видеопоток: та же техника компьютерного зрения — сегментация изображения — переводит скан плана помещения в структурированные данные — полигоны стен и проёмов, — вместо картинки, которую нельзя посчитать.
Общий признак задачи, где CV-мониторинг подходит: событие или объект нужно замечать по видео или изображению регулярно, а ручное наблюдение упирается в человеческий ресурс.
Ограничения
CV-мониторинг работает не «из коробки» под любую задачу. Вот что стоит понимать заранее.
- Качество зависит от освещения и ракурса камеры. Модель, обученная на дневном датасете, деградирует в темноте или в инфракрасном режиме — это требует отдельного дообучения на кадрах нужного типа освещения, а не тех же весов, применённых к другой картинке. Одна точка обзора теряет объект за скученностью или углом — многокамерная схема с проекцией сверху снижает этот риск, но не убирает его полностью.
- Edge-вычисления против облака — компромисс, а не универсальный выбор. Обработка на месте снимает зависимость от связи, что критично на удалённых объектах, но ограничена мощностью установленного там железа. Облако даёт больше вычислительных ресурсов, но требует канала связи и его надёжности.
- Точность требует разметки под конкретный объект. Модель обучается на конкретном наборе данных, и новое событие или новый тип объекта не появляется в системе автоматически — нужна разметка нового датасета и дообучение. Точность при этом не всегда выражается одним числом: разные типы событий распознаются с разной уверенностью, и диапазон честнее, чем усреднённая цифра.
- Идентификация по внешнему виду — не абсолютная точность. Там, где решение принимается по сходству образов, а не по однозначному идентификатору вроде бирки или номера, есть процент ошибок. Такая система снимает рутинный ручной поиск, но не заменяет источник истины там, где ошибка юридически значима.
Как мы это реализовали
- Молочная ферма КРС: автоматическое обнаружение ключевых событий 24/7 — YOLOv11 для детекции, RTMPose для анализа позы, BiLSTM для временных паттернов поведения. 4 камеры с проекцией bird's-eye-view, отдельная ветка под инфракрасный ночной режим, edge-деплой на NVIDIA Jetson Orin NX без облака. Целевая точность 83–100% с предупреждением за 1–9 часов до события.
- Молочная ферма КРС: идентификация коров по фото и видеопотоку — эмбеддинги EfficientNet-B1 вместо классификатора, чтобы новых животных можно было добавлять без переобучения модели. Идентификация по фотографии (точность 78%) и трекинг по видеопотоку в реальном времени через ByteTrack. Мобильное приложение, веб-панель, API.
- Векторизация планов помещений — сегментационная модель на PyTorch, обученная на датасете CubiCasa5k, переводит скан плана в полигоны стен и проёмов. Код открыт.
Что это будет стоить и сколько времени
Пилот CV-системы под конкретную задачу — от 200 000 ₽, 1–2 месяца. В эту стоимость входит сбор и разметка датасета под ваш объект, обучение и тестирование модели, интеграция в существующую инфраструктуру — камеры, сервер на месте или облако. Точная оценка зависит от количества сценариев обнаружения и качества исходного видеопотока — обсуждается на этапе аудита.