12 repository-uri
Processes video frames sequentially to identify and track objects across a video stream.
Distinct from Object Detection: Distinct from Object Detection: focuses on sequential video frame processing, not static image detection.
Explore 12 awesome GitHub repositories matching artificial intelligence & ml · Video Stream Detections. Refine with filters or upvote what's useful.
This is a real-time object detection framework built on the YOLOv3 architecture, implemented in PyTorch. It provides a complete pipeline for identifying and localizing objects in images and video using a single neural network pass, combining a Darknet-53 backbone with multi-scale feature pyramids and anchor-based bounding box prediction. The framework extends beyond basic detection to include instance segmentation, human pose estimation, and multi-object tracking across video frames. It offers a model export toolkit that converts trained models through ONNX to CoreML, TensorFlow Lite, and Ten
Processes video frames sequentially to identify and track objects across a video stream.
ImageAI is a Python computer vision library providing a suite of tools for image classification, object detection, and video analytics. It functions as an integrated framework for locating and labeling objects in static images and video streams, utilizing deep learning models for identification and categorization. The project includes a model training toolkit that allows for the creation of custom classifiers and detectors through scratch training or transfer learning. It features a GPU-accelerated inference engine to increase processing speed for vision tasks and includes specialized utiliti
Identifies and labels objects within video files or live streams by rendering bounding boxes and probability percentages.
Acest proiect este un framework de detecție a obiectelor PyTorch care implementează arhitectura Faster R-CNN. Acesta servește ca un model de viziune pentru prezicerea casetelor de delimitare precise în jurul mai multor obiecte din imagini și fluxuri video live. Sistemul este optimizat pentru antrenarea multi-GPU pentru a reduce timpul necesar pentru convergența modelului. Utilizează un design accelerat prin GPU pentru a gestiona antrenarea și inferența rețelelor complexe de detecție. Framework-ul acoperă întregul ciclu de viață al detecției obiectelor, inclusiv antrenarea rețelelor personalizate și inferența pentru imagini statice și fluxuri video în timp real. Include capabilități pentru validarea performanței modelului folosind seturi de date standardizate, precum și optimizări de antrenare, cum ar fi gruparea bazată pe raportul de aspect și sarcinile de lucru distribuite.
Processes live video feeds sequentially to identify and locate objects as they appear on screen.
This project is an object detection framework implementing the YOLOv3 architecture using Keras and TensorFlow. It functions as a deep learning vision model and computer vision toolset designed to locate and classify multiple entities within images and video streams using bounding boxes. The system includes a multi-GPU inference engine to distribute computational loads across several graphics processing units. It also provides a pipeline for creating custom object detectors by retraining pre-trained weights on annotated datasets to recognize user-defined object classes. The framework covers m
Processes sequential video frames to detect objects and exports the resulting detection output.
PaddleX is a PaddlePaddle-based framework for building, deploying, and fine-tuning AI model pipelines, with pre-built support for computer vision, OCR, document analysis, and time series tasks. It offers a toolkit of ready-to-use pipelines for image classification, object detection, segmentation, and pose estimation, alongside an end-to-end OCR document analysis pipeline that extracts text, tables, formulas, and layout information. The platform also includes a dedicated time series forecasting pipeline for analyzing historical data to detect anomalies, classify patterns, and predict future val
Locates and classifies actions occurring within a video stream.
yolotf este un framework de detecție a obiectelor care oferă instrumente pentru convertirea configurațiilor și ponderilor modelelor Darknet în grafuri TensorFlow. Include un antrenor de modele TensorFlow pentru antrenarea de noi modele de detecție sau fine-tuning-ul ponderilor existente folosind seturi de date personalizate. Proiectul dispune de un exportator de modele mobile care serializează definițiile grafurilor și metadatele în fișiere protobuf pentru deployment pe dispozitive mobile. Framework-ul suportă inferența de detecție a obiectelor pe imagini și video pentru a identifica obiecte și a exporta coordonatele bounding box-urilor. Gestionează starea modelului prin traducerea mapării ponderilor și antrenare bazată pe checkpoint-uri pentru a permite restaurarea ponderilor și a stărilor optimizatorului.
Processes video streams to identify objects and export annotated output video with bounding boxes.
This is the official documentation repository for Raspberry Pi hardware and software. It covers the complete range of Raspberry Pi single-board computers, the RP-series microcontrollers, and the Raspberry Pi operating system. The documentation provides reference material for setting up devices, configuring hardware, and using the system for tasks including AI inference, camera and video capture, embedded development, and remote access. The documentation covers the full boot chain from the GPU firmware and EEPROM bootloader through to kernel loading, with detailed guidance on boot configuratio
Documents identifying predefined objects in a live camera stream using a TensorFlow Lite neural network.
SAHI este un framework de inferență prin tăiere (sliced inference) și un pipeline de computer vision conceput pentru a detecta obiecte mici în imagini de înaltă rezoluție. Acesta oferă un sistem pentru divizarea imaginilor mari în patch-uri suprapuse pentru a preveni pierderea detaliilor care apare de obicei în timpul downscaling-ului standard al modelelor, alături de un utilitar de tiling al imaginilor și un toolkit pentru seturi de date COCO. Proiectul se distinge prin oferirea unui wrapper de predicție model-agnostic care standardizează diferite framework-uri de machine learning într-o interfață unificată. Acest lucru îi permite să implementeze inferența prin tăiere și detectarea obiectelor pe diverse backend-uri de modele, menținând în același timp un format de output consistent. Dincolo de inferență, framework-ul acoperă gestionarea seturilor de date pentru formatele COCO și YOLO, inclusiv instrumente pentru tăierea imaginilor adnotate, remaparea categoriilor și fuziunea seturilor de date. Include, de asemenea, o suită pentru evaluarea și monitorizarea performanței modelelor, având calculul metricilor pentru precizie și recall, analiza erorilor de detecție și vizualizarea rezultatelor. Toolkit-ul este accesibil printr-o interfață în linie de comandă pentru automatizarea fluxurilor de lucru de inferență pe directoare de imagini și fluxuri video.
Implements frame skipping optimizations to increase the processing speed of object detection across video streams.
mmaction2 este un set de instrumente PyTorch pentru înțelegerea video, conceput pentru antrenarea și evaluarea modelelor de deep learning. Servește ca un framework pentru recunoașterea acțiunilor, localizarea temporală și detectarea acțiunilor spatio-temporale, oferind instrumente specializate atât pentru analiza video bazată pe pixeli, cât și pentru recunoașterea acțiunilor bazată pe schelet. Proiectul se distinge printr-o arhitectură modulară care dispune de descoperirea componentelor bazată pe registru și asamblarea ierarhică a modelelor bazată pe configurație. Suportă fuziunea caracteristicilor multi-modale, integrând cadre RGB, flux optic și audio, și include capabilități pentru recuperarea clipurilor video din text și predicția video zero-shot. În linii mari, framework-ul acoperă ingineria seturilor de date video, inclusiv standardizarea adnotărilor și eșantionarea cadrelor, precum și antrenarea și evaluarea cuprinzătoare a modelelor. Oferă utilitare pentru antrenarea distribuită, distilarea cunoștințelor și optimizarea inferenței prin reparametrizarea modelului. Codul sursă suportă exportul modelelor ONNX și containerizarea mediului pentru implementarea pe diferite noduri de calcul.
Locates and classifies specific actions in video by identifying the corresponding time interval and spatial region.
mmtracking is a PyTorch video perception framework designed for training and deploying computer vision models that analyze sequential image data. It provides specialized tools for multi-object tracking, video instance segmentation, and a configuration-driven system for managing deep learning models. The project utilizes a deep learning model registry and a configuration-driven pipeline to swap model backbones and detectors without modifying the core codebase. This modular approach allows for the development of custom perception architectures by combining various components and configurations.
Processes video frames sequentially to identify and locate multiple objects using temporal alignment.
Acest proiect este un sistem de computer vision conceput pentru recunoașterea facială în timp real și urmărirea identității folosind fluxuri video live. Oferă un framework pentru captarea, înregistrarea și identificarea simultană a mai multor persoane prin compararea inputului video live cu o bază de date locală de descriptori faciali pre-înregistrați. Sistemul se distinge printr-un pipeline de procesare orientat spre performanță care echilibrează sarcina computațională în timpul analizei live. Prin combinarea extracției de caracteristici prin rețele neuronale profunde cu urmărirea obiectelor bazată pe centroizi, software-ul menține etichete de identitate consistente între cadrele video, minimizând în același timp frecvența calculelor costisitoare de recunoaștere. Această abordare permite urmărirea și identificarea stabilă a mai multor persoane fără a necesita procesare completă pe fiecare cadru. Biblioteca susține o gamă de sarcini de gestionare a identității, inclusiv crearea de baze de date faciale căutabile și logarea automatizată a persoanelor. Gestionează întregul ciclu de viață al datelor biometrice, de la extracția inițială a vectorilor numerici unici din imaginile camerei până la stocarea persistentă a acestor descriptori pe sistemul de fișiere local pentru verificare ulterioară.
Optimizes processing performance by performing full facial recognition on intermittent frames while using lightweight tracking for intermediate frames.
This application is a real-time computer vision system designed to identify and label objects within live video feeds, recorded files, and static images. It functions as a comprehensive framework that integrates pre-trained machine learning models with video processing pipelines to perform multi-object localization and visual data tracking. The system distinguishes itself through a multithreaded architecture that decouples frame acquisition from detection logic, ensuring the interface remains responsive during continuous analysis. It provides specialized scripts for training and optimizing cu
Identifies and labels items within recorded video files by applying pre-trained models to sequential frames.