20 dépôts
Systems designed to maintain the persistent identity of multiple objects across continuous video streams and live feeds.
Explore 20 awesome GitHub repositories matching artificial intelligence & ml · Object Tracking Systems. Refine with filters or upvote what's useful.
Ultralytics is a comprehensive computer vision framework designed for training, validating, and deploying deep learning models across a wide range of visual recognition tasks. It provides a unified interface for core operations including object detection, instance segmentation, pose estimation, and image classification. By utilizing a modular architecture, the platform allows users to swap model components to balance inference speed and accuracy requirements for diverse applications. The framework distinguishes itself through its support for real-time processing and flexible deployment. It in
Maintains persistent identity across continuous video feeds for multiple detected objects.
PaddleDetection is an object detection framework designed for the end-to-end development, training, and deployment of computer vision models. It provides a comprehensive library of modular neural network architectures and pipelines that support object detection, instance segmentation, and multi-object tracking tasks. The project distinguishes itself through a configuration-driven approach that decouples model components like backbones and heads, allowing for the flexible assembly of custom vision workflows. It incorporates advanced techniques such as anchor-free detection logic, joint detecti
Monitors moving objects across single or multiple camera feeds to analyze traffic flow and pedestrian movement patterns in real-time.
jetson-inference is a set of libraries and tools for executing optimized deep learning models on embedded GPU hardware. Its primary purpose is to enable real-time computer vision and AI inference at the edge with low latency and high throughput. The project distinguishes itself through high-performance streaming analytics and the ability to execute concurrent AI pipelines on auto-grade silicon. It provides specialized support for multi-sensor stream processing, utilizing zero-copy data transport to load camera frames directly into GPU memory. The codebase covers a broad surface of capabiliti
Maintains unique object identities across a network of multiple cameras to handle occlusions.
This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene
Implements assignment algorithms to match detected object boxes with existing tracking identities.
This project is a computer vision system for object segmentation and tracking across images and videos. It employs models capable of identifying and masking objects using text prompts, bounding boxes, click points, or image exemplars. The system differentiates itself through memory-based video tracking and shared-memory architectures that maintain consistent object identities over time. It supports multi-object processing in single computation passes to increase frame throughput and utilizes iterative refinement to correct segmentation boundaries through sequential prompts. The software also
Tracks multiple objects simultaneously using a shared-memory approach to maximize frame throughput.
ByteTrack is a multi-object tracking framework that implements the ByteTrack algorithm, an ECCV 2022 method designed to recover occluded objects and reduce trajectory fragmentation. The core innovation of the project is its association algorithm, which processes every detection box—including low-confidence ones—by using separate high and low score thresholds, Kalman filter motion prediction, and Hungarian algorithm matching to produce consistent object identities across video frames. The project distinguishes itself by its comprehensive approach to handling occlusions and fragmented trajector
Implements the ByteTrack association algorithm that matches every detection box to existing track IDs.
Follows shoppers through a store by stitching together video feeds from multiple cameras to analyze movement patterns.
DeepSORT est un framework de suivi multi-objets en temps réel conçu pour maintenir des identités cohérentes de plusieurs objets à travers les frames vidéo. Il intègre des caractéristiques d'apparence de deep learning avec des descripteurs de mouvement pour suivre les objets à travers une séquence de données vidéo. Le système utilise un réseau de neurones convolutif profond pour générer des descripteurs visuels de haute dimension pour la ré-identification de personnes. Ces caractéristiques d'apparence sont combinées avec l'estimation de mouvement via le filtrage de Kalman et résolues en utilisant l'algorithme hongrois pour associer de manière optimale les détections aux pistes existantes. Le framework inclut des capacités pour le filtrage d'association basé sur le gating et la gestion de pistes basée sur l'état pour gérer les cycles de vie des objets. Il fournit également des outils pour rendre les résultats de suivi sur les frames vidéo et évaluer les performances de suivi par rapport à des benchmarks établis.
Maintains consistent identities of multiple objects across a sequence of video frames.
Gluon-CV est une bibliothèque de vision par ordinateur MXNet qui fournit une collection complète d'architectures de vision pré-implémentées et de pipelines d'entraînement. Elle sert de toolkit de recherche en deep learning et de zoo de modèles contenant des poids pré-entraînés à l'état de l'art pour l'analyse d'images et de vidéos. Le projet inclut une bibliothèque spécialisée d'estimation de pose humaine et un toolkit de compression de modèles. Ces outils permettent l'élagage et la quantification de modèles de deep learning pour augmenter la vitesse d'inférence et faciliter le déploiement sur du matériel edge contraint. La bibliothèque couvre un large éventail de capacités de vision, incluant la classification d'images, la détection d'objets, ainsi que la segmentation sémantique et d'instance. Elle fournit également des outils pour l'analyse vidéo, tels que la reconnaissance d'action, le suivi d'objets et l'estimation de profondeur monoculaire. L'entraînement est pris en charge via des pipelines automatisés et des charges de travail multi-GPU distribuées pour accélérer la convergence des modèles.
Matches and identifies specific individuals across different camera scenes using visual features.
Ce projet est un framework de ré-identification de personnes PyTorch conçu pour entraîner et évaluer des modèles qui identifient des individus à travers différentes vues de caméra. Il fournit un pipeline complet d'entraînement de modèle, un extracteur de caractéristiques de deep learning pour convertir des images en vecteurs numériques, et une suite d'outils de benchmarking de vision par ordinateur pour mesurer la précision de récupération d'identité. Le framework inclut une boîte à outils de transfert learning spécialisée qui prend en charge le gel de couches, l'optimisation du taux d'apprentissage par étapes et des taux d'apprentissage différentiels pour le fine-tuning de modèles pré-entraînés. Il se distingue par un moteur extensible qui permet le développement d'une logique d'entraînement personnalisée et l'implémentation d'objectifs d'optimisation spécifiques comme le hard-sample triplet loss mining et le label smoothing. Le système couvre une gestion complète des jeux de données, incluant le support des benchmarks standard, l'échantillonnage équilibré par lots et l'augmentation d'images. Il fournit des utilitaires d'évaluation pour calculer les rangs de récupération et les distances de caractéristiques, ainsi que des outils de visualisation pour générer des cartes de chaleur d'activation et des galeries de récupération classées. Le projet est implémenté en Python et exploite PyTorch pour ses opérations de deep learning.
Computes specialized accuracy, rank, and distance measures to quantify the effectiveness of identity matching across camera views.
Roboflow Sports is a sports video analysis system that combines object detection and tracking with bird's-eye field visualization. Its core pipeline detects and tracks players, referees, and balls across video frames, then maps those tracked positions onto a radar-style overhead view of the playing field. The system goes beyond basic detection by localizing field boundaries and key landmarks such as pitch lines and corners, enabling spatial mapping of player positions relative to the field geometry. It classifies detected players by team affiliation through visual feature extraction and clust
Associates detections across frames using Kalman filters for motion prediction and appearance features for re-identifying occluded objects.
This project is a comprehensive instructional resource and course for building neural networks using PyTorch. It covers the fundamental building blocks of deep learning, including tensor manipulation, automatic differentiation, and the construction of modular neural network components. The repository serves as a technical guide for several specialized domains. It provides implementation details for computer vision tasks such as image classification, object detection, and semantic segmentation, as well as natural language processing workflows involving transformers, recurrent networks, and gen
Associates new detections with existing tracking IDs based on the intersection over union of bounding boxes.
Ce projet est un framework d'apprentissage profond basé sur PyTorch et une base de référence d'apprentissage supervisé pour la ré-identification de personnes et de véhicules. Il fournit un pipeline complet pour entraîner et évaluer des modèles conçus pour extraire des embeddings de caractéristiques basés sur l'identité et faire correspondre la même entité à travers différentes vues de caméra. Le framework se distingue par sa prise en charge de la correspondance d'identité multi-modalité, permettant la récupération d'identités à travers différents capteurs d'imagerie tels que le RVB et l'infrarouge. Il inclut également un raffinement de récupération avancé via des techniques de re-classement, utilisant le codage réciproque et les réseaux de neurones sur graphes pour améliorer la précision du classement. Le système couvre un large éventail de capacités de vision par ordinateur, y compris l'extraction d'embeddings de caractéristiques, l'évaluation de la récupération d'images et le prétraitement des données avec une augmentation par effacement aléatoire. Il fournit des outils pour l'optimisation des modèles via la fusion de convolution et de normalisation par lots, ainsi que l'accélération d'inférence TensorRT. Des outils de surveillance et de diagnostic sont inclus pour visualiser les cartes thermiques d'attention des modèles et les résultats d'identification. La bibliothèque implémente également des mécanismes défensifs via l'entraînement antagoniste pour augmenter la robustesse des modèles.
Implements a complete PyTorch framework for training and evaluating person re-identification models.
Ce projet est un framework de suivi multi-objets conçu pour assigner des identités persistantes aux boîtes englobantes détectées à travers des images vidéo consécutives. Il fonctionne comme un algorithme de suivi par vision par ordinateur qui surveille plusieurs cibles en mouvement en temps réel en associant les détections à des étiquettes cohérentes. Le système utilise une approche d'estimation d'état centrée sur un filtre de Kalman pour prédire les positions futures des objets et maintenir l'identité pendant les lacunes de détection. Il emploie l'algorithme hongrois pour une association de données optimale et calcule l'intersection sur l'union pour faire correspondre les emplacements de suivi prédits avec les détections réelles. Le pipeline de traitement gère un registre de suivis actifs en utilisant un modèle de vitesse constante linéaire pour simplifier les transitions d'état. Il effectue un traitement récursif image par image pour mettre à jour l'état de tous les objets suivis au fur et à mesure que de nouvelles images sont analysées.
Provides a comprehensive system for assigning persistent identities to detected objects across video streams.
FairMOT est un framework de suivi multi-objets et un modèle de deep learning conçu pour identifier et suivre plusieurs entités à travers des images vidéo. Il implémente un pipeline unifié qui intègre la détection d'objets et la ré-identification d'identité dans un réseau conjoint à étape unique. Le système utilise une méthode de détection sans ancres pour prédire les centres des objets et les dimensions des boîtes englobantes. Il maintient la cohérence de l'identité à travers les images consécutives en générant des vecteurs d'embedding de haute dimension pour la ré-identification et en employant un filtre de Kalman pour la prédiction de l'état de mouvement. Le framework couvre un large éventail de capacités en vision par ordinateur, incluant la détection d'objets en temps réel et l'utilisation de l'algorithme hongrois pour l'assignation des trajectoires. Il inclut également des utilitaires pour entraîner des modèles sur des jeux de données d'images personnalisés et générer des visualisations vidéo avec des boîtes englobantes superposées et des identifiants persistants.
Provides a complete system for maintaining the persistent identity of multiple objects across continuous video streams.
fast-reid est un framework de vision par ordinateur basé sur PyTorch conçu pour construire, entraîner et déployer des modèles de deep learning pour des tâches de vision basées sur l'identité. Il fournit une boîte à outils spécialisée pour la ré-identification de personnes et de véhicules, permettant la correspondance d'individus et de véhicules à travers des vues de caméra non chevauchantes. Le projet inclut des outils pour la reconnaissance d'attributs de personnes afin d'identifier des caractéristiques et des traits physiques spécifiques. Il dispose d'un zoo de modèles modulaire qui permet l'échange et le benchmarking de différentes architectures de ré-identification. Le framework couvre une infrastructure de développement à grande échelle, incluant l'entraînement distribué sur plusieurs GPU, l'entraînement en précision mixte et la distillation de connaissances pour transférer des représentations de réseaux complexes vers des modèles étudiants plus petits. Il fournit également une boucle d'optimisation des hyperparamètres, un moteur d'évaluation multi-dataset et des pipelines pour exporter des modèles vers des formats standards de l'industrie pour le déploiement en production.
Matches individuals across non-overlapping camera views using deep learning for identity tracking.
Human is a TensorFlow.js computer vision library used for face, body, and hand tracking within the browser or Node.js. It provides a framework for human pose and gesture tracking, facial recognition, and biometric liveness detection to verify a live human presence. The project distinguishes itself through a full suite of identity and motion tools, including a facial recognition framework that generates embeddings for similarity matching and a background segmenter for separating humans from their environment. It incorporates a liveness detector to prevent spoofing during facial analysis. The
Implements logic to associate detected body parts and features with specific individuals for consistent tracking.
This project is a multi-object tracking library and computer vision toolkit designed to maintain consistent identity IDs for objects across video frames. It provides a motion-based object tracking system that converts raw detections into stable temporal tracks, enabling the analysis of object movement and behavior over time. The toolkit distinguishes itself through advanced identity maintenance, utilizing Kalman filters for linear motion tracking and sparse optical flow for camera motion estimation. It features multi-stage object association to recover occluded objects and non-linear motion t
Maintains consistent identity IDs for multiple objects across video frames to analyze movement and behavior.
Ce projet est un pipeline de vision par ordinateur qui intègre la détection et le suivi d'objets pour surveiller des objets en mouvement au sein de flux vidéo. Il fonctionne comme un outil d'analyse de bout en bout qui traite les images vidéo pour identifier, classifier et maintenir l'identité unique des objets à mesure qu'ils se déplacent dans une scène. Le système utilise une combinaison d'inférence de deep learning pour la détection et d'estimation de mouvement pour assurer la continuité temporelle. En associant des descripteurs d'apparence visuelle à une modélisation prédictive du mouvement, il maintient les identités des objets même pendant des occlusions temporaires ou lorsque le chevauchement spatial est insuffisant. Le framework emploie un traitement séquentiel pour synchroniser les résultats de détection avec la logique de suivi, permettant une surveillance cohérente des patterns de mouvement. Au-delà du suivi de base, le logiciel inclut des capacités pour quantifier l'activité au sein d'un flux vidéo. Il prend en charge le calcul des totaux d'objets ou de véhicules à mesure qu'ils franchissent des lignes désignées ou entrent dans des zones spécifiques. L'implémentation est structurée comme un framework de développement pour construire des applications de vision personnalisées qui interprètent et extraient des données d'environnements dynamiques.
Implements a computer vision pipeline that detects and tracks objects across video frames using deep learning models.
This project is a computer vision framework designed for the detection, identification, and tracking of human subjects within video streams. It provides an integrated system for locating individuals, generating biometric models from image datasets, and maintaining identity labels across consecutive video frames. The system distinguishes itself through its ability to maintain identity persistence across multiple camera feeds. By utilizing deep learning inference to extract feature vector embeddings and applying motion prediction algorithms, it links unique identity signatures across disparate
Links unique identity signatures across disparate camera feeds to maintain consistent tracking in complex environments.