20 dépôts
Architectures and models designed for processing, classifying, and labeling visual data such as images.
Explore 20 awesome GitHub repositories matching artificial intelligence & ml · Computer Vision Models. Refine with filters or upvote what's useful.
This project is an open-source, interactive educational platform designed to teach deep learning through a comprehensive, code-first curriculum. It provides a structured learning path that covers foundational mathematics, modern neural network architectures, and practical optimization techniques, enabling practitioners to master complex artificial intelligence concepts through hands-on experimentation. The platform distinguishes itself by integrating technical explanations with executable Jupyter notebooks. This design allows readers to modify code and hyperparameters in real-time, facilitati
Examines the structural components and feature extraction capabilities of convolutional neural networks through interactive code examples.
This repository serves as a centralized collection of state-of-the-art deep learning architectures and reference implementations designed for research and application development. It provides a comprehensive toolkit for computer vision and natural language processing, offering pre-built models and training pipelines for tasks ranging from image classification and object detection to complex sequence modeling. The project distinguishes itself by providing a flexible execution harness that manages the entire training lifecycle, including data ingestion and backpropagation. It supports scalable
Exposes standardized, high-performance architectures tailored for image classification, object detection, and segmentation tasks.
Ultralytics is a comprehensive computer vision framework designed for training, validating, and deploying deep learning models across a wide range of visual recognition tasks. It provides a unified interface for core operations including object detection, instance segmentation, pose estimation, and image classification. By utilizing a modular architecture, the platform allows users to swap model components to balance inference speed and accuracy requirements for diverse applications. The framework distinguishes itself through its support for real-time processing and flexible deployment. It in
Locates and monitors specific anatomical or object keypoints within video frames and static images.
Appwrite is a backend-as-a-service platform that provides a unified development environment for building full-stack applications. It integrates essential infrastructure components—including authentication, databases, storage, and serverless functions—into a single, centralized interface to simplify application development and resource management. The platform distinguishes itself through a container-based microservices architecture that ensures consistent execution across diverse infrastructure. It features a versatile connectivity layer that links frontend applications with third-party servi
Processes and labels visual data through integrated computer vision model capabilities.
YOLOv7 is a PyTorch vision library and real-time inference engine designed for object detection, human pose estimation, and instance segmentation. It provides a framework for detecting and locating multiple objects within images or video streams using neural networks. The system includes tools for custom model training and fine-tuning, allowing pre-trained weights to be adapted to specialized datasets via transfer learning. It also supports model weight export and format conversion to facilitate deployment on production servers and embedded edge devices.
Provides a vision model that identifies keypoints on the human body to determine orientation and posture.
OpenALPR is a computer vision platform designed to identify vehicle license plates and attributes from live video streams or static images. It functions as an intelligent access control and analytics system, enabling the automation of security monitoring, parking facility management, and operational workflows through real-time vehicle detection. The platform distinguishes itself by supporting international license plate formats and regional configuration mapping, allowing for deployment across diverse geographic standards. It integrates directly with existing network camera infrastructure, pe
Employs deep learning models to classify character patterns and vehicle attributes from image segments.
This is a real-time object detection framework built on the YOLOv3 architecture, implemented in PyTorch. It provides a complete pipeline for identifying and localizing objects in images and video using a single neural network pass, combining a Darknet-53 backbone with multi-scale feature pyramids and anchor-based bounding box prediction. The framework extends beyond basic detection to include instance segmentation, human pose estimation, and multi-object tracking across video frames. It offers a model export toolkit that converts trained models through ONNX to CoreML, TensorFlow Lite, and Ten
Ships a human pose estimation model that detects body keypoints and reconstructs poses in images and video.
AlphaPose est un framework de deep learning pour l'estimation de pose et une bibliothèque de vision par ordinateur PyTorch conçue pour détecter et suivre les points clés du corps humain, du visage, des mains et des pieds dans les images et les vidéos. Il fournit un système pour l'estimation de la posture squelettique et le suivi de pose multi-personnes. Le projet implémente des outils pour la reconstruction de pose humaine en 3D, générant des positions d'articulations et des formes de maillage corporel à partir de données d'images 2D. Il inclut également un tracker de pose multi-personnes capable de maintenir l'identité de plusieurs individus à travers des images vidéo consécutives. Le framework couvre un large éventail de capacités en vision par ordinateur, notamment la localisation de points clés multi-personnes, le suivi de mouvement humain et la reconstruction de maillages corporels en 3D.
Detects keypoints for the human body, face, hands, and feet across multiple people in images and videos.
CenterNet est un framework de détection d'objets par points centraux et un pipeline de vision par ordinateur en temps réel. Il identifie les objets et les poses en prédisant les points centraux au lieu d'utiliser des boîtes d'ancrage (anchor boxes). Le système fonctionne comme un estimateur de boîtes englobantes 3D, un modèle d'estimation de pose humaine et un outil de détection d'objets en temps réel. Il traite le placement des articulations et les emplacements des objets comme des problèmes de détection de points centraux pour localiser les entités dans les images et l'espace tridimensionnel. Les capacités couvrent la détection d'objets 3D, l'estimation de points clés humains et l'analyse vidéo en direct. Le pipeline utilise un processus d'inférence feedforward à étape unique pour effectuer une analyse continue sur des webcams ou des fichiers vidéo.
Identifies human body joints and limbs by treating pose estimation as center point detection.
PaddleX is a PaddlePaddle-based framework for building, deploying, and fine-tuning AI model pipelines, with pre-built support for computer vision, OCR, document analysis, and time series tasks. It offers a toolkit of ready-to-use pipelines for image classification, object detection, segmentation, and pose estimation, alongside an end-to-end OCR document analysis pipeline that extracts text, tables, formulas, and layout information. The platform also includes a dedicated time series forecasting pipeline for analyzing historical data to detect anomalies, classify patterns, and predict future val
Identifies and locates specific body joints like shoulders and elbows in images to analyze human pose.
Gluon-CV est une bibliothèque de vision par ordinateur MXNet qui fournit une collection complète d'architectures de vision pré-implémentées et de pipelines d'entraînement. Elle sert de toolkit de recherche en deep learning et de zoo de modèles contenant des poids pré-entraînés à l'état de l'art pour l'analyse d'images et de vidéos. Le projet inclut une bibliothèque spécialisée d'estimation de pose humaine et un toolkit de compression de modèles. Ces outils permettent l'élagage et la quantification de modèles de deep learning pour augmenter la vitesse d'inférence et faciliter le déploiement sur du matériel edge contraint. La bibliothèque couvre un large éventail de capacités de vision, incluant la classification d'images, la détection d'objets, ainsi que la segmentation sémantique et d'instance. Elle fournit également des outils pour l'analyse vidéo, tels que la reconnaissance d'action, le suivi d'objets et l'estimation de profondeur monoculaire. L'entraînement est pris en charge via des pipelines automatisés et des charges de travail multi-GPU distribuées pour accélérer la convergence des modèles.
Includes specialized models for identifying anatomical keypoints and tracking human body movement.
Ce projet est une collection de Jupyter Notebooks éducatifs proposant des tutoriels sur la construction de réseaux de neurones et les opérations sur tenseurs avec le framework TensorFlow. Il sert de dépôt pédagogique pour le machine learning et de guide d'implémentation pour les étudiants en deep learning. La suite se concentre sur des architectures avancées spécifiques, notamment les réseaux convolutifs pour la classification d'images, les réseaux résiduels avec connexions sautées pour la stabilité de l'entraînement, et les auto-encodeurs variationnels pour la modélisation générative et la synthèse de données. Elle inclut également des guides pour construire des auto-encodeurs de débruitage et profonds afin d'effectuer l'extraction de caractéristiques et la réduction de dimensionnalité. Le dépôt couvre un large spectre de modélisation prédictive, avec des implémentations de régression linéaire, polynomiale et logistique pour prédire des valeurs continues et des résultats binaires. Le contenu est organisé en notebooks interactifs permettant aux utilisateurs d'exécuter des opérations mathématiques et de modifier des expériences de machine learning.
Builds convolutional neural networks utilizing convolutional layers for feature extraction and visual pattern recognition.
Sapiens est un modèle de vision humaine haute résolution conçu pour des tâches de vision par ordinateur centrées sur l'humain de haute précision. Il fonctionne comme une suite d'outils pour estimer la pose humaine, la profondeur et la géométrie de surface. Le projet utilise une architecture vision transformer comme backbone pour effectuer plusieurs tâches via un encodeur partagé. Cette architecture permet la prédiction simultanée des structures squelettiques, des emplacements des articulations et de la distance entre une caméra et un sujet humain. Les capacités du modèle couvrent la segmentation des parties du corps humain pour isoler les régions anatomiques des arrière-plans et la prédiction des normales de surface pour récupérer les détails géométriques 3D à partir d'images 2D. Ces tâches sont soutenues par un framework d'apprentissage multi-tâches qui utilise la régression au niveau des pixels et le masquage par segmentation sémantique.
Delineates human anatomical regions and joint locations to separate people from backgrounds.
Ce projet est une implémentation PyTorch d'une architecture de recherche conçue pour l'apprentissage de représentations haute résolution. Il sert de framework de vision par ordinateur axé sur la détection précise de points clés, l'estimation de pose humaine et la segmentation sémantique d'images. L'implémentation fournit des outils spécialisés pour identifier les points de repère anatomiques sur le corps humain et prédire les coordonnées des points clés du visage afin d'analyser l'orientation et l'alignement. Elle utilise un système de flux parallèles multi-résolution et une fusion multi-échelle répétée pour maintenir des représentations haute résolution tout au long du réseau. Le framework couvre un large éventail de tâches de vision par ordinateur, notamment la détection d'objets, la classification d'images et la segmentation sémantique au niveau du pixel. Il inclut également des workflows pour entraîner des modèles sur des jeux de données étiquetés et évaluer quantitativement la précision des positions articulaires prédites par rapport aux données de validation.
Includes workflows for training neural networks to detect human keypoints using labeled datasets.
Ce projet est une collection d'exemples d'apprentissage automatique TensorFlow fournissant des implémentations de référence pour divers paradigmes de réseaux de neurones. Il couvre les modèles d'apprentissage supervisé, non supervisé, par renforcement et séquentiel. Le dépôt inclut des implémentations pour les réseaux de neurones convolutifs axés sur la classification et le classement d'images, ainsi que des réseaux de neurones récurrents pour la prévision de séries temporelles et la traduction séquence-à-séquence. Il fournit en outre des exemples d'agents d'apprentissage par renforcement entraînés via l'optimisation des récompenses et des techniques d'apprentissage non supervisé telles que les auto-encodeurs et les cartes auto-organisatrices pour le clustering de données. Les capacités supplémentaires couvrent la régression et la classification supervisées, la génération d'embeddings sémantiques et l'utilisation de modèles de Markov cachés pour la modélisation de données séquentielles. Le projet inclut également des utilitaires pour la gestion des opérations de tenseurs et la visualisation des performances des modèles via des tableaux de bord. Le contenu est livré sous forme d'une série de Jupyter Notebooks.
Implements convolutional neural networks for feature extraction in image and video processing tasks.
Ce projet est une ressource pédagogique complète et un manuel de tutoriels pour construire, entraîner et déployer des modèles de machine learning avec TensorFlow 2. Il sert de guide d'apprentissage structuré couvrant les concepts fondamentaux du deep learning, notamment les architectures de réseaux de neurones, la différenciation automatique et les opérations sur les tenseurs. Le manuel fournit des conseils techniques pour optimiser l'efficacité de l'exécution via la gestion de la mémoire GPU, l'entraînement distribué et la quantification de modèles. Il inclut également des guides détaillés pour construire des pipelines de données haute performance et exporter des modèles vers des serveurs de production, des appareils mobiles et des navigateurs web. Le contenu couvre un large éventail de capacités, incluant le développement de modèles avec des réseaux convolutifs et récurrents, l'implémentation de fonctions de perte et de couches personnalisées, ainsi que l'utilisation de modèles pré-entraînés pour le transfer learning. Il aborde également les stratégies de déploiement pour les appareils edge et l'utilisation d'environnements d'exécution cloud pour l'accélération matérielle. La ressource est implémentée sous forme d'une collection de Jupyter Notebooks.
Implements convolutional neural network architectures for spatial feature extraction and image processing.
HigherHRNet est un framework de deep learning conçu pour l'estimation de pose humaine bottom-up. Il fonctionne comme un détecteur de points clés en vision par ordinateur qui identifie et suit les articulations du corps humain en utilisant des pyramides de caractéristiques haute résolution et l'apprentissage de représentations sensibles à l'échelle. Le projet se distingue par une approche bottom-up, qui identifie les parties du corps individuellement sur toute l'image avant de les regrouper en squelettes humains distincts. Cette méthodologie est soutenue par une fusion de caractéristiques multi-résolution, qui maintient des représentations haute résolution tout au long du réseau en fusionnant de manière répétée des branches parallèles de résolutions spatiales variées. Pour garantir une précision constante pour des sujets de tailles différentes, le système utilise la régression de cartes de chaleur sensible à l'échelle et l'inférence multi-échelle, agrégeant les prédictions sur plusieurs résolutions d'image. Le framework inclut des outils complets pour entraîner des réseaux de neurones sur de grands jeux de données. Ces pipelines d'entraînement intègrent la normalisation par lots synchronisée pour stabiliser la convergence sur plusieurs GPU et le calcul tensoriel en précision mixte pour gérer la consommation de mémoire et la vitesse d'entraînement. L'architecture utilise également des couches de suréchantillonnage par déconvolution pour mapper les représentations basse résolution vers les dimensions d'entrée originales.
Provides tools for training neural networks for keypoint detection using large datasets and optimized training techniques.
Ce projet est un framework de deep learning construit pour détecter et suivre les points clés du corps humain dans des images et des flux vidéo. Il fonctionne à la fois comme un système de suivi de mouvement en temps réel et comme un environnement de machine learning pour entraîner et évaluer des modèles d'estimation de pose. Le système utilise un réseau de neurones convolutif à deux branches pour prédire simultanément les emplacements des parties du corps et leurs connexions directionnelles. Il emploie un raffinement des caractéristiques multi-étapes pour améliorer la précision de la localisation des points clés et utilise des algorithmes d'analyse gloutonne et de correspondance bipartite pour associer les parties détectées en squelettes individuels. Pour maintenir les performances pendant l'analyse vidéo en direct, le framework exécute une inférence parallèle sur les régions de l'image en utilisant le traitement par lots basé sur des tenseurs. Au-delà du suivi en temps réel, la bibliothèque fournit des outils pour entraîner des modèles sur des jeux de données annotés et calculer la précision moyenne (mAP) par rapport à des benchmarks standardisés pour vérifier la qualité de la détection. Le dépôt inclut les composants nécessaires pour gérer l'intégralité du cycle de vie de l'estimation de pose, de l'entraînement initial du modèle à la validation des performances.
Provides training pipelines to optimize neural network weights for human pose detection on annotated datasets.
Ce projet est un pipeline de vision par ordinateur qui intègre la détection et le suivi d'objets pour surveiller des objets en mouvement au sein de flux vidéo. Il fonctionne comme un outil d'analyse de bout en bout qui traite les images vidéo pour identifier, classifier et maintenir l'identité unique des objets à mesure qu'ils se déplacent dans une scène. Le système utilise une combinaison d'inférence de deep learning pour la détection et d'estimation de mouvement pour assurer la continuité temporelle. En associant des descripteurs d'apparence visuelle à une modélisation prédictive du mouvement, il maintient les identités des objets même pendant des occlusions temporaires ou lorsque le chevauchement spatial est insuffisant. Le framework emploie un traitement séquentiel pour synchroniser les résultats de détection avec la logique de suivi, permettant une surveillance cohérente des patterns de mouvement. Au-delà du suivi de base, le logiciel inclut des capacités pour quantifier l'activité au sein d'un flux vidéo. Il prend en charge le calcul des totaux d'objets ou de véhicules à mesure qu'ils franchissent des lignes désignées ou entrent dans des zones spécifiques. L'implémentation est structurée comme un framework de développement pour construire des applications de vision personnalisées qui interprètent et extraient des données d'environnements dynamiques.
Uses convolutional neural network architectures to perform high-speed object detection and classification within video frames.
Ce projet est un framework de vision par ordinateur conçu pour la détection en temps réel des points clés du corps humain et des structures squelettiques. Il fournit une boîte à outils intégrée pour entraîner, optimiser et exécuter des modèles d'estimation de pose spécifiquement pour un déploiement sur du matériel informatique en périphérie (edge computing). Le framework se distingue en utilisant le mappage de champ d'affinité de partie (part affinity field) pour encoder les relations spatiales entre les articulations, qui sont ensuite traitées via un algorithme d'analyse glouton pour reconstruire les squelettes humains à partir de données visuelles. Pour garantir une exécution haute performance, la bibliothèque incorpore la quantification de modèle et des moteurs d'inférence accélérés par le matériel qui optimisent les graphes computationnels pour un matériel local spécifique. Au-delà de la détection de base, le projet prend en charge des flux de travail de bout en bout qui incluent le développement de modèles de pose personnalisés en utilisant des schémas de jeux de données standardisés. Ces capacités permettent le réglage fin des modèles pour répondre à des tâches de détection uniques tout en maintenant les exigences de faible latence nécessaires pour l'analyse de flux vidéo en direct.
Supports end-to-end workflows for training specialized pose estimation models using custom dataset schemas.