4 dépôts
Workflows for training neural networks for keypoint detection using large datasets and memory-efficient optimization techniques.
Distinct from Pose Estimation Models: Distinct from general pose estimation models: focuses on the training pipeline and optimization tools rather than the model architecture itself.
Explore 4 awesome GitHub repositories matching artificial intelligence & ml · Pose Estimation Training Pipelines. Refine with filters or upvote what's useful.
Ce projet est une implémentation PyTorch d'une architecture de recherche conçue pour l'apprentissage de représentations haute résolution. Il sert de framework de vision par ordinateur axé sur la détection précise de points clés, l'estimation de pose humaine et la segmentation sémantique d'images. L'implémentation fournit des outils spécialisés pour identifier les points de repère anatomiques sur le corps humain et prédire les coordonnées des points clés du visage afin d'analyser l'orientation et l'alignement. Elle utilise un système de flux parallèles multi-résolution et une fusion multi-échelle répétée pour maintenir des représentations haute résolution tout au long du réseau. Le framework couvre un large éventail de tâches de vision par ordinateur, notamment la détection d'objets, la classification d'images et la segmentation sémantique au niveau du pixel. Il inclut également des workflows pour entraîner des modèles sur des jeux de données étiquetés et évaluer quantitativement la précision des positions articulaires prédites par rapport aux données de validation.
Includes workflows for training neural networks to detect human keypoints using labeled datasets.
HigherHRNet est un framework de deep learning conçu pour l'estimation de pose humaine bottom-up. Il fonctionne comme un détecteur de points clés en vision par ordinateur qui identifie et suit les articulations du corps humain en utilisant des pyramides de caractéristiques haute résolution et l'apprentissage de représentations sensibles à l'échelle. Le projet se distingue par une approche bottom-up, qui identifie les parties du corps individuellement sur toute l'image avant de les regrouper en squelettes humains distincts. Cette méthodologie est soutenue par une fusion de caractéristiques multi-résolution, qui maintient des représentations haute résolution tout au long du réseau en fusionnant de manière répétée des branches parallèles de résolutions spatiales variées. Pour garantir une précision constante pour des sujets de tailles différentes, le système utilise la régression de cartes de chaleur sensible à l'échelle et l'inférence multi-échelle, agrégeant les prédictions sur plusieurs résolutions d'image. Le framework inclut des outils complets pour entraîner des réseaux de neurones sur de grands jeux de données. Ces pipelines d'entraînement intègrent la normalisation par lots synchronisée pour stabiliser la convergence sur plusieurs GPU et le calcul tensoriel en précision mixte pour gérer la consommation de mémoire et la vitesse d'entraînement. L'architecture utilise également des couches de suréchantillonnage par déconvolution pour mapper les représentations basse résolution vers les dimensions d'entrée originales.
Provides tools for training neural networks for keypoint detection using large datasets and optimized training techniques.
Ce projet est un framework de deep learning construit pour détecter et suivre les points clés du corps humain dans des images et des flux vidéo. Il fonctionne à la fois comme un système de suivi de mouvement en temps réel et comme un environnement de machine learning pour entraîner et évaluer des modèles d'estimation de pose. Le système utilise un réseau de neurones convolutif à deux branches pour prédire simultanément les emplacements des parties du corps et leurs connexions directionnelles. Il emploie un raffinement des caractéristiques multi-étapes pour améliorer la précision de la localisation des points clés et utilise des algorithmes d'analyse gloutonne et de correspondance bipartite pour associer les parties détectées en squelettes individuels. Pour maintenir les performances pendant l'analyse vidéo en direct, le framework exécute une inférence parallèle sur les régions de l'image en utilisant le traitement par lots basé sur des tenseurs. Au-delà du suivi en temps réel, la bibliothèque fournit des outils pour entraîner des modèles sur des jeux de données annotés et calculer la précision moyenne (mAP) par rapport à des benchmarks standardisés pour vérifier la qualité de la détection. Le dépôt inclut les composants nécessaires pour gérer l'intégralité du cycle de vie de l'estimation de pose, de l'entraînement initial du modèle à la validation des performances.
Provides training pipelines to optimize neural network weights for human pose detection on annotated datasets.
Ce projet est un framework de vision par ordinateur conçu pour la détection en temps réel des points clés du corps humain et des structures squelettiques. Il fournit une boîte à outils intégrée pour entraîner, optimiser et exécuter des modèles d'estimation de pose spécifiquement pour un déploiement sur du matériel informatique en périphérie (edge computing). Le framework se distingue en utilisant le mappage de champ d'affinité de partie (part affinity field) pour encoder les relations spatiales entre les articulations, qui sont ensuite traitées via un algorithme d'analyse glouton pour reconstruire les squelettes humains à partir de données visuelles. Pour garantir une exécution haute performance, la bibliothèque incorpore la quantification de modèle et des moteurs d'inférence accélérés par le matériel qui optimisent les graphes computationnels pour un matériel local spécifique. Au-delà de la détection de base, le projet prend en charge des flux de travail de bout en bout qui incluent le développement de modèles de pose personnalisés en utilisant des schémas de jeux de données standardisés. Ces capacités permettent le réglage fin des modèles pour répondre à des tâches de détection uniques tout en maintenant les exigences de faible latence nécessaires pour l'analyse de flux vidéo en direct.
Supports end-to-end workflows for training specialized pose estimation models using custom dataset schemas.