5 Repos
High-performance pipelines for real-time human landmark detection.
Distinguishing note: Focuses on the engine/pipeline aspect, distinct from the general pose estimation concept.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Pose Estimation Engines. Refine with filters or upvote what's useful.
OpenPose is a real-time pose estimation engine designed to detect and track human body, face, hand, and foot landmarks. It functions as a multi-person motion tracker, identifying the spatial coordinates of multiple individuals simultaneously within video streams or static images. Beyond two-dimensional detection, the software acts as a three-dimensional kinematics processor, reconstructing spatial movement data from single or multiple synchronized camera perspectives. The system distinguishes itself through a bottom-up approach that utilizes part-affinity fields to associate body parts across
Detects human body, face, and hand landmarks from video streams with high-speed performance.
AlphaPose ist ein Deep-Learning-Framework zur Pose-Schätzung und eine PyTorch-Bibliothek für Computer Vision, die darauf ausgelegt ist, Schlüsselpunkte von menschlichen Körpern, Gesichtern, Händen und Füßen in Bildern und Videos zu erkennen und zu verfolgen. Es bietet ein System zur Skelett-Pose-Schätzung und zum Multi-Person-Pose-Tracking. Das Projekt implementiert Werkzeuge für die dreidimensionale Rekonstruktion menschlicher Posen, wobei Gelenkpositionen und Körpernetzformen aus zweidimensionalen Bilddaten generiert werden. Es enthält zudem einen Multi-Person-Pose-Tracker, der die Identität mehrerer Personen über aufeinanderfolgende Videoframes hinweg beibehalten kann. Das Framework deckt ein breites Spektrum an Computer-Vision-Funktionen ab, darunter die Lokalisierung von Schlüsselpunkten bei mehreren Personen, die Verfolgung menschlicher Bewegungen und die Rekonstruktion dreidimensionaler Körpernetze.
Implements a top-down pipeline that detects human bounding boxes before predicting keypoints within them.
MMPose is a PyTorch-based pose estimation toolbox and deep learning training pipeline designed for detecting 2D and 3D keypoints on humans, animals, and faces. It serves as a computer vision model zoo and a framework for both 2D pose estimation and 3D pose lifting. The project is distinguished by its modular architecture and extensibility, employing a registry-based system and hierarchical configurations to allow for custom algorithm integration and model pipeline customization. It supports diverse estimation paradigms, including top-down, bottom-up, and two-stage pose lifting workflows. The
Implements a bottom-up pose estimation pipeline that detects and groups all keypoints in an image simultaneously.
Dies ist ein Framework für die Pose-Schätzung mehrerer Personen, das für die Echtzeit-Erkennung menschlicher Keypoints konzipiert ist. Es fungiert als Bottom-up-Pose-Schätzer, der Skelettgelenke bei allen Personen in einer Szene identifiziert, ohne dass ein separater Personendetektor erforderlich ist. Das System nutzt ein Convolutional Neural Network-Modell zur Generierung von Heatmaps und Vektorfeldern für die Haltungsanalyse. Es implementiert spezifisch Part-Affinity-Fields, um die Position und Ausrichtung von Gliedmaßen zu kodieren, was es dem Modell ermöglicht, einzelne Gelenke zu vollständigen Skeletten zu verbinden. Das Projekt deckt Computer-Vision-Bewegungsanalyse und Deep-Learning-Haltungsanalyse ab und extrahiert räumliche Koordinaten menschlicher Körperteile aus Bild- und Videodaten.
Implements a bottom-up pipeline that detects keypoints globally and groups them into distinct human instances.
HigherHRNet ist ein Deep-Learning-Framework für Bottom-up-Human-Pose-Estimation. Es fungiert als Keypoint-Detektor für Computer Vision, der menschliche Körpergelenke identifiziert und verfolgt, indem er hochauflösende Feature-Pyramiden und skalenbewusstes Repräsentationslernen nutzt. Das Projekt zeichnet sich durch einen Bottom-up-Ansatz aus, der einzelne Körperteile über ein gesamtes Bild hinweg identifiziert, bevor sie zu menschlichen Skeletten gruppiert werden. Diese Methodik wird durch Multi-Resolution-Feature-Fusion unterstützt, die hochauflösende Repräsentationen im gesamten Netzwerk beibehält, indem parallele Zweige unterschiedlicher räumlicher Auflösung wiederholt zusammengeführt werden. Um eine konsistente Genauigkeit für Subjekte unterschiedlicher Größe zu gewährleisten, verwendet das System skalenbewusste Heatmap-Regression und Multi-Scale-Inferenz, wobei Vorhersagen über mehrere Bildauflösungen hinweg aggregiert werden. Das Framework enthält umfassende Tools für das Training neuronaler Netze auf großen Datensätzen. Diese Trainings-Pipelines integrieren Synchronized Batch Normalization zur Stabilisierung der Konvergenz über mehrere GPUs hinweg sowie Mixed-Precision-Tensor-Berechnungen zur Verwaltung von Speicherverbrauch und Trainingsgeschwindigkeit. Die Architektur nutzt zudem dekonvolutionale Upsampling-Layer, um niedrig aufgelöste Repräsentationen auf die ursprünglichen Eingabedimensionen abzubilden.
Identifies individual body parts across an entire image before clustering them into distinct human skeletons.