awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

24 dépôts

Awesome GitHub Repositories3D Pose Estimation

Converting 2D pose detections or images into three-dimensional spatial coordinates.

Distinct from 3D Pose Estimation: Existing candidates are either in 'awesome-lists' or too specific to real-time tracking; a core ML category is needed.

Explore 24 awesome GitHub repositories matching artificial intelligence & ml · 3D Pose Estimation. Refine with filters or upvote what's useful.

Awesome 3D Pose Estimation GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • winfredy/sadtalkerAvatar de Winfredy

    Winfredy/SadTalker

    13,919Voir sur GitHub↗

    SadTalker is a generative framework designed to synthesize expressive talking head videos from static portrait images. By mapping audio signals or text prompts to three-dimensional facial motion coefficients, the system synchronizes lip movements, facial expressions, and head orientation to create realistic digital character performances. The project distinguishes itself by decoupling identity from dynamic motion through latent space encoding, ensuring that the generated animations maintain visual fidelity to the source portrait. It supports comprehensive motion synthesis, including full-body

    Calculates head orientation and movement parameters from source data to drive realistic spatial transformations of the static portrait.

    Python
    Voir sur GitHub↗13,919
  • mvig-sjtu/alphaposeAvatar de MVIG-SJTU

    MVIG-SJTU/AlphaPose

    8,583Voir sur GitHub↗

    AlphaPose est un framework de deep learning pour l'estimation de pose et une bibliothèque de vision par ordinateur PyTorch conçue pour détecter et suivre les points clés du corps humain, du visage, des mains et des pieds dans les images et les vidéos. Il fournit un système pour l'estimation de la posture squelettique et le suivi de pose multi-personnes. Le projet implémente des outils pour la reconstruction de pose humaine en 3D, générant des positions d'articulations et des formes de maillage corporel à partir de données d'images 2D. Il inclut également un tracker de pose multi-personnes capable de maintenir l'identité de plusieurs individus à travers des images vidéo consécutives. Le framework couvre un large éventail de capacités en vision par ordinateur, notamment la localisation de points clés multi-personnes, le suivi de mouvement humain et la reconstruction de maillages corporels en 3D.

    Calculates three-dimensional joint positions and body mesh shapes from two-dimensional image data.

    Python
    Voir sur GitHub↗8,583
  • tadasbaltrusaitis/openfaceAvatar de TadasBaltrusaitis

    TadasBaltrusaitis/OpenFace

    7,690Voir sur GitHub↗

    OpenFace est un framework d'informatique affective et une boîte à outils d'analyse du comportement facial conçus pour l'extraction de caractéristiques faciales et la reconnaissance des mouvements musculaires afin d'analyser le comportement émotionnel humain. Il fournit une plateforme de recherche pour analyser les émotions humaines et les modèles d'interaction sociale via la vision par ordinateur. Le logiciel implémente une suite d'outils pour détecter les points de repère faciaux, calculer la pose de la tête dans l'espace 3D par rapport à une caméra, et suivre le regard en analysant la position et l'orientation des yeux. Il inclut également des capacités de reconnaissance des unités d'action faciale pour identifier des mouvements musculaires spécifiques. Le projet couvre un large éventail de primitives d'analyse faciale, incluant l'extraction de caractéristiques faciales pour transformer des images brutes en visages alignés et descripteurs standardisés.

    Calculates the orientation and position of a head in 3D space relative to the camera.

    MATLAB
    Voir sur GitHub↗7,690
  • open-mmlab/mmposeAvatar de open-mmlab

    open-mmlab/mmpose

    7,374Voir sur GitHub↗

    MMPose is a PyTorch-based pose estimation toolbox and deep learning training pipeline designed for detecting 2D and 3D keypoints on humans, animals, and faces. It serves as a computer vision model zoo and a framework for both 2D pose estimation and 3D pose lifting. The project is distinguished by its modular architecture and extensibility, employing a registry-based system and hierarchical configurations to allow for custom algorithm integration and model pipeline customization. It supports diverse estimation paradigms, including top-down, bottom-up, and two-stage pose lifting workflows. The

    Converts two-dimensional pose detections into three-dimensional coordinates to provide spatial depth information.

    Pythonanimal-pose-estimationbenchmarkcpm
    Voir sur GitHub↗7,374
  • facebookresearch/denseposeAvatar de facebookresearch

    facebookresearch/DensePose

    7,252Voir sur GitHub↗

    DensePose is a 3D human pose estimation framework designed to map 2D image pixels to a 3D surface-based model of the human body in real time. It functions as a computer vision anatomical mapper that projects 2D visual data onto a 3D surface to create detailed anatomical representations. The system operates as an image-to-3D texture transfer engine, localizing 2D image annotations onto 3D models to apply photographic textures to digital human representations. It uses a surface-based body mapping method to associate human pixels in an RGB image with specific coordinates on a 3D body template.

    Analyzes 2D images to determine the precise 3D position and orientation of human body parts.

    Jupyter Notebook
    Voir sur GitHub↗7,252
  • relativty/relativAvatar de relativty

    relativty/Relativ

    7,189Voir sur GitHub↗

    Relativ is an open-source project for the development of custom virtual reality hardware, encompassing the mechanical design, electronics, and software interfaces required to build a headset from scratch. It provides the frameworks necessary for assembling devices using open-source electronics and firmware. The project integrates custom hardware with SteamVR through driver-based configurations, mapping device identifiers and display viewports to ensure rendered images align with physical secondary displays. It employs a combination of microcontroller-based inertial measurement unit polling fo

    Uses camera feeds and neural networks to estimate 3D body position for spatial movement tracking.

    C++
    Voir sur GitHub↗7,189
  • shimat/opencvsharpAvatar de shimat

    shimat/opencvsharp

    6,011Voir sur GitHub↗

    OpenCVSharp is a .NET library that wraps native OpenCV functions, providing C# developers with access to OpenCV's computer vision capabilities through an API that mirrors the native C/C++ style. It serves as a managed wrapper for image processing, feature detection, object detection, and image manipulation tasks, while also handling automatic disposal of unmanaged OpenCV resources like Mat objects to prevent memory leaks in .NET applications. The library enables keypoint detection and descriptor extraction using algorithms such as AKAZE, BRISK, or FAST, with brute-force or FLANN-based matchin

    Estimates the pose of a calibrated camera from a set of 3D-to-2D point correspondences.

    C#computer-visiondotnetdotnetstandard
    Voir sur GitHub↗6,011
  • facebookresearch/sam-3d-objectsAvatar de facebookresearch

    facebookresearch/sam-3d-objects

    6,012Voir sur GitHub↗

    SAM 3D Objects is a promptable foundation model that recovers 3D objects and human meshes from single images. It converts masked objects in a single photograph into full 3D models with pose, shape, texture, and layout, while also producing complete 3D human body meshes from the same input. The system integrates promptable segmentation to isolate objects and humans before reconstruction, then aligns the independently reconstructed 3D elements into a shared coordinate space. This enables scene-level understanding where multiple 3D reconstructions from the same image coexist in a common coordina

    Estimates 3D shape, pose, and texture from a single image using learned parametric models.

    Python
    Voir sur GitHub↗6,012
  • deeplabcut/deeplabcutD

    DeepLabCut/DeepLabCut

    5,694Voir sur GitHub↗

    DeepLabCut est une boîte à outils de deep learning pour l'estimation de pose animale 2D et 3D sans marqueur. Il fonctionne comme un système de suivi de mouvement qui identifie des points anatomiques clés sur des animaux dans des séquences vidéo sans avoir besoin de marqueurs physiques. Le framework utilise l'apprentissage par transfert (transfer learning) et une bibliothèque de poids pré-entraînés pour accélérer l'entraînement de réseaux pour différentes espèces. Il prend en charge le suivi d'identité multi-individus pour maintenir des identités uniques à travers les séquences vidéo et offre une détection de pose en temps réel pour les flux vidéo en direct. Le système couvre un large éventail de capacités de vision par ordinateur, incluant l'analyse de mouvement spatial 3D, le suivi de marqueurs anatomiques et le raffinement de prédiction auto-supervisé. Il inclut des utilitaires pour l'étiquetage des données d'entraînement et un registre de modèles pour intégrer des architectures de réseaux de neurones personnalisées. Le logiciel fournit une conteneurisation Docker pour garantir une installation et une exécution cohérentes sur différents systèmes d'exploitation.

    Extracts three-dimensional spatial coordinates from video to analyze animal movement in 3D space.

    Python
    Voir sur GitHub↗5,694
  • yeemachine/kalidokitAvatar de yeemachine

    yeemachine/kalidokit

    5,660Voir sur GitHub↗

    Kalidokit is a web-based motion capture tool that transforms real-time webcam video into 3D character animation data. It functions as a blendshape and kinematics calculator, converting facial, hand, and body tracking data from Mediapipe and TensorFlow.js into blendshape weights and euler rotations for driving digital puppets and avatars. The tool solves face landmarks to derive head rotation, eye blinks, mouth shapes, and brow values for rigging, while hand landmarks are converted into finger joint rotations and body keypoints into per-joint euler rotations for full-body animation. It include

    Derives head rotation, tilt, and lean angles from face landmarks using perspective-n-point algorithms.

    TypeScriptface-detectionhand-detectionmediapipe-facemesh
    Voir sur GitHub↗5,660
  • yadiraf/prnetAvatar de YadiraF

    YadiraF/PRNet

    5,013Voir sur GitHub↗

    PRNet est une bibliothèque Python pour la reconstruction faciale 3D. Elle utilise un modèle de régression par apprentissage profond pour prédire la géométrie faciale 3D et les couleurs des sommets à partir d'une seule image 2D afin de générer un maillage texturé. Le projet fournit des outils pour l'échange de visages numériques, permettant de remplacer un visage cible par une nouvelle image et de mélanger les textures pour correspondre à la pose originale. Il inclut également un framework pour l'échange et le mélange de textures faciales afin de s'adapter à des poses 3D spécifiques. Des capacités supplémentaires couvrent l'analyse faciale, y compris la détection et l'alignement des points de repère faciaux ainsi que l'estimation de la pose de la tête et des matrices d'orientation de la caméra.

    Implements techniques for calculating the 3D orientation and position of a head relative to a camera.

    Python
    Voir sur GitHub↗5,013
  • zejun-yang/aniportraitAvatar de Zejun-Yang

    Zejun-Yang/AniPortrait

    5,020Voir sur GitHub↗

    AniPortrait est un pipeline de synthèse vidéo IA conçu pour générer des portraits parlants photoréalistes et des animations faciales. Il fonctionne comme un générateur de têtes parlantes et un animateur piloté par l'audio qui synchronise les mouvements des lèvres, les expressions et les poses de la tête avec la parole ou des sources vidéo de référence. Le système inclut un outil de transfert d'expression faciale pour réenacter les mouvements d'une vidéo source sur une image de référence statique. Il utilise un modèle de diffusion latente avec un conditionnement d'image basé sur la référence pour maintenir l'identité visuelle et la cohérence à travers les images générées. Le pipeline couvre le mappage audio-vers-expression, le contrôle de mouvement guidé par la pose et la synthèse vidéo photoréaliste. Il incorpore un suréchantillonnage par interpolation d'images pour accélérer le processus de génération et réduire le temps de rendu total.

    Directs specific head orientation and movement during animation using external control files.

    Python
    Voir sur GitHub↗5,020
  • accord-net/frameworkAvatar de accord-net

    accord-net/framework

    4,540Voir sur GitHub↗

    Ce projet est un framework de calcul scientifique pour l'écosystème .NET, fournissant une suite complète de bibliothèques pour l'analyse numérique, les statistiques et l'optimisation mathématique. Il sert de boîte à outils fondamentale pour développer des applications en machine learning, traitement numérique du signal et vision par ordinateur. Le framework fournit des outils spécialisés pour l'entraînement et le déploiement de modèles prédictifs, incluant les réseaux de neurones, les machines à vecteurs de support (SVM) et les arbres de décision. Il se distingue par des intégrations poussées pour l'analyse visuelle en temps réel, comme le suivi d'objets et la détection de traits faciaux, ainsi qu'une bibliothèque dédiée au traitement numérique du signal pour capturer et filtrer les signaux audio et de capteurs. La surface de capacités s'étend à la décomposition de matrices de haut niveau et à l'algèbre linéaire, à la modélisation d'états probabilistes et aux algorithmes de recherche heuristique. Il couvre également un large éventail d'utilitaires de manipulation de données, de la réduction de dimensionnalité et la normalisation à l'organisation de données spatiales et aux composants de visualisation scientifique. Le système inclut des contrôleurs d'intégration matérielle pour la configuration de caméras, la gestion des ports GPIO et le matériel de détection de profondeur spécialisé.

    Calculates the three-dimensional position and orientation of objects in space.

    C#
    Voir sur GitHub↗4,540
  • nv-tlabs/get3dAvatar de nv-tlabs

    nv-tlabs/GET3D

    4,441Voir sur GitHub↗

    GET3D est un framework de rendu et de modèle de maillage 3D génératif conçu pour synthétiser des formes texturées et des maillages tétraédriques de haute qualité. Il fonctionne comme un reconstructeur image-vers-3D et un générateur texte-vers-3D, utilisant un moteur de rendu 3D différentiable pour produire des perspectives visuelles et des effets de matériaux réalistes. Le système permet la création d'assets 3D à partir d'images 2D uniques, de nuages de points ou de prompts textuels descriptifs. Il dispose d'un interpolateur d'espace latent pour créer des transitions fluides entre différents objets 3D et prend en charge le contrôle indépendant de la géométrie et de la texture. Le projet couvre un large éventail de capacités de génération 3D, y compris la synthèse voxel-vers-forme, la synthèse de nouvelles vues et l'estimation non supervisée de matériaux. Il fournit également des outils pour l'extraction d'isosurfaces et la génération de maillages tétraédriques prêts pour la physique.

    Estimates 3D geometry, textures, and lighting from a single-view image without requiring 3D supervision data.

    Python
    Voir sur GitHub↗4,441
  • zju3dv/easymocapAvatar de zju3dv

    zju3dv/EasyMocap

    4,483Voir sur GitHub↗

    EasyMocap is a markerless 3D human motion capture system that recovers body, hand, and face poses from single or multi-view video without physical markers or suits. It uses parametric body models like SMPL, SMPL-X, and MANO, and leverages mirror reflections to resolve depth ambiguity in single-view pose estimation, improving accuracy by computing mirror surface normals from vanishing points. The system distinguishes itself through mirror-assisted depth disambiguation, enabling accurate 3D pose reconstruction from a single RGB image or video that includes a mirror reflection. It also supports

    Recovering 3D body, hand, and face poses from single or multi-view video without physical markers or suits.

    Pythonmotion-capture
    Voir sur GitHub↗4,483
  • xlite-dev/lite.ai.toolkitAvatar de xlite-dev

    xlite-dev/lite.ai.toolkit

    4,413Voir sur GitHub↗

    lite.ai.toolkit est une boîte à outils de vision par ordinateur en C++ conçue pour le déploiement d'IA sur le edge. Elle permet l'exécution de modèles pré-entraînés pour la détection d'objets, la classification d'images et la segmentation sur des appareils aux ressources limitées. Le projet dispose d'un moteur d'inférence multi-backend qui prend en charge le runtime de modèle ONNX, permettant aux modèles d'IA de s'exécuter sur différentes cibles matérielles. Il inclut un pipeline accéléré par GPU spécifiquement pour le matériel NVIDIA afin de réduire la latence et d'augmenter la vitesse de traitement. La boîte à outils couvre un large éventail de capacités d'analyse faciale, incluant la détection d'émotions, l'estimation du genre et de l'âge, et l'analyse de la pose de la tête. Elle fournit également des outils pour la reconnaissance faciale via l'extraction d'embeddings de caractéristiques et le calcul de similarité cosinus pour vérifier les identités. Les capacités supplémentaires incluent le détourage d'image (matting) pour l'isolation du premier plan, la colorisation d'images en niveaux de gris et le transfert de style artistique.

    Calculates 3D head orientation using yaw, pitch, and roll Euler angles.

    C++
    Voir sur GitHub↗4,413
  • bytedance-seed/depth-anything-3Avatar de ByteDance-Seed

    ByteDance-Seed/Depth-Anything-3

    4,412Voir sur GitHub↗

    Depth-Anything-3 is a collection of core model implementations for depth prediction, multi-view geometry estimation, and RGB-D spatial pipelines. It includes a monocular depth estimation model for predicting depth maps from single images or video, and a 3D Gaussian splatting generator that predicts parameters to synthesize high-fidelity novel views of a scene. The project provides a multi-view geometry estimator for calculating spatially consistent depth and camera poses across synchronized visual inputs. It also functions as a visual SLAM enhancement tool designed to reduce drift and improve

    Calculates precise 3D camera positions and orientations from visual inputs using coordinate-based pose estimation.

    Python
    Voir sur GitHub↗4,412
  • michaelgrupp/evoAvatar de MichaelGrupp

    MichaelGrupp/evo

    4,255Voir sur GitHub↗

    evo est un framework Python pour l'évaluation des algorithmes SLAM, de l'odométrie robotique et des données de trajectoire. Il sert de bibliothèque d'analyse pour mesurer la dérive et la précision en calculant les erreurs de pose absolues et relatives entre les chemins estimés et les références de vérité terrain. Le projet fournit un framework d'alignement géométrique pour corriger la rotation, la translation et l'échelle entre les trajectoires spatiales, assurant une mesure d'erreur cohérente. Il inclut des outils spécialisés pour l'analyse de la dérive odométrique et le traitement des données robotiques, y compris la capacité d'extraire des informations de trajectoire à partir de fichiers ROS bagfiles. Le logiciel couvre un large éventail de capacités, notamment la visualisation de trajectoires 2D et 3D avec prise en charge des tuiles de cartes géographiques et des superpositions de cartes ROS. Les fonctionnalités supplémentaires incluent la synchronisation temporelle, les transformations spatiales et la possibilité de filtrer ou d'exporter des données de trajectoire dans divers formats standards de l'industrie.

    Flattens 3D trajectory poses into specified 2D planes such as xy, xz, or yz for simplified analysis.

    Python
    Voir sur GitHub↗4,255
  • facebookresearch/videopose3dAvatar de facebookresearch

    facebookresearch/VideoPose3D

    3,986Voir sur GitHub↗

    VideoPose3D is a machine learning framework designed for 3D human pose estimation. It functions as a motion reconstruction tool that predicts 3D joint positions from 2D video sequences using a temporal convolutional network to process body movement over time. The project includes a semi-supervised learning pipeline that improves pose accuracy by combining labeled datasets with unlabeled video data and projection consistency loss. It also features a video pose visualizer capable of rendering 3D skeleton reconstructions and 2D keypoints as overlays on original footage. The framework covers the

    Provides a framework for converting 2D pose detections from video into three-dimensional spatial coordinates.

    Python
    Voir sur GitHub↗3,986
  • cvg/hierarchical-localizationAvatar de cvg

    cvg/Hierarchical-Localization

    3,961Voir sur GitHub↗

    This project is a 3D visual localization framework designed to determine a camera's exact position and orientation by matching 2D image features against a 3D reference model. It includes a structure-from-motion pipeline to reconstruct 3D scene geometry from unordered image sets, creating the necessary spatial maps for localization. The system employs a hierarchical coarse-to-fine localization approach. This process begins with a global-descriptor image retrieval system to identify candidate reference images from a large database and progresses through local feature matching to final 3D model

    Calculates precise camera position and orientation by solving the transformation between 2D points and 3D coordinates.

    Pythondeep-learningfeature-matchingimage-retrieval
    Voir sur GitHub↗3,961
Préc.12Suivant
  1. Home
  2. Artificial Intelligence & ML
  3. 3D Pose Estimation

Explorer les sous-tags

  • Custom Video InferenceApplying trained pose estimation models to original, unseen video files for real-world analysis. **Distinct from 3D Pose Estimation:** Focuses on the inference process on custom video files rather than the general coordinate conversion methodology
  • Head Pose Estimation1 sous-tagTechniques for calculating the 3D orientation and position of a head relative to a camera. **Distinct from 3D Pose Estimation:** Distinct from 3D Pose Estimation: specifically targets the orientation of the head rather than full body or generic object pose.
  • Markerless Motion CaptureRecovering 3D body, hand, and face poses from single or multi-view video without physical markers or suits. **Distinct from 3D Pose Estimation:** Distinct from 3D Pose Estimation: focuses on markerless motion capture from video, not general 3D pose estimation from images.
  • Mirror-Assisted Depth DisambiguationsEstimates 3D human pose from a single RGB image or video by using mirror reflections to resolve depth ambiguity. **Distinct from 3D Pose Estimation:** Distinct from general 3D Pose Estimation: specifically leverages mirror reflections and vanishing point analysis to resolve depth ambiguity in single-view inputs.
  • Perspective-n-Point Solvers1 sous-tagEstimating the pose of a calibrated camera from a set of 3D-to-2D point correspondences. **Distinct from 3D Pose Estimation:** Distinct from 3D Pose Estimation: specifically solves the Perspective-n-Point problem for camera pose from known 3D-2D correspondences, not general pose estimation.
  • Planar Pose ProjectionsProjecting 3D spatial poses onto specific 2D coordinate planes. **Distinct from 3D Pose Estimation:** This is a data projection for analysis, unlike 3D Pose Estimation which is a recovery process from images.
  • Pseudo Ground-Truth RefinementsUses reconstructed 3D poses as pseudo ground-truth to boost the accuracy and generalizability of existing pose estimation models. **Distinct from 3D Pose Estimation:** Distinct from general 3D Pose Estimation: focuses on using reconstructed poses as training data to improve other models, not on direct pose estimation itself.
  • Single-View Shape and Texture EstimationsEstimates 3D shape, pose, and texture from a single image using learned parametric models. **Distinct from 3D Pose Estimation:** Distinct from 3D Pose Estimation: also estimates shape and texture, not just skeletal pose.
  • Spatial Motion AnalysisAnalysis of 3D pose data to extract volumetric and depth information from motion sequences. **Distinct from 3D Pose Estimation:** Distinct from 3D Pose Estimation as it focuses on the subsequent analysis of motion and depth rather than the initial coordinate estimation.
  • Visual Localization FrameworksIntegrated systems that combine image retrieval and pose estimation to locate cameras in 3D space. **Distinct from 3D Pose Estimation:** Distinct from general pose estimation by incorporating a full pipeline of retrieval and matching against a reference model.