12 repository-uri
Models designed to detect and track specific keypoints on objects or human bodies.
Explore 12 awesome GitHub repositories matching artificial intelligence & ml · Pose Estimation Models. Refine with filters or upvote what's useful.
Ultralytics is a comprehensive computer vision framework designed for training, validating, and deploying deep learning models across a wide range of visual recognition tasks. It provides a unified interface for core operations including object detection, instance segmentation, pose estimation, and image classification. By utilizing a modular architecture, the platform allows users to swap model components to balance inference speed and accuracy requirements for diverse applications. The framework distinguishes itself through its support for real-time processing and flexible deployment. It in
Locates and monitors specific anatomical or object keypoints within video frames and static images.
YOLOv7 is a PyTorch vision library and real-time inference engine designed for object detection, human pose estimation, and instance segmentation. It provides a framework for detecting and locating multiple objects within images or video streams using neural networks. The system includes tools for custom model training and fine-tuning, allowing pre-trained weights to be adapted to specialized datasets via transfer learning. It also supports model weight export and format conversion to facilitate deployment on production servers and embedded edge devices.
Provides a vision model that identifies keypoints on the human body to determine orientation and posture.
This is a real-time object detection framework built on the YOLOv3 architecture, implemented in PyTorch. It provides a complete pipeline for identifying and localizing objects in images and video using a single neural network pass, combining a Darknet-53 backbone with multi-scale feature pyramids and anchor-based bounding box prediction. The framework extends beyond basic detection to include instance segmentation, human pose estimation, and multi-object tracking across video frames. It offers a model export toolkit that converts trained models through ONNX to CoreML, TensorFlow Lite, and Ten
Ships a human pose estimation model that detects body keypoints and reconstructs poses in images and video.
AlphaPose este un framework de deep learning pentru estimarea posturii și o bibliotecă PyTorch de computer vision, concepută pentru detectarea și urmărirea punctelor cheie ale corpului uman, feței, mâinilor și picioarelor în imagini și clipuri video. Oferă un sistem pentru estimarea scheletică a posturii și urmărirea posturii pentru mai multe persoane. Proiectul implementează instrumente pentru reconstrucția tridimensională a posturii umane, generând poziții ale articulațiilor și forme ale mesh-ului corporal din date bidimensionale. Include, de asemenea, un tracker de postură pentru mai multe persoane, capabil să mențină identitatea acestora pe parcursul cadrelor video consecutive. Framework-ul acoperă o gamă largă de capabilități de computer vision, inclusiv localizarea punctelor cheie pentru mai multe persoane, urmărirea mișcării umane și reconstrucția mesh-urilor corporale 3D.
Detects keypoints for the human body, face, hands, and feet across multiple people in images and videos.
CenterNet este un framework de detectare a obiectelor bazat pe puncte centrale și un pipeline de computer vision în timp real. Acesta identifică obiectele și posturile prin prezicerea punctelor centrale în loc să utilizeze anchor boxes. Sistemul funcționează ca un estimator de bounding box-uri 3D, un model de estimare a posturii umane și un instrument pentru detectarea obiectelor în timp real. Acesta tratează plasarea articulațiilor și locațiile obiectelor ca probleme de detectare a punctelor centrale pentru a localiza entitățile în imagini și în spațiul tridimensional. Capabilitățile acoperă detectarea obiectelor 3D, estimarea punctelor cheie umane și analiza video live. Pipeline-ul utilizează un proces de inferență feedforward într-o singură etapă pentru a efectua analize continue pe camere web sau fișiere video.
Identifies human body joints and limbs by treating pose estimation as center point detection.
PaddleX is a PaddlePaddle-based framework for building, deploying, and fine-tuning AI model pipelines, with pre-built support for computer vision, OCR, document analysis, and time series tasks. It offers a toolkit of ready-to-use pipelines for image classification, object detection, segmentation, and pose estimation, alongside an end-to-end OCR document analysis pipeline that extracts text, tables, formulas, and layout information. The platform also includes a dedicated time series forecasting pipeline for analyzing historical data to detect anomalies, classify patterns, and predict future val
Identifies and locates specific body joints like shoulders and elbows in images to analyze human pose.
Gluon-CV este o bibliotecă de computer vision pentru MXNet care oferă o colecție cuprinzătoare de arhitecturi de viziune pre-implementate și pipeline-uri de antrenament. Servește drept toolkit de cercetare în deep learning și o grădină zoologică de modele (model zoo) care conține ponderi pre-antrenate de ultimă generație pentru analiza imaginilor și a videoclipurilor. Proiectul include o bibliotecă specializată de estimare a posturii umane și un toolkit de compresie a modelelor. Aceste instrumente permit tăierea (pruning) și cuantizarea modelelor de deep learning pentru a crește viteza de inferență și a facilita implementarea pe hardware edge cu resurse limitate. Biblioteca acoperă o gamă largă de capabilități de viziune, inclusiv clasificarea imaginilor, detectarea obiectelor și segmentarea semantică și de instanță. De asemenea, oferă instrumente pentru analiza video, cum ar fi recunoașterea acțiunilor, urmărirea obiectelor și estimarea adâncimii monoculare. Antrenamentul este susținut prin pipeline-uri automatizate și sarcini de lucru distribuite multi-GPU pentru a accelera convergența modelului.
Includes specialized models for identifying anatomical keypoints and tracking human body movement.
Sapiens este un model de viziune umană de înaltă rezoluție conceput pentru sarcini de computer vision centrate pe om, de înaltă precizie. Acesta funcționează ca o suită de instrumente pentru estimarea posturii umane, a adâncimii și a geometriei suprafeței. Proiectul utilizează un backbone de tip vision transformer pentru a îndeplini sarcini multiple printr-un encoder partajat. Această arhitectură permite predicția simultană a structurilor scheletice, a locațiilor articulațiilor și a distanței dintre o cameră și un subiect uman. Capabilitățile modelului acoperă segmentarea părților corpului uman pentru a izola regiunile anatomice de fundal și predicția normalelor suprafeței pentru a recupera detalii geometrice 3D din imagini 2D. Aceste sarcini sunt susținute de un framework de învățare multi-task care utilizează regresia la nivel de pixel și mascarea prin segmentare semantică.
Delineates human anatomical regions and joint locations to separate people from backgrounds.
Acest proiect este o implementare PyTorch a unei arhitecturi de cercetare concepute pentru învățarea reprezentărilor de înaltă rezoluție. Acesta servește drept framework de computer vision axat pe detectarea precisă a punctelor cheie, estimarea posturii umane și segmentarea semantică a imaginilor. Implementarea oferă instrumente specializate pentru identificarea reperelor anatomice pe corpul uman și pentru prezicerea coordonatelor punctelor cheie faciale în vederea analizării orientării și alinierii. Utilizează un sistem de fluxuri paralele cu rezoluții multiple și fuziune repetată la mai multe scări pentru a menține reprezentări de înaltă rezoluție în întreaga rețea. Framework-ul acoperă o gamă largă de sarcini de computer vision, inclusiv detectarea obiectelor, clasificarea imaginilor și segmentarea semantică la nivel de pixel. Include, de asemenea, fluxuri de lucru pentru antrenarea modelelor pe seturi de date etichetate și pentru evaluarea cantitativă a acurateței pozițiilor articulațiilor prezise față de datele de validare.
Includes workflows for training neural networks to detect human keypoints using labeled datasets.
HigherHRNet este un framework de deep learning conceput pentru estimarea posturii umane de tip bottom-up. Acesta funcționează ca un detector de puncte cheie (keypoints) în computer vision, care identifică și urmărește articulațiile corpului uman prin utilizarea piramidelor de caracteristici de înaltă rezoluție și a învățării reprezentărilor conștiente de scară (scale-aware). Proiectul se distinge printr-o abordare bottom-up, care identifică părțile individuale ale corpului în întreaga imagine înainte de a le grupa în schelete umane distincte. Această metodologie este susținută de fuziunea caracteristicilor multi-rezoluție, care menține reprezentări de înaltă rezoluție în întreaga rețea prin îmbinarea repetată a ramurilor paralele de rezoluții spațiale variabile. Pentru a asigura o acuratețe consistentă pentru subiecți de dimensiuni diferite, sistemul folosește regresia heatmap-urilor scale-aware și inferența multi-scală, agregând predicțiile pe mai multe rezoluții ale imaginii. Framework-ul include instrumente cuprinzătoare pentru antrenarea rețelelor neuronale pe seturi de date mari. Aceste pipeline-uri de antrenare încorporează normalizarea batch sincronizată pentru a stabiliza convergența pe mai multe unități de procesare grafică (GPU) și calculul tensorial cu precizie mixtă pentru a gestiona consumul de memorie și viteza de antrenare. Arhitectura utilizează, de asemenea, straturi de upsampling deconvolutional pentru a mapa reprezentările de joasă rezoluție înapoi la dimensiunile originale de input.
Provides tools for training neural networks for keypoint detection using large datasets and optimized training techniques.
Acest proiect este un framework de deep learning construit pentru detectarea și urmărirea punctelor cheie ale corpului uman în imagini și fluxuri video. Acesta funcționează atât ca un sistem de urmărire a mișcării în timp real, cât și ca un mediu de machine learning pentru antrenarea și evaluarea modelelor de estimare a posturii. Sistemul utilizează o rețea neuronală convoluțională cu două ramuri pentru a prezice simultan locațiile părților corpului și conexiunile lor direcționale. Folosește rafinarea caracteristicilor în mai multe etape pentru a îmbunătăți acuratețea localizării punctelor cheie și utilizează algoritmi de parsare greedy și potrivire bipartită pentru a asocia părțile detectate în schelete individuale. Pentru a menține performanța în timpul analizei video live, framework-ul execută inferența paralelă pe regiuni ale imaginii folosind procesarea batch bazată pe tensori. Dincolo de urmărirea în timp real, biblioteca oferă instrumente pentru antrenarea modelelor pe seturi de date adnotate și calcularea preciziei medii (mAP) față de benchmark-uri standardizate pentru a verifica calitatea detecției. Repository-ul include componentele necesare pentru a gestiona întregul ciclu de viață al estimării posturii, de la antrenarea inițială a modelului până la validarea performanței.
Provides training pipelines to optimize neural network weights for human pose detection on annotated datasets.
Acest proiect este un framework de viziune computerizată conceput pentru detectarea în timp real a punctelor cheie ale corpului uman și a structurilor scheletice. Oferă un toolkit integrat pentru antrenarea, optimizarea și executarea modelelor de estimare a posturii, special pentru implementarea pe hardware de edge computing. Framework-ul se distinge prin utilizarea mapării part affinity field pentru a coda relațiile spațiale dintre articulații, care sunt apoi procesate printr-un algoritm de parsare greedy pentru a reconstrui scheletele umane din date vizuale. Pentru a asigura execuția de înaltă performanță, biblioteca încorporează cuantificarea modelului și motoare de inferență accelerate hardware care optimizează grafurile computaționale pentru hardware local specific. Dincolo de detectarea de bază, proiectul susține fluxuri de lucru end-to-end care includ dezvoltarea de modele de postură personalizate folosind scheme de seturi de date standardizate. Aceste capabilități permit fine-tuning-ul modelelor pentru a aborda sarcini de detectare unice, menținând în același timp cerințele de latență scăzută necesare pentru analiza fluxului video live.
Supports end-to-end workflows for training specialized pose estimation models using custom dataset schemas.