6 repository-uri
Models that detect key body joints and limbs for each person in an image or video to reconstruct their pose.
Distinct from Pose Estimation Models: Distinct from Pose Estimation Models: focuses specifically on human body keypoints rather than general object or animal pose estimation.
Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Human. Refine with filters or upvote what's useful.
This is a real-time object detection framework built on the YOLOv3 architecture, implemented in PyTorch. It provides a complete pipeline for identifying and localizing objects in images and video using a single neural network pass, combining a Darknet-53 backbone with multi-scale feature pyramids and anchor-based bounding box prediction. The framework extends beyond basic detection to include instance segmentation, human pose estimation, and multi-object tracking across video frames. It offers a model export toolkit that converts trained models through ONNX to CoreML, TensorFlow Lite, and Ten
Ships a human pose estimation model that detects body keypoints and reconstructs poses in images and video.
AlphaPose este un framework de deep learning pentru estimarea posturii și o bibliotecă PyTorch de computer vision, concepută pentru detectarea și urmărirea punctelor cheie ale corpului uman, feței, mâinilor și picioarelor în imagini și clipuri video. Oferă un sistem pentru estimarea scheletică a posturii și urmărirea posturii pentru mai multe persoane. Proiectul implementează instrumente pentru reconstrucția tridimensională a posturii umane, generând poziții ale articulațiilor și forme ale mesh-ului corporal din date bidimensionale. Include, de asemenea, un tracker de postură pentru mai multe persoane, capabil să mențină identitatea acestora pe parcursul cadrelor video consecutive. Framework-ul acoperă o gamă largă de capabilități de computer vision, inclusiv localizarea punctelor cheie pentru mai multe persoane, urmărirea mișcării umane și reconstrucția mesh-urilor corporale 3D.
Detects keypoints for the human body, face, hands, and feet across multiple people in images and videos.
CenterNet este un framework de detectare a obiectelor bazat pe puncte centrale și un pipeline de computer vision în timp real. Acesta identifică obiectele și posturile prin prezicerea punctelor centrale în loc să utilizeze anchor boxes. Sistemul funcționează ca un estimator de bounding box-uri 3D, un model de estimare a posturii umane și un instrument pentru detectarea obiectelor în timp real. Acesta tratează plasarea articulațiilor și locațiile obiectelor ca probleme de detectare a punctelor centrale pentru a localiza entitățile în imagini și în spațiul tridimensional. Capabilitățile acoperă detectarea obiectelor 3D, estimarea punctelor cheie umane și analiza video live. Pipeline-ul utilizează un proces de inferență feedforward într-o singură etapă pentru a efectua analize continue pe camere web sau fișiere video.
Identifies human body joints and limbs by treating pose estimation as center point detection.
PaddleX is a PaddlePaddle-based framework for building, deploying, and fine-tuning AI model pipelines, with pre-built support for computer vision, OCR, document analysis, and time series tasks. It offers a toolkit of ready-to-use pipelines for image classification, object detection, segmentation, and pose estimation, alongside an end-to-end OCR document analysis pipeline that extracts text, tables, formulas, and layout information. The platform also includes a dedicated time series forecasting pipeline for analyzing historical data to detect anomalies, classify patterns, and predict future val
Identifies and locates specific body joints like shoulders and elbows in images to analyze human pose.
Gluon-CV este o bibliotecă de computer vision pentru MXNet care oferă o colecție cuprinzătoare de arhitecturi de viziune pre-implementate și pipeline-uri de antrenament. Servește drept toolkit de cercetare în deep learning și o grădină zoologică de modele (model zoo) care conține ponderi pre-antrenate de ultimă generație pentru analiza imaginilor și a videoclipurilor. Proiectul include o bibliotecă specializată de estimare a posturii umane și un toolkit de compresie a modelelor. Aceste instrumente permit tăierea (pruning) și cuantizarea modelelor de deep learning pentru a crește viteza de inferență și a facilita implementarea pe hardware edge cu resurse limitate. Biblioteca acoperă o gamă largă de capabilități de viziune, inclusiv clasificarea imaginilor, detectarea obiectelor și segmentarea semantică și de instanță. De asemenea, oferă instrumente pentru analiza video, cum ar fi recunoașterea acțiunilor, urmărirea obiectelor și estimarea adâncimii monoculare. Antrenamentul este susținut prin pipeline-uri automatizate și sarcini de lucru distribuite multi-GPU pentru a accelera convergența modelului.
Includes specialized models for identifying anatomical keypoints and tracking human body movement.
Sapiens este un model de viziune umană de înaltă rezoluție conceput pentru sarcini de computer vision centrate pe om, de înaltă precizie. Acesta funcționează ca o suită de instrumente pentru estimarea posturii umane, a adâncimii și a geometriei suprafeței. Proiectul utilizează un backbone de tip vision transformer pentru a îndeplini sarcini multiple printr-un encoder partajat. Această arhitectură permite predicția simultană a structurilor scheletice, a locațiilor articulațiilor și a distanței dintre o cameră și un subiect uman. Capabilitățile modelului acoperă segmentarea părților corpului uman pentru a izola regiunile anatomice de fundal și predicția normalelor suprafeței pentru a recupera detalii geometrice 3D din imagini 2D. Aceste sarcini sunt susținute de un framework de învățare multi-task care utilizează regresia la nivel de pixel și mascarea prin segmentare semantică.
Delineates human anatomical regions and joint locations to separate people from backgrounds.