20 repository-uri
Architectures and models designed for processing, classifying, and labeling visual data such as images.
Explore 20 awesome GitHub repositories matching artificial intelligence & ml · Computer Vision Models. Refine with filters or upvote what's useful.
This project is an open-source, interactive educational platform designed to teach deep learning through a comprehensive, code-first curriculum. It provides a structured learning path that covers foundational mathematics, modern neural network architectures, and practical optimization techniques, enabling practitioners to master complex artificial intelligence concepts through hands-on experimentation. The platform distinguishes itself by integrating technical explanations with executable Jupyter notebooks. This design allows readers to modify code and hyperparameters in real-time, facilitati
Examines the structural components and feature extraction capabilities of convolutional neural networks through interactive code examples.
This repository serves as a centralized collection of state-of-the-art deep learning architectures and reference implementations designed for research and application development. It provides a comprehensive toolkit for computer vision and natural language processing, offering pre-built models and training pipelines for tasks ranging from image classification and object detection to complex sequence modeling. The project distinguishes itself by providing a flexible execution harness that manages the entire training lifecycle, including data ingestion and backpropagation. It supports scalable
Exposes standardized, high-performance architectures tailored for image classification, object detection, and segmentation tasks.
Ultralytics is a comprehensive computer vision framework designed for training, validating, and deploying deep learning models across a wide range of visual recognition tasks. It provides a unified interface for core operations including object detection, instance segmentation, pose estimation, and image classification. By utilizing a modular architecture, the platform allows users to swap model components to balance inference speed and accuracy requirements for diverse applications. The framework distinguishes itself through its support for real-time processing and flexible deployment. It in
Locates and monitors specific anatomical or object keypoints within video frames and static images.
Appwrite is a backend-as-a-service platform that provides a unified development environment for building full-stack applications. It integrates essential infrastructure components—including authentication, databases, storage, and serverless functions—into a single, centralized interface to simplify application development and resource management. The platform distinguishes itself through a container-based microservices architecture that ensures consistent execution across diverse infrastructure. It features a versatile connectivity layer that links frontend applications with third-party servi
Processes and labels visual data through integrated computer vision model capabilities.
YOLOv7 is a PyTorch vision library and real-time inference engine designed for object detection, human pose estimation, and instance segmentation. It provides a framework for detecting and locating multiple objects within images or video streams using neural networks. The system includes tools for custom model training and fine-tuning, allowing pre-trained weights to be adapted to specialized datasets via transfer learning. It also supports model weight export and format conversion to facilitate deployment on production servers and embedded edge devices.
Provides a vision model that identifies keypoints on the human body to determine orientation and posture.
OpenALPR is a computer vision platform designed to identify vehicle license plates and attributes from live video streams or static images. It functions as an intelligent access control and analytics system, enabling the automation of security monitoring, parking facility management, and operational workflows through real-time vehicle detection. The platform distinguishes itself by supporting international license plate formats and regional configuration mapping, allowing for deployment across diverse geographic standards. It integrates directly with existing network camera infrastructure, pe
Employs deep learning models to classify character patterns and vehicle attributes from image segments.
This is a real-time object detection framework built on the YOLOv3 architecture, implemented in PyTorch. It provides a complete pipeline for identifying and localizing objects in images and video using a single neural network pass, combining a Darknet-53 backbone with multi-scale feature pyramids and anchor-based bounding box prediction. The framework extends beyond basic detection to include instance segmentation, human pose estimation, and multi-object tracking across video frames. It offers a model export toolkit that converts trained models through ONNX to CoreML, TensorFlow Lite, and Ten
Ships a human pose estimation model that detects body keypoints and reconstructs poses in images and video.
AlphaPose este un framework de deep learning pentru estimarea posturii și o bibliotecă PyTorch de computer vision, concepută pentru detectarea și urmărirea punctelor cheie ale corpului uman, feței, mâinilor și picioarelor în imagini și clipuri video. Oferă un sistem pentru estimarea scheletică a posturii și urmărirea posturii pentru mai multe persoane. Proiectul implementează instrumente pentru reconstrucția tridimensională a posturii umane, generând poziții ale articulațiilor și forme ale mesh-ului corporal din date bidimensionale. Include, de asemenea, un tracker de postură pentru mai multe persoane, capabil să mențină identitatea acestora pe parcursul cadrelor video consecutive. Framework-ul acoperă o gamă largă de capabilități de computer vision, inclusiv localizarea punctelor cheie pentru mai multe persoane, urmărirea mișcării umane și reconstrucția mesh-urilor corporale 3D.
Detects keypoints for the human body, face, hands, and feet across multiple people in images and videos.
CenterNet este un framework de detectare a obiectelor bazat pe puncte centrale și un pipeline de computer vision în timp real. Acesta identifică obiectele și posturile prin prezicerea punctelor centrale în loc să utilizeze anchor boxes. Sistemul funcționează ca un estimator de bounding box-uri 3D, un model de estimare a posturii umane și un instrument pentru detectarea obiectelor în timp real. Acesta tratează plasarea articulațiilor și locațiile obiectelor ca probleme de detectare a punctelor centrale pentru a localiza entitățile în imagini și în spațiul tridimensional. Capabilitățile acoperă detectarea obiectelor 3D, estimarea punctelor cheie umane și analiza video live. Pipeline-ul utilizează un proces de inferență feedforward într-o singură etapă pentru a efectua analize continue pe camere web sau fișiere video.
Identifies human body joints and limbs by treating pose estimation as center point detection.
PaddleX is a PaddlePaddle-based framework for building, deploying, and fine-tuning AI model pipelines, with pre-built support for computer vision, OCR, document analysis, and time series tasks. It offers a toolkit of ready-to-use pipelines for image classification, object detection, segmentation, and pose estimation, alongside an end-to-end OCR document analysis pipeline that extracts text, tables, formulas, and layout information. The platform also includes a dedicated time series forecasting pipeline for analyzing historical data to detect anomalies, classify patterns, and predict future val
Identifies and locates specific body joints like shoulders and elbows in images to analyze human pose.
Gluon-CV este o bibliotecă de computer vision pentru MXNet care oferă o colecție cuprinzătoare de arhitecturi de viziune pre-implementate și pipeline-uri de antrenament. Servește drept toolkit de cercetare în deep learning și o grădină zoologică de modele (model zoo) care conține ponderi pre-antrenate de ultimă generație pentru analiza imaginilor și a videoclipurilor. Proiectul include o bibliotecă specializată de estimare a posturii umane și un toolkit de compresie a modelelor. Aceste instrumente permit tăierea (pruning) și cuantizarea modelelor de deep learning pentru a crește viteza de inferență și a facilita implementarea pe hardware edge cu resurse limitate. Biblioteca acoperă o gamă largă de capabilități de viziune, inclusiv clasificarea imaginilor, detectarea obiectelor și segmentarea semantică și de instanță. De asemenea, oferă instrumente pentru analiza video, cum ar fi recunoașterea acțiunilor, urmărirea obiectelor și estimarea adâncimii monoculare. Antrenamentul este susținut prin pipeline-uri automatizate și sarcini de lucru distribuite multi-GPU pentru a accelera convergența modelului.
Includes specialized models for identifying anatomical keypoints and tracking human body movement.
Acest proiect este o colecție de Jupyter Notebooks educaționale care oferă tutoriale despre construcția rețelelor neuronale și operații cu tensori folosind framework-ul TensorFlow. Servește drept depozit educațional de machine learning și ghid de implementare pentru studenții pasionați de deep learning. Suita se concentrează pe arhitecturi avansate specifice, inclusiv rețele convoluționale pentru clasificarea imaginilor, rețele reziduale cu conexiuni de tip skip pentru stabilitatea antrenamentului și autoencodere variaționale pentru modelare generativă și sinteza datelor. Include, de asemenea, ghiduri pentru construirea de autoencodere de tip denoising și deep pentru extragerea caracteristicilor și reducerea dimensionalității. Depozitul acoperă o arie mai largă de modelare predictivă, cu implementări de regresie liniară, polinomială și logistică pentru predicția valorilor continue și a rezultatelor binare. Conținutul este organizat în notebook-uri interactive care permit utilizatorilor să execute operații matematice și să modifice experimentele de machine learning.
Builds convolutional neural networks utilizing convolutional layers for feature extraction and visual pattern recognition.
Sapiens este un model de viziune umană de înaltă rezoluție conceput pentru sarcini de computer vision centrate pe om, de înaltă precizie. Acesta funcționează ca o suită de instrumente pentru estimarea posturii umane, a adâncimii și a geometriei suprafeței. Proiectul utilizează un backbone de tip vision transformer pentru a îndeplini sarcini multiple printr-un encoder partajat. Această arhitectură permite predicția simultană a structurilor scheletice, a locațiilor articulațiilor și a distanței dintre o cameră și un subiect uman. Capabilitățile modelului acoperă segmentarea părților corpului uman pentru a izola regiunile anatomice de fundal și predicția normalelor suprafeței pentru a recupera detalii geometrice 3D din imagini 2D. Aceste sarcini sunt susținute de un framework de învățare multi-task care utilizează regresia la nivel de pixel și mascarea prin segmentare semantică.
Delineates human anatomical regions and joint locations to separate people from backgrounds.
Acest proiect este o implementare PyTorch a unei arhitecturi de cercetare concepute pentru învățarea reprezentărilor de înaltă rezoluție. Acesta servește drept framework de computer vision axat pe detectarea precisă a punctelor cheie, estimarea posturii umane și segmentarea semantică a imaginilor. Implementarea oferă instrumente specializate pentru identificarea reperelor anatomice pe corpul uman și pentru prezicerea coordonatelor punctelor cheie faciale în vederea analizării orientării și alinierii. Utilizează un sistem de fluxuri paralele cu rezoluții multiple și fuziune repetată la mai multe scări pentru a menține reprezentări de înaltă rezoluție în întreaga rețea. Framework-ul acoperă o gamă largă de sarcini de computer vision, inclusiv detectarea obiectelor, clasificarea imaginilor și segmentarea semantică la nivel de pixel. Include, de asemenea, fluxuri de lucru pentru antrenarea modelelor pe seturi de date etichetate și pentru evaluarea cantitativă a acurateței pozițiilor articulațiilor prezise față de datele de validare.
Includes workflows for training neural networks to detect human keypoints using labeled datasets.
This project is a collection of TensorFlow machine learning examples providing reference implementations for various neural network paradigms. It covers supervised, unsupervised, reinforcement, and sequential learning models. The repository includes implementations for convolutional neural networks focused on image classification and ranking, as well as recurrent neural networks for time-series forecasting and sequence-to-sequence translation. It further provides examples of reinforcement learning agents trained via reward optimization and unsupervised learning techniques such as autoencoders
Implements convolutional neural networks for feature extraction in image and video processing tasks.
Acest proiect este o resursă educațională cuprinzătoare și un manual de tutoriale pentru construirea, antrenarea și implementarea modelelor de machine learning folosind TensorFlow 2. Acesta servește drept ghid de învățare structurat, acoperind concepte fundamentale de deep learning, inclusiv arhitecturi de rețele neuronale, diferențiere automată și operații cu tensori. Manualul oferă îndrumări tehnice pentru optimizarea eficienței execuției prin gestionarea memoriei GPU, antrenarea distribuită și cuantizarea modelelor. Include, de asemenea, manuale detaliate pentru construirea de pipeline-uri de date de înaltă performanță și exportul modelelor pentru servere de producție, dispozitive mobile și browsere web. Materialul acoperă o gamă largă de capabilități, inclusiv dezvoltarea de modele cu rețele convoluționale și recurente, implementarea de funcții de loss și straturi personalizate, precum și utilizarea modelelor pre-antrenate pentru transfer learning. De asemenea, abordează strategii de implementare pentru dispozitive edge și utilizarea runtime-urilor bazate pe cloud pentru accelerare hardware. Resursa este implementată sub forma unei colecții de Jupyter Notebooks.
Implements convolutional neural network architectures for spatial feature extraction and image processing.
HigherHRNet este un framework de deep learning conceput pentru estimarea posturii umane de tip bottom-up. Acesta funcționează ca un detector de puncte cheie (keypoints) în computer vision, care identifică și urmărește articulațiile corpului uman prin utilizarea piramidelor de caracteristici de înaltă rezoluție și a învățării reprezentărilor conștiente de scară (scale-aware). Proiectul se distinge printr-o abordare bottom-up, care identifică părțile individuale ale corpului în întreaga imagine înainte de a le grupa în schelete umane distincte. Această metodologie este susținută de fuziunea caracteristicilor multi-rezoluție, care menține reprezentări de înaltă rezoluție în întreaga rețea prin îmbinarea repetată a ramurilor paralele de rezoluții spațiale variabile. Pentru a asigura o acuratețe consistentă pentru subiecți de dimensiuni diferite, sistemul folosește regresia heatmap-urilor scale-aware și inferența multi-scală, agregând predicțiile pe mai multe rezoluții ale imaginii. Framework-ul include instrumente cuprinzătoare pentru antrenarea rețelelor neuronale pe seturi de date mari. Aceste pipeline-uri de antrenare încorporează normalizarea batch sincronizată pentru a stabiliza convergența pe mai multe unități de procesare grafică (GPU) și calculul tensorial cu precizie mixtă pentru a gestiona consumul de memorie și viteza de antrenare. Arhitectura utilizează, de asemenea, straturi de upsampling deconvolutional pentru a mapa reprezentările de joasă rezoluție înapoi la dimensiunile originale de input.
Provides tools for training neural networks for keypoint detection using large datasets and optimized training techniques.
Acest proiect este un framework de deep learning construit pentru detectarea și urmărirea punctelor cheie ale corpului uman în imagini și fluxuri video. Acesta funcționează atât ca un sistem de urmărire a mișcării în timp real, cât și ca un mediu de machine learning pentru antrenarea și evaluarea modelelor de estimare a posturii. Sistemul utilizează o rețea neuronală convoluțională cu două ramuri pentru a prezice simultan locațiile părților corpului și conexiunile lor direcționale. Folosește rafinarea caracteristicilor în mai multe etape pentru a îmbunătăți acuratețea localizării punctelor cheie și utilizează algoritmi de parsare greedy și potrivire bipartită pentru a asocia părțile detectate în schelete individuale. Pentru a menține performanța în timpul analizei video live, framework-ul execută inferența paralelă pe regiuni ale imaginii folosind procesarea batch bazată pe tensori. Dincolo de urmărirea în timp real, biblioteca oferă instrumente pentru antrenarea modelelor pe seturi de date adnotate și calcularea preciziei medii (mAP) față de benchmark-uri standardizate pentru a verifica calitatea detecției. Repository-ul include componentele necesare pentru a gestiona întregul ciclu de viață al estimării posturii, de la antrenarea inițială a modelului până la validarea performanței.
Provides training pipelines to optimize neural network weights for human pose detection on annotated datasets.
Acest proiect este un pipeline de computer vision care integrează detectarea și urmărirea obiectelor pentru a monitoriza obiectele în mișcare în fluxurile video. Funcționează ca un instrument de analiză end-to-end care procesează cadrele video pentru a identifica, clasifica și menține identitatea unică a obiectelor pe măsură ce se mișcă printr-o scenă. Sistemul utilizează o combinație de inferență deep learning pentru detectare și estimarea mișcării pentru a asigura continuitatea temporală. Prin împerecherea descriptorilor de aspect vizual cu modelarea predictivă a mișcării, menține identitățile obiectelor chiar și în timpul ocluziilor temporale sau când suprapunerea spațială este insuficientă. Framework-ul folosește procesarea secvențială pentru a sincroniza rezultatele detectării cu logica de urmărire, permițând monitorizarea consistentă a tiparelor de mișcare. Dincolo de urmărirea de bază, software-ul include capabilități pentru cuantificarea activității într-un flux video. Suportă calcularea numărului total de obiecte sau vehicule pe măsură ce traversează linii desemnate sau intră în zone specifice. Implementarea este structurată ca un framework de dezvoltare pentru construirea de aplicații de viziune personalizate care interpretează și extrag date din medii dinamice.
Uses convolutional neural network architectures to perform high-speed object detection and classification within video frames.
Acest proiect este un framework de viziune computerizată conceput pentru detectarea în timp real a punctelor cheie ale corpului uman și a structurilor scheletice. Oferă un toolkit integrat pentru antrenarea, optimizarea și executarea modelelor de estimare a posturii, special pentru implementarea pe hardware de edge computing. Framework-ul se distinge prin utilizarea mapării part affinity field pentru a coda relațiile spațiale dintre articulații, care sunt apoi procesate printr-un algoritm de parsare greedy pentru a reconstrui scheletele umane din date vizuale. Pentru a asigura execuția de înaltă performanță, biblioteca încorporează cuantificarea modelului și motoare de inferență accelerate hardware care optimizează grafurile computaționale pentru hardware local specific. Dincolo de detectarea de bază, proiectul susține fluxuri de lucru end-to-end care includ dezvoltarea de modele de postură personalizate folosind scheme de seturi de date standardizate. Aceste capabilități permit fine-tuning-ul modelelor pentru a aborda sarcini de detectare unice, menținând în același timp cerințele de latență scăzută necesare pentru analiza fluxului video live.
Supports end-to-end workflows for training specialized pose estimation models using custom dataset schemas.