awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

20 Repos

Awesome GitHub RepositoriesComputer Vision Models

Architectures and models designed for processing, classifying, and labeling visual data such as images.

Explore 20 awesome GitHub repositories matching artificial intelligence & ml · Computer Vision Models. Refine with filters or upvote what's useful.

Awesome Computer Vision Models GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • d2l-ai/d2l-zhAvatar von d2l-ai

    d2l-ai/d2l-zh

    78,493Auf GitHub ansehen↗

    This project is an open-source, interactive educational platform designed to teach deep learning through a comprehensive, code-first curriculum. It provides a structured learning path that covers foundational mathematics, modern neural network architectures, and practical optimization techniques, enabling practitioners to master complex artificial intelligence concepts through hands-on experimentation. The platform distinguishes itself by integrating technical explanations with executable Jupyter notebooks. This design allows readers to modify code and hyperparameters in real-time, facilitati

    Examines the structural components and feature extraction capabilities of convolutional neural networks through interactive code examples.

    Pythonbookchinesecomputer-vision
    Auf GitHub ansehen↗78,493
  • tensorflow/modelsAvatar von tensorflow

    tensorflow/models

    77,663Auf GitHub ansehen↗

    This repository serves as a centralized collection of state-of-the-art deep learning architectures and reference implementations designed for research and application development. It provides a comprehensive toolkit for computer vision and natural language processing, offering pre-built models and training pipelines for tasks ranging from image classification and object detection to complex sequence modeling. The project distinguishes itself by providing a flexible execution harness that manages the entire training lifecycle, including data ingestion and backpropagation. It supports scalable

    Exposes standardized, high-performance architectures tailored for image classification, object detection, and segmentation tasks.

    Python
    Auf GitHub ansehen↗77,663
  • ultralytics/ultralyticsAvatar von ultralytics

    ultralytics/ultralytics

    58,468Auf GitHub ansehen↗

    Ultralytics is a comprehensive computer vision framework designed for training, validating, and deploying deep learning models across a wide range of visual recognition tasks. It provides a unified interface for core operations including object detection, instance segmentation, pose estimation, and image classification. By utilizing a modular architecture, the platform allows users to swap model components to balance inference speed and accuracy requirements for diverse applications. The framework distinguishes itself through its support for real-time processing and flexible deployment. It in

    Locates and monitors specific anatomical or object keypoints within video frames and static images.

    Pythonclicomputer-visiondeep-learning
    Auf GitHub ansehen↗58,468
  • appwrite/appwriteAvatar von appwrite

    appwrite/appwrite

    56,318Auf GitHub ansehen↗

    Appwrite is a backend-as-a-service platform that provides a unified development environment for building full-stack applications. It integrates essential infrastructure components—including authentication, databases, storage, and serverless functions—into a single, centralized interface to simplify application development and resource management. The platform distinguishes itself through a container-based microservices architecture that ensures consistent execution across diverse infrastructure. It features a versatile connectivity layer that links frontend applications with third-party servi

    Processes and labels visual data through integrated computer vision model capabilities.

    TypeScriptandroidappwritebackend
    Auf GitHub ansehen↗56,318
  • wongkinyiu/yolov7Avatar von WongKinYiu

    WongKinYiu/yolov7

    14,110Auf GitHub ansehen↗

    YOLOv7 is a PyTorch vision library and real-time inference engine designed for object detection, human pose estimation, and instance segmentation. It provides a framework for detecting and locating multiple objects within images or video streams using neural networks. The system includes tools for custom model training and fine-tuning, allowing pre-trained weights to be adapted to specialized datasets via transfer learning. It also supports model weight export and format conversion to facilitate deployment on production servers and embedded edge devices.

    Provides a vision model that identifies keypoints on the human body to determine orientation and posture.

    Jupyter Notebookdarknetpytorchscaled-yolov4
    Auf GitHub ansehen↗14,110
  • openalpr/openalprAvatar von openalpr

    openalpr/openalpr

    11,366Auf GitHub ansehen↗

    OpenALPR is a computer vision platform designed to identify vehicle license plates and attributes from live video streams or static images. It functions as an intelligent access control and analytics system, enabling the automation of security monitoring, parking facility management, and operational workflows through real-time vehicle detection. The platform distinguishes itself by supporting international license plate formats and regional configuration mapping, allowing for deployment across diverse geographic standards. It integrates directly with existing network camera infrastructure, pe

    Employs deep learning models to classify character patterns and vehicle attributes from image segments.

    C++
    Auf GitHub ansehen↗11,366
  • ultralytics/yolov3Avatar von ultralytics

    ultralytics/yolov3

    10,571Auf GitHub ansehen↗

    This is a real-time object detection framework built on the YOLOv3 architecture, implemented in PyTorch. It provides a complete pipeline for identifying and localizing objects in images and video using a single neural network pass, combining a Darknet-53 backbone with multi-scale feature pyramids and anchor-based bounding box prediction. The framework extends beyond basic detection to include instance segmentation, human pose estimation, and multi-object tracking across video frames. It offers a model export toolkit that converts trained models through ONNX to CoreML, TensorFlow Lite, and Ten

    Ships a human pose estimation model that detects body keypoints and reconstructs poses in images and video.

    Pythondeep-learningmachine-learningobject-detection
    Auf GitHub ansehen↗10,571
  • mvig-sjtu/alphaposeAvatar von MVIG-SJTU

    MVIG-SJTU/AlphaPose

    8,583Auf GitHub ansehen↗

    AlphaPose ist ein Deep-Learning-Framework zur Pose-Schätzung und eine PyTorch-Bibliothek für Computer Vision, die darauf ausgelegt ist, Schlüsselpunkte von menschlichen Körpern, Gesichtern, Händen und Füßen in Bildern und Videos zu erkennen und zu verfolgen. Es bietet ein System zur Skelett-Pose-Schätzung und zum Multi-Person-Pose-Tracking. Das Projekt implementiert Werkzeuge für die dreidimensionale Rekonstruktion menschlicher Posen, wobei Gelenkpositionen und Körpernetzformen aus zweidimensionalen Bilddaten generiert werden. Es enthält zudem einen Multi-Person-Pose-Tracker, der die Identität mehrerer Personen über aufeinanderfolgende Videoframes hinweg beibehalten kann. Das Framework deckt ein breites Spektrum an Computer-Vision-Funktionen ab, darunter die Lokalisierung von Schlüsselpunkten bei mehreren Personen, die Verfolgung menschlicher Bewegungen und die Rekonstruktion dreidimensionaler Körpernetze.

    Detects keypoints for the human body, face, hands, and feet across multiple people in images and videos.

    Python
    Auf GitHub ansehen↗8,583
  • xingyizhou/centernetAvatar von xingyizhou

    xingyizhou/CenterNet

    7,565Auf GitHub ansehen↗

    CenterNet ist ein Framework für die Objekterkennung mittels Mittelpunkten und eine Echtzeit-Computer-Vision-Pipeline. Es identifiziert Objekte und Posen durch die Vorhersage von Mittelpunkten anstelle der Verwendung von Anchor-Boxen. Das System fungiert als 3D-Bounding-Box-Schätzer, als Modell zur Schätzung menschlicher Posen und als Tool für die Echtzeit-Objekterkennung. Es behandelt die Platzierung von Gelenken und Objektpositionen als Probleme der Mittelpunkterkennung, um Entitäten in Bildern und im dreidimensionalen Raum zu lokalisieren. Die Funktionen decken 3D-Objekterkennung, Schätzung menschlicher Keypoints und Live-Videoanalyse ab. Die Pipeline verwendet einen einstufigen Feedforward-Inferenzprozess, um eine kontinuierliche Analyse von Webcams oder Videodateien durchzuführen.

    Identifies human body joints and limbs by treating pose estimation as center point detection.

    Python
    Auf GitHub ansehen↗7,565
  • paddlepaddle/paddlexAvatar von PaddlePaddle

    PaddlePaddle/PaddleX

    6,163Auf GitHub ansehen↗

    PaddleX is a PaddlePaddle-based framework for building, deploying, and fine-tuning AI model pipelines, with pre-built support for computer vision, OCR, document analysis, and time series tasks. It offers a toolkit of ready-to-use pipelines for image classification, object detection, segmentation, and pose estimation, alongside an end-to-end OCR document analysis pipeline that extracts text, tables, formulas, and layout information. The platform also includes a dedicated time series forecasting pipeline for analyzing historical data to detect anomalies, classify patterns, and predict future val

    Identifies and locates specific body joints like shoulders and elbows in images to analyze human pose.

    Pythonai-pipelinesclassificationdeployment
    Auf GitHub ansehen↗6,163
  • dmlc/gluon-cvAvatar von dmlc

    dmlc/gluon-cv

    5,922Auf GitHub ansehen↗

    Gluon-CV ist eine MXNet-Computer-Vision-Bibliothek, die eine umfassende Sammlung vortrainierter Vision-Architekturen und Trainings-Pipelines bereitstellt. Sie dient als Deep-Learning-Research-Toolkit und Model-Zoo mit State-of-the-Art-Gewichten für die Bild- und Videoanalyse. Das Projekt enthält eine spezialisierte Bibliothek für Human-Pose-Estimation sowie ein Toolkit zur Modellkompression. Diese Tools ermöglichen das Pruning und die Quantisierung von Deep-Learning-Modellen, um die Inferenzgeschwindigkeit zu erhöhen und die Bereitstellung auf ressourcenbeschränkter Edge-Hardware zu erleichtern. Die Bibliothek deckt ein breites Spektrum an Vision-Funktionen ab, darunter Bildklassifizierung, Objekterkennung sowie semantische und Instanz-Segmentierung. Sie bietet zudem Tools für die Videoanalyse, wie Action-Recognition, Objekt-Tracking und monokulare Tiefenschätzung. Das Training wird durch automatisierte Pipelines und verteilte Multi-GPU-Workloads unterstützt, um die Modellkonvergenz zu beschleunigen.

    Includes specialized models for identifying anatomical keypoints and tracking human body movement.

    Pythonaction-recognitioncomputer-visiondeep-learning
    Auf GitHub ansehen↗5,922
  • pkmital/tensorflow_tutorialsAvatar von pkmital

    pkmital/tensorflow_tutorials

    5,668Auf GitHub ansehen↗

    This project is a collection of educational Jupyter Notebooks providing tutorials on neural network construction and tensor operations using the TensorFlow framework. It serves as a machine learning educational repository and implementation guide for deep learning students. The suite focuses on specific advanced architectures, including convolutional networks for image classification, residual networks with skip connections for training stability, and variational autoencoders for generative modeling and data synthesis. It also includes guides for building denoising and deep autoencoders to pe

    Builds convolutional neural networks utilizing convolutional layers for feature extraction and visual pattern recognition.

    Jupyter Notebook
    Auf GitHub ansehen↗5,668
  • facebookresearch/sapiensAvatar von facebookresearch

    facebookresearch/sapiens

    5,388Auf GitHub ansehen↗

    Sapiens ist ein hochauflösendes menschliches Sichtmodell, das für hochpräzise, menschenzentrierte Computer-Vision-Aufgaben entwickelt wurde. Es fungiert als Tool-Suite zur Schätzung menschlicher Posen, Tiefe und Oberflächengeometrie. Das Projekt nutzt ein Vision-Transformer-Backbone, um mehrere Aufgaben über einen gemeinsamen Encoder auszuführen. Diese Architektur ermöglicht die gleichzeitige Vorhersage von Skelettstrukturen, Gelenkpositionen und der Entfernung zwischen einer Kamera und einer menschlichen Person. Die Funktionen des Modells decken die Segmentierung menschlicher Körperteile zur Isolierung anatomischer Regionen vom Hintergrund sowie die Vorhersage von Oberflächennormalen zur Wiederherstellung von 3D-Geometriedetails aus 2D-Bildern ab. Diese Aufgaben werden durch ein Multi-Task-Learning-Framework unterstützt, das pixelweise Regression und semantische Segmentierungsmaskierung verwendet.

    Delineates human anatomical regions and joint locations to separate people from backgrounds.

    Python
    Auf GitHub ansehen↗5,388
  • leoxiaobin/deep-high-resolution-net.pytorchAvatar von leoxiaobin

    leoxiaobin/deep-high-resolution-net.pytorch

    4,479Auf GitHub ansehen↗

    Dieses Projekt ist eine PyTorch-Implementierung einer Forschungsarchitektur für hochauflösendes Representation Learning. Es dient als Computer-Vision-Framework mit Fokus auf präziser Keypoint-Erkennung, menschlicher Pose-Schätzung und semantischer Bildsegmentierung. Die Implementierung bietet spezialisierte Tools zur Identifizierung anatomischer Orientierungspunkte am menschlichen Körper und zur Vorhersage von Gesichtskoordinaten für die Analyse von Ausrichtung und Position. Es nutzt ein System aus parallelen Streams mit mehreren Auflösungen und wiederholter Multi-Scale-Fusion, um hochauflösende Repräsentationen im gesamten Netzwerk beizubehalten. Das Framework deckt ein breites Spektrum an Computer-Vision-Aufgaben ab, darunter Objekterkennung, Bildklassifizierung und pixelgenaue semantische Segmentierung. Es enthält zudem Workflows für das Training von Modellen auf gelabelten Datensätzen und die quantitative Evaluierung der Genauigkeit vorhergesagter Gelenkpositionen anhand von Validierungsdaten.

    Includes workflows for training neural networks to detect human keypoints using labeled datasets.

    Cuda
    Auf GitHub ansehen↗4,479
  • binroot/tensorflow-bookAvatar von BinRoot

    BinRoot/TensorFlow-Book

    4,431Auf GitHub ansehen↗

    Dieses Projekt ist eine Sammlung von TensorFlow-Machine-Learning-Beispielen, die Referenzimplementierungen für verschiedene neuronale Netzwerkparadigmen bereitstellen. Es deckt überwachte (supervised), unüberwachte (unsupervised), verstärkende (reinforcement) und sequentielle Lernmodelle ab. Das Repository enthält Implementierungen für Convolutional Neural Networks (CNNs), die auf Bildklassifizierung und -ranking fokussiert sind, sowie Recurrent Neural Networks (RNNs) für Zeitreihenprognosen und Sequence-to-Sequence-Übersetzung. Es bietet zudem Beispiele für Reinforcement-Learning-Agenten, die durch Belohnungsoptimierung trainiert werden, sowie unüberwachte Lerntechniken wie Autoencoder und selbstorganisierende Karten für Daten-Clustering. Zusätzliche Funktionen decken überwachte Regression und Klassifizierung, semantische Embedding-Generierung und die Verwendung von Hidden-Markov-Modellen für sequentielle Datenmodellierung ab. Das Projekt enthält zudem Utilities für das Management von Tensor-Operationen und die Visualisierung der Modellleistung über Dashboards. Der Inhalt wird als eine Reihe von Jupyter Notebooks bereitgestellt.

    Implements convolutional neural networks for feature extraction in image and video processing tasks.

    Jupyter Notebookautoencoderbookclassification
    Auf GitHub ansehen↗4,431
  • snowkylin/tensorflow-handbookAvatar von snowkylin

    snowkylin/tensorflow-handbook

    3,927Auf GitHub ansehen↗

    Dieses Projekt ist eine umfassende Bildungsressource und ein Tutorial-Handbuch für das Erstellen, Trainieren und Bereitstellen von Machine-Learning-Modellen mit TensorFlow 2. Es dient als strukturierter Lernleitfaden für grundlegende Deep-Learning-Konzepte, einschließlich neuronaler Netzwerkarchitekturen, automatischer Differenzierung und Tensor-Operationen. Das Handbuch bietet technische Anleitungen zur Optimierung der Ausführungseffizienz durch GPU-Speicherverwaltung, verteiltes Training und Modellquantisierung. Es enthält zudem detaillierte Anleitungen für den Aufbau leistungsfähiger Datenpipelines und den Export von Modellen für Produktionsserver, mobile Geräte und Webbrowser. Das Material deckt ein breites Spektrum an Funktionen ab, darunter die Modellentwicklung mit konvolutionellen und rekurrenten Netzwerken, die Implementierung benutzerdefinierter Verlustfunktionen und Layer sowie die Nutzung vortrainierter Modelle für Transfer Learning. Zudem werden Bereitstellungsstrategien für Edge-Geräte und die Nutzung cloudbasierter Runtimes zur Hardwarebeschleunigung behandelt. Die Ressource ist als Sammlung von Jupyter Notebooks implementiert.

    Implements convolutional neural network architectures for spatial feature extraction and image processing.

    Jupyter Notebook
    Auf GitHub ansehen↗3,927
  • hrnet/higherhrnet-human-pose-estimationAvatar von HRNet

    HRNet/HigherHRNet-Human-Pose-Estimation

    1,456Auf GitHub ansehen↗

    HigherHRNet ist ein Deep-Learning-Framework für Bottom-up-Human-Pose-Estimation. Es fungiert als Keypoint-Detektor für Computer Vision, der menschliche Körpergelenke identifiziert und verfolgt, indem er hochauflösende Feature-Pyramiden und skalenbewusstes Repräsentationslernen nutzt. Das Projekt zeichnet sich durch einen Bottom-up-Ansatz aus, der einzelne Körperteile über ein gesamtes Bild hinweg identifiziert, bevor sie zu menschlichen Skeletten gruppiert werden. Diese Methodik wird durch Multi-Resolution-Feature-Fusion unterstützt, die hochauflösende Repräsentationen im gesamten Netzwerk beibehält, indem parallele Zweige unterschiedlicher räumlicher Auflösung wiederholt zusammengeführt werden. Um eine konsistente Genauigkeit für Subjekte unterschiedlicher Größe zu gewährleisten, verwendet das System skalenbewusste Heatmap-Regression und Multi-Scale-Inferenz, wobei Vorhersagen über mehrere Bildauflösungen hinweg aggregiert werden. Das Framework enthält umfassende Tools für das Training neuronaler Netze auf großen Datensätzen. Diese Trainings-Pipelines integrieren Synchronized Batch Normalization zur Stabilisierung der Konvergenz über mehrere GPUs hinweg sowie Mixed-Precision-Tensor-Berechnungen zur Verwaltung von Speicherverbrauch und Trainingsgeschwindigkeit. Die Architektur nutzt zudem dekonvolutionale Upsampling-Layer, um niedrig aufgelöste Repräsentationen auf die ursprünglichen Eingabedimensionen abzubilden.

    Provides tools for training neural networks for keypoint detection using large datasets and optimized training techniques.

    Python
    Auf GitHub ansehen↗1,456
  • tensorboy/pytorch_realtime_multi-person_pose_estimationAvatar von tensorboy

    tensorboy/pytorch_Realtime_Multi-Person_Pose_Estimation

    1,372Auf GitHub ansehen↗

    Dieses Projekt ist ein Deep-Learning-Framework für die Erkennung und Verfolgung menschlicher Körper-Keypoints in Bildern und Videostreams. Es fungiert sowohl als Echtzeit-Motion-Tracking-System als auch als Machine-Learning-Umgebung für das Training und die Evaluierung von Pose-Estimation-Modellen. Das System nutzt ein Convolutional Neural Network mit zwei Zweigen, um Körperteilpositionen und deren gerichtete Verbindungen gleichzeitig vorherzusagen. Es verwendet mehrstufige Feature-Verfeinerung, um die Genauigkeit der Keypoint-Lokalisierung zu verbessern, und nutzt Greedy-Parsing- sowie Bipartite-Matching-Algorithmen, um erkannte Teile zu individuellen Skeletten zuzuordnen. Um die Leistung während der Live-Videoanalyse aufrechtzuerhalten, führt das Framework parallele Inferenz über Bildregionen hinweg mittels Tensor-basierter Batch-Verarbeitung aus. Über das Echtzeit-Tracking hinaus bietet die Bibliothek Tools für das Training von Modellen auf annotierten Datensätzen und die Berechnung der Mean Average Precision (mAP) gegenüber standardisierten Benchmarks, um die Erkennungsqualität zu verifizieren. Das Repository enthält die notwendigen Komponenten, um den gesamten Lebenszyklus der Pose Estimation zu verwalten, vom anfänglichen Modelltraining bis zur Leistungsvalidierung.

    Provides training pipelines to optimize neural network weights for human pose detection on annotated datasets.

    Python
    Auf GitHub ansehen↗1,372
  • muhammadmoinfaisal/yolov8-deepsort-object-trackingAvatar von MuhammadMoinFaisal

    MuhammadMoinFaisal/YOLOv8-DeepSORT-Object-Tracking

    1,166Auf GitHub ansehen↗

    This project is a computer vision pipeline that integrates object detection and tracking to monitor moving objects within video streams. It functions as an end-to-end analytics tool that processes video frames to identify, classify, and maintain the unique identity of objects as they move through a scene. The system utilizes a combination of deep learning inference for detection and motion estimation to ensure temporal continuity. By pairing visual appearance descriptors with predictive motion modeling, it maintains object identities even during temporary occlusions or when spatial overlap is

    Uses convolutional neural network architectures to perform high-speed object detection and classification within video frames.

    Jupyter Notebookobject-countingobject-detectionobject-tracking
    Auf GitHub ansehen↗1,166
  • nvidia-ai-iot/trt_poseAvatar von NVIDIA-AI-IOT

    NVIDIA-AI-IOT/trt_pose

    1,060Auf GitHub ansehen↗

    Dieses Projekt ist ein Computer-Vision-Framework für die Echtzeiterkennung menschlicher Körper-Keypoints und Skelettstrukturen. Es bietet ein integriertes Toolkit zum Trainieren, Optimieren und Ausführen von Pose-Estimation-Modellen speziell für die Bereitstellung auf Edge-Computing-Hardware. Das Framework zeichnet sich durch die Verwendung von Part-Affinity-Field-Mapping aus, um räumliche Beziehungen zwischen Gelenken zu kodieren, die dann durch einen Greedy-Parsing-Algorithmus verarbeitet werden, um menschliche Skelette aus visuellen Daten zu rekonstruieren. Um eine hochperformante Ausführung sicherzustellen, integriert die Bibliothek Modellquantisierung und hardwarebeschleunigte Inferenz-Engines, die Rechengraphen für spezifische lokale Hardware optimieren. Über die Kern-Erkennung hinaus unterstützt das Projekt End-to-End-Workflows, die die Entwicklung benutzerdefinierter Pose-Modelle unter Verwendung standardisierter Datensatz-Schemata beinhalten. Diese Funktionen ermöglichen das Fine-Tuning von Modellen, um einzigartige Erkennungsaufgaben zu adressieren, während die für Live-Videostream-Analysen notwendigen Low-Latency-Anforderungen beibehalten werden.

    Supports end-to-end workflows for training specialized pose estimation models using custom dataset schemas.

    Pythonhuman-posehuman-pose-estimationjetson
    Auf GitHub ansehen↗1,060
  1. Home
  2. Artificial Intelligence & ML
  3. Artificial Intelligence Tooling
  4. Language Model Integrations
  5. Computer Vision Models

Unter-Tags erkunden

  • Convolutional Neural NetworksDeep learning architectures utilizing convolutional layers for feature extraction in image and video processing tasks.
  • Pose Estimation Models2 Sub-TagsModels designed to detect and track specific keypoints on objects or human bodies.