awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

20 repositorios

Awesome GitHub RepositoriesComputer Vision Models

Architectures and models designed for processing, classifying, and labeling visual data such as images.

Explore 20 awesome GitHub repositories matching artificial intelligence & ml · Computer Vision Models. Refine with filters or upvote what's useful.

Awesome Computer Vision Models GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • d2l-ai/d2l-zhAvatar de d2l-ai

    d2l-ai/d2l-zh

    78,493Ver en GitHub↗

    This project is an open-source, interactive educational platform designed to teach deep learning through a comprehensive, code-first curriculum. It provides a structured learning path that covers foundational mathematics, modern neural network architectures, and practical optimization techniques, enabling practitioners to master complex artificial intelligence concepts through hands-on experimentation. The platform distinguishes itself by integrating technical explanations with executable Jupyter notebooks. This design allows readers to modify code and hyperparameters in real-time, facilitati

    Examines the structural components and feature extraction capabilities of convolutional neural networks through interactive code examples.

    Pythonbookchinesecomputer-vision
    Ver en GitHub↗78,493
  • tensorflow/modelsAvatar de tensorflow

    tensorflow/models

    77,663Ver en GitHub↗

    This repository serves as a centralized collection of state-of-the-art deep learning architectures and reference implementations designed for research and application development. It provides a comprehensive toolkit for computer vision and natural language processing, offering pre-built models and training pipelines for tasks ranging from image classification and object detection to complex sequence modeling. The project distinguishes itself by providing a flexible execution harness that manages the entire training lifecycle, including data ingestion and backpropagation. It supports scalable

    Exposes standardized, high-performance architectures tailored for image classification, object detection, and segmentation tasks.

    Python
    Ver en GitHub↗77,663
  • ultralytics/ultralyticsAvatar de ultralytics

    ultralytics/ultralytics

    58,468Ver en GitHub↗

    Ultralytics is a comprehensive computer vision framework designed for training, validating, and deploying deep learning models across a wide range of visual recognition tasks. It provides a unified interface for core operations including object detection, instance segmentation, pose estimation, and image classification. By utilizing a modular architecture, the platform allows users to swap model components to balance inference speed and accuracy requirements for diverse applications. The framework distinguishes itself through its support for real-time processing and flexible deployment. It in

    Locates and monitors specific anatomical or object keypoints within video frames and static images.

    Pythonclicomputer-visiondeep-learning
    Ver en GitHub↗58,468
  • appwrite/appwriteAvatar de appwrite

    appwrite/appwrite

    56,318Ver en GitHub↗

    Appwrite is a backend-as-a-service platform that provides a unified development environment for building full-stack applications. It integrates essential infrastructure components—including authentication, databases, storage, and serverless functions—into a single, centralized interface to simplify application development and resource management. The platform distinguishes itself through a container-based microservices architecture that ensures consistent execution across diverse infrastructure. It features a versatile connectivity layer that links frontend applications with third-party servi

    Processes and labels visual data through integrated computer vision model capabilities.

    TypeScriptandroidappwritebackend
    Ver en GitHub↗56,318
  • wongkinyiu/yolov7Avatar de WongKinYiu

    WongKinYiu/yolov7

    14,110Ver en GitHub↗

    YOLOv7 is a PyTorch vision library and real-time inference engine designed for object detection, human pose estimation, and instance segmentation. It provides a framework for detecting and locating multiple objects within images or video streams using neural networks. The system includes tools for custom model training and fine-tuning, allowing pre-trained weights to be adapted to specialized datasets via transfer learning. It also supports model weight export and format conversion to facilitate deployment on production servers and embedded edge devices.

    Provides a vision model that identifies keypoints on the human body to determine orientation and posture.

    Jupyter Notebookdarknetpytorchscaled-yolov4
    Ver en GitHub↗14,110
  • openalpr/openalprAvatar de openalpr

    openalpr/openalpr

    11,366Ver en GitHub↗

    OpenALPR is a computer vision platform designed to identify vehicle license plates and attributes from live video streams or static images. It functions as an intelligent access control and analytics system, enabling the automation of security monitoring, parking facility management, and operational workflows through real-time vehicle detection. The platform distinguishes itself by supporting international license plate formats and regional configuration mapping, allowing for deployment across diverse geographic standards. It integrates directly with existing network camera infrastructure, pe

    Employs deep learning models to classify character patterns and vehicle attributes from image segments.

    C++
    Ver en GitHub↗11,366
  • ultralytics/yolov3Avatar de ultralytics

    ultralytics/yolov3

    10,571Ver en GitHub↗

    This is a real-time object detection framework built on the YOLOv3 architecture, implemented in PyTorch. It provides a complete pipeline for identifying and localizing objects in images and video using a single neural network pass, combining a Darknet-53 backbone with multi-scale feature pyramids and anchor-based bounding box prediction. The framework extends beyond basic detection to include instance segmentation, human pose estimation, and multi-object tracking across video frames. It offers a model export toolkit that converts trained models through ONNX to CoreML, TensorFlow Lite, and Ten

    Ships a human pose estimation model that detects body keypoints and reconstructs poses in images and video.

    Pythondeep-learningmachine-learningobject-detection
    Ver en GitHub↗10,571
  • mvig-sjtu/alphaposeAvatar de MVIG-SJTU

    MVIG-SJTU/AlphaPose

    8,583Ver en GitHub↗

    AlphaPose es un framework de estimación de pose basado en deep learning y una biblioteca de visión artificial para PyTorch, diseñada para detectar y rastrear puntos clave del cuerpo humano, rostro, manos y pies en imágenes y videos. Proporciona un sistema para la estimación de posturas esqueléticas y el seguimiento de poses de múltiples personas. El proyecto implementa herramientas para la reconstrucción de poses humanas en tres dimensiones, generando posiciones de articulaciones y mallas corporales a partir de datos de imágenes bidimensionales. También incluye un rastreador de poses multi-persona capaz de mantener la identidad de varios individuos a través de fotogramas de video consecutivos. El framework cubre una amplia gama de capacidades de visión artificial, incluyendo la localización de puntos clave en múltiples personas, el seguimiento de movimiento humano y la reconstrucción de mallas corporales en 3D.

    Detects keypoints for the human body, face, hands, and feet across multiple people in images and videos.

    Python
    Ver en GitHub↗8,583
  • xingyizhou/centernetAvatar de xingyizhou

    xingyizhou/CenterNet

    7,565Ver en GitHub↗

    CenterNet es un framework de detección de objetos por puntos centrales y una tubería (pipeline) de visión artificial en tiempo real. Identifica objetos y poses prediciendo puntos centrales en lugar de utilizar cajas de anclaje (anchor boxes). El sistema funciona como un estimador de cajas delimitadoras 3D, un modelo de estimación de pose humana y una herramienta para la detección de objetos en tiempo real. Trata la ubicación de las articulaciones y las posiciones de los objetos como problemas de detección de puntos centrales para localizar entidades en imágenes y en el espacio tridimensional. Las capacidades cubren la detección de objetos 3D, la estimación de puntos clave humanos y el análisis de video en vivo. La tubería utiliza un proceso de inferencia de alimentación directa (feedforward) de una sola etapa para realizar análisis continuo en cámaras web o archivos de video.

    Identifies human body joints and limbs by treating pose estimation as center point detection.

    Python
    Ver en GitHub↗7,565
  • paddlepaddle/paddlexAvatar de PaddlePaddle

    PaddlePaddle/PaddleX

    6,163Ver en GitHub↗

    PaddleX is a PaddlePaddle-based framework for building, deploying, and fine-tuning AI model pipelines, with pre-built support for computer vision, OCR, document analysis, and time series tasks. It offers a toolkit of ready-to-use pipelines for image classification, object detection, segmentation, and pose estimation, alongside an end-to-end OCR document analysis pipeline that extracts text, tables, formulas, and layout information. The platform also includes a dedicated time series forecasting pipeline for analyzing historical data to detect anomalies, classify patterns, and predict future val

    Identifies and locates specific body joints like shoulders and elbows in images to analyze human pose.

    Pythonai-pipelinesclassificationdeployment
    Ver en GitHub↗6,163
  • dmlc/gluon-cvAvatar de dmlc

    dmlc/gluon-cv

    5,922Ver en GitHub↗

    Gluon-CV es una biblioteca de visión artificial para MXNet que proporciona una colección completa de arquitecturas de visión preimplementadas y tuberías de entrenamiento. Sirve como un kit de herramientas de investigación de aprendizaje profundo y un zoológico de modelos (model zoo) que contiene pesos preentrenados de última generación para análisis de imágenes y video. El proyecto incluye una biblioteca especializada en estimación de pose humana y un kit de herramientas de compresión de modelos. Estas herramientas permiten la poda (pruning) y cuantización de modelos de aprendizaje profundo para aumentar la velocidad de inferencia y facilitar el despliegue en hardware de borde (edge hardware) con recursos limitados. La biblioteca cubre una amplia gama de capacidades de visión, incluyendo clasificación de imágenes, detección de objetos y segmentación semántica e instanciada. También proporciona herramientas para análisis de video, como reconocimiento de acciones, seguimiento de objetos y estimación de profundidad monocular. El entrenamiento es compatible a través de tuberías automatizadas y cargas de trabajo distribuidas multi-GPU para acelerar la convergencia del modelo.

    Includes specialized models for identifying anatomical keypoints and tracking human body movement.

    Pythonaction-recognitioncomputer-visiondeep-learning
    Ver en GitHub↗5,922
  • pkmital/tensorflow_tutorialsAvatar de pkmital

    pkmital/tensorflow_tutorials

    5,668Ver en GitHub↗

    Este proyecto es una colección de Jupyter Notebooks educativos que ofrecen tutoriales sobre la construcción de redes neuronales y operaciones con tensores utilizando el framework TensorFlow. Sirve como repositorio educativo de machine learning y guía de implementación para estudiantes de deep learning. La suite se centra en arquitecturas avanzadas específicas, incluyendo redes convolucionales para clasificación de imágenes, redes residuales con conexiones de salto (skip connections) para la estabilidad del entrenamiento y autoencoders variacionales para modelado generativo y síntesis de datos. También incluye guías para construir autoencoders de eliminación de ruido (denoising) y profundos para realizar extracción de características y reducción de dimensionalidad. El repositorio cubre un espectro más amplio de modelado predictivo, con implementaciones de regresión lineal, polinómica y logística para predecir valores continuos y resultados binarios. El contenido está organizado en notebooks interactivos que permiten a los usuarios ejecutar operaciones matemáticas y modificar experimentos de machine learning.

    Builds convolutional neural networks utilizing convolutional layers for feature extraction and visual pattern recognition.

    Jupyter Notebook
    Ver en GitHub↗5,668
  • facebookresearch/sapiensAvatar de facebookresearch

    facebookresearch/sapiens

    5,388Ver en GitHub↗

    Sapiens es un modelo de visión humana de alta resolución diseñado para tareas de visión artificial centradas en el ser humano de alta precisión. Funciona como un conjunto de herramientas para estimar la pose humana, la profundidad y la geometría de la superficie. El proyecto utiliza un backbone de vision transformer para realizar múltiples tareas a través de un codificador compartido. Esta arquitectura permite la predicción simultánea de estructuras esqueléticas, ubicaciones de articulaciones y la distancia entre una cámara y un sujeto humano. Las capacidades del modelo cubren la segmentación de partes del cuerpo humano para aislar regiones anatómicas de los fondos y la predicción de normales de superficie para recuperar detalles geométricos 3D a partir de imágenes 2D. Estas tareas están respaldadas por un framework de aprendizaje multitarea que emplea regresión a nivel de píxel y enmascaramiento de segmentación semántica.

    Delineates human anatomical regions and joint locations to separate people from backgrounds.

    Python
    Ver en GitHub↗5,388
  • leoxiaobin/deep-high-resolution-net.pytorchAvatar de leoxiaobin

    leoxiaobin/deep-high-resolution-net.pytorch

    4,479Ver en GitHub↗

    Este proyecto es una implementación en PyTorch de una arquitectura de investigación diseñada para el aprendizaje de representaciones de alta resolución. Funciona como un framework de visión artificial centrado en la detección precisa de puntos clave, la estimación de poses humanas y la segmentación semántica de imágenes. La implementación proporciona herramientas especializadas para identificar puntos de referencia anatómicos en el cuerpo humano y predecir coordenadas de puntos clave faciales para analizar la orientación y alineación. Utiliza un sistema de flujos paralelos de múltiples resoluciones y fusión multiescala repetida para mantener representaciones de alta resolución en toda la red. El framework abarca una amplia gama de tareas de visión artificial, incluyendo detección de objetos, clasificación de imágenes y segmentación semántica a nivel de píxel. También incluye flujos de trabajo para entrenar modelos en datasets etiquetados y evaluar cuantitativamente la precisión de las posiciones articulares predichas frente a datos de validación.

    Includes workflows for training neural networks to detect human keypoints using labeled datasets.

    Cuda
    Ver en GitHub↗4,479
  • binroot/tensorflow-bookAvatar de BinRoot

    BinRoot/TensorFlow-Book

    4,431Ver en GitHub↗

    Este proyecto es una colección de ejemplos de aprendizaje automático de TensorFlow que proporciona implementaciones de referencia para varios paradigmas de redes neuronales. Cubre modelos de aprendizaje supervisado, no supervisado, por refuerzo y secuencial. El repositorio incluye implementaciones para redes neuronales convolucionales centradas en la clasificación y clasificación de imágenes, así como redes neuronales recurrentes para pronóstico de series temporales y traducción de secuencia a secuencia. Proporciona además ejemplos de agentes de aprendizaje por refuerzo entrenados mediante optimización de recompensas y técnicas de aprendizaje no supervisado como autoencoders y mapas autoorganizados para la agrupación de datos. Las capacidades adicionales cubren la regresión y clasificación supervisada, la generación de embeddings semánticos y el uso de modelos ocultos de Markov para el modelado de datos secuenciales. El proyecto también incluye utilidades para la gestión de operaciones de tensores y la visualización del rendimiento del modelo mediante paneles. El contenido se entrega como una serie de Jupyter Notebooks.

    Implements convolutional neural networks for feature extraction in image and video processing tasks.

    Jupyter Notebookautoencoderbookclassification
    Ver en GitHub↗4,431
  • snowkylin/tensorflow-handbookAvatar de snowkylin

    snowkylin/tensorflow-handbook

    3,927Ver en GitHub↗

    Este proyecto es un recurso educativo integral y un manual de tutoriales para construir, entrenar y desplegar modelos de machine learning usando TensorFlow 2. Sirve como una guía de aprendizaje estructurada que cubre conceptos fundamentales de deep learning, incluyendo arquitecturas de redes neuronales, diferenciación automática y operaciones con tensores. El manual proporciona orientación técnica sobre cómo optimizar la eficiencia de ejecución mediante la gestión de memoria de GPU, entrenamiento distribuido y cuantización de modelos. También incluye guías detalladas para construir pipelines de datos de alto rendimiento y exportar modelos para servidores de producción, dispositivos móviles y navegadores web. El material abarca una amplia gama de capacidades, incluyendo el desarrollo de modelos con redes convolucionales y recurrentes, la implementación de funciones de pérdida y capas personalizadas, y el uso de modelos preentrenados para transfer learning. También aborda estrategias de despliegue para dispositivos edge y el uso de entornos de ejecución en la nube para aceleración por hardware. El recurso está implementado como una colección de Jupyter Notebooks.

    Implements convolutional neural network architectures for spatial feature extraction and image processing.

    Jupyter Notebook
    Ver en GitHub↗3,927
  • hrnet/higherhrnet-human-pose-estimationAvatar de HRNet

    HRNet/HigherHRNet-Human-Pose-Estimation

    1,456Ver en GitHub↗

    HigherHRNet es un framework de deep learning diseñado para la estimación de poses humanas de abajo hacia arriba (bottom-up). Funciona como un detector de puntos clave de visión artificial que identifica y rastrea las articulaciones del cuerpo humano utilizando pirámides de características de alta resolución y aprendizaje de representación consciente de la escala. El proyecto destaca por su enfoque bottom-up, que identifica partes individuales del cuerpo en toda una imagen antes de agruparlas en esqueletos humanos distintos. Esta metodología se apoya en la fusión de características multirresolución, que mantiene representaciones de alta resolución en toda la red al fusionar repetidamente ramas paralelas de diferentes resoluciones espaciales. Para garantizar una precisión consistente para sujetos de diferentes tamaños, el sistema emplea regresión de mapas de calor consciente de la escala e inferencia multiescala, agregando predicciones a través de múltiples resoluciones de imagen. El framework incluye herramientas integrales para entrenar redes neuronales en grandes conjuntos de datos. Estos pipelines de entrenamiento incorporan normalización por lotes sincronizada para estabilizar la convergencia en múltiples unidades de procesamiento gráfico (GPU) y computación de tensores de precisión mixta para gestionar el consumo de memoria y la velocidad de entrenamiento. La arquitectura también utiliza capas de sobremuestreo deconvolucional para mapear representaciones de baja resolución de vuelta a las dimensiones de entrada originales.

    Provides tools for training neural networks for keypoint detection using large datasets and optimized training techniques.

    Python
    Ver en GitHub↗1,456
  • tensorboy/pytorch_realtime_multi-person_pose_estimationAvatar de tensorboy

    tensorboy/pytorch_Realtime_Multi-Person_Pose_Estimation

    1,372Ver en GitHub↗

    Este proyecto es un framework de deep learning construido para detectar y rastrear puntos clave del cuerpo humano en imágenes y flujos de video. Funciona tanto como un sistema de seguimiento de movimiento en tiempo real como un entorno de machine learning para entrenar y evaluar modelos de estimación de pose. El sistema utiliza una red neuronal convolucional de dos ramas para predecir las ubicaciones de las partes del cuerpo y sus conexiones direccionales simultáneamente. Emplea refinamiento de características multietapa para mejorar la precisión de la localización de puntos clave y utiliza algoritmos de análisis codicioso y emparejamiento bipartito para asociar las partes detectadas en esqueletos individuales. Para mantener el rendimiento durante el análisis de video en vivo, el framework ejecuta inferencia paralela a través de regiones de imagen utilizando procesamiento por lotes basado en tensores. Más allá del seguimiento en tiempo real, la biblioteca proporciona herramientas para entrenar modelos en conjuntos de datos anotados y calcular la precisión media promedio (mAP) frente a benchmarks estandarizados para verificar la calidad de la detección. El repositorio incluye los componentes necesarios para gestionar el ciclo de vida completo de la estimación de pose, desde el entrenamiento inicial del modelo hasta la validación del rendimiento.

    Provides training pipelines to optimize neural network weights for human pose detection on annotated datasets.

    Python
    Ver en GitHub↗1,372
  • muhammadmoinfaisal/yolov8-deepsort-object-trackingAvatar de MuhammadMoinFaisal

    MuhammadMoinFaisal/YOLOv8-DeepSORT-Object-Tracking

    1,166Ver en GitHub↗

    Este proyecto es una tubería (pipeline) de visión artificial que integra detección y seguimiento de objetos para monitorear objetos en movimiento dentro de flujos de video. Funciona como una herramienta de análisis de extremo a extremo que procesa fotogramas de video para identificar, clasificar y mantener la identidad única de los objetos a medida que se mueven a través de una escena. El sistema utiliza una combinación de inferencia de deep learning para la detección y estimación de movimiento para asegurar la continuidad temporal. Al emparejar descriptores de apariencia visual con modelos de movimiento predictivos, mantiene las identidades de los objetos incluso durante oclusiones temporales o cuando la superposición espacial es insuficiente. El framework emplea procesamiento secuencial para sincronizar los resultados de la detección con la lógica de seguimiento, permitiendo el monitoreo consistente de patrones de movimiento. Más allá del seguimiento básico, el software incluye capacidades para cuantificar la actividad dentro de un feed de video. Admite el cálculo de recuentos totales de objetos o vehículos a medida que cruzan líneas designadas o entran en áreas específicas. La implementación está estructurada como un framework de desarrollo para construir aplicaciones de visión personalizadas que interpretan y extraen datos de entornos dinámicos.

    Uses convolutional neural network architectures to perform high-speed object detection and classification within video frames.

    Jupyter Notebookobject-countingobject-detectionobject-tracking
    Ver en GitHub↗1,166
  • nvidia-ai-iot/trt_poseAvatar de NVIDIA-AI-IOT

    NVIDIA-AI-IOT/trt_pose

    1,060Ver en GitHub↗

    Este proyecto es un framework de visión artificial diseñado para la detección en tiempo real de puntos clave del cuerpo humano y estructuras esqueléticas. Proporciona un kit de herramientas integrado para entrenar, optimizar y ejecutar modelos de estimación de pose específicamente para su despliegue en hardware de computación de borde. El framework se distingue por utilizar mapeo de campos de afinidad de partes para codificar relaciones espaciales entre articulaciones, que luego se procesan a través de un algoritmo de análisis codicioso para reconstruir esqueletos humanos a partir de datos visuales. Para asegurar una ejecución de alto rendimiento, la biblioteca incorpora cuantización de modelos y motores de inferencia acelerados por hardware que optimizan los grafos computacionales para hardware local específico. Más allá de la detección central, el proyecto admite flujos de trabajo de extremo a extremo que incluyen el desarrollo de modelos de pose personalizados utilizando esquemas de conjuntos de datos estandarizados. Estas capacidades permiten el ajuste fino de modelos para abordar tareas de detección únicas mientras se mantienen los requisitos de baja latencia necesarios para el análisis de transmisiones de video en vivo.

    Supports end-to-end workflows for training specialized pose estimation models using custom dataset schemas.

    Pythonhuman-posehuman-pose-estimationjetson
    Ver en GitHub↗1,060
  1. Home
  2. Artificial Intelligence & ML
  3. Artificial Intelligence Tooling
  4. Language Model Integrations
  5. Computer Vision Models

Explorar subetiquetas

  • Convolutional Neural NetworksDeep learning architectures utilizing convolutional layers for feature extraction in image and video processing tasks.
  • Pose Estimation Models2 sub-etiquetasModels designed to detect and track specific keypoints on objects or human bodies.