9 repositorios
Preserves spatial information during feature extraction using interpolation for pixel-level localization.
Distinct from Computer Vision Features: Focuses on alignment for segmentation, distinct from general visual feature extraction.
Explore 9 awesome GitHub repositories matching artificial intelligence & ml · Region Alignment. Refine with filters or upvote what's useful.
This project is an educational platform and research toolkit designed to teach deep learning through a combination of mathematical theory, visual diagrams, and executable code. It provides a comprehensive environment for building, training, and evaluating neural networks, grounding complex concepts in interactive computational notebooks that allow for hands-on experimentation. The framework distinguishes itself by interleaving theoretical foundations—including linear algebra, calculus, and probability—with practical implementations across multiple industry-standard libraries. It supports flex
Shares convolutional computation across images and uses pooling to normalize features from variable-sized regions for faster processing.
Detectron is a PyTorch object detection framework and computer vision research platform. It provides implementations of neural network architectures for locating and identifying objects in images, including Mask R-CNN for generating instance segmentation masks and RetinaNet for one-stage detection. The platform supports computer vision prototyping and object detection research through the deployment of pre-trained baseline models. This allows for the rapid implementation and evaluation of visual recognition systems. Its capabilities cover image object localization and instance segmentation w
Uses bilinear interpolation to preserve spatial information and avoid misalignment in region proposals.
This project is a TensorFlow and Keras implementation of the Mask R-CNN architecture. It provides a framework for performing simultaneous object detection and instance segmentation, transforming raw images into segmented masks and bounding boxes for individual object identification. The toolset enables custom computer vision training through fine-tuning pre-trained weights and integrating user-provided datasets. It includes capabilities for distributed GPU training to accelerate the optimization of large vision models. The framework covers model evaluation using standard precision metrics an
Uses bilinear interpolation to align regions of interest, ensuring precise spatial alignment for pixel-level mask prediction.
AI-on-the-edge-device is an edge AI meter digitizer and computer vision image processor designed to convert images of analog and digital utility meters into numeric values. It functions as an IoT gateway that runs neural network inference locally on hardware to monitor water, power, and gas readings. The system is distinguished by its ability to handle both analog pointers and digital digits through custom-trained neural networks. It includes specialized tools for image alignment, region-of-interest extraction, and hardware-level lighting control to minimize glare on glass surfaces. To mainta
Extracts specific image coordinates and applies geometric corrections for consistent model input.
Este proyecto es un framework de detección de objetos de PyTorch que implementa la arquitectura Faster R-CNN. Sirve como modelo de visión para predecir cuadros delimitadores precisos alrededor de múltiples objetos dentro de imágenes y transmisiones de video en vivo. El sistema está optimizado para el entrenamiento multi-GPU para reducir el tiempo requerido para la convergencia del modelo. Utiliza un diseño acelerado por GPU para manejar el entrenamiento y la inferencia de redes de detección complejas. El framework cubre el ciclo de vida completo de la detección de objetos, incluyendo el entrenamiento de redes personalizadas y la inferencia para imágenes estáticas y transmisiones de video en tiempo real. Incluye capacidades para la validación del rendimiento del modelo utilizando conjuntos de datos estandarizados, así como optimizaciones de entrenamiento como el agrupamiento basado en relación de aspecto y cargas de trabajo distribuidas.
Isolates features from specific regions of interest using pooling and alignment to improve detection accuracy.
mmcv is a foundation library for computer vision based on PyTorch. It provides a comprehensive system for constructing convolutional neural networks, a toolkit for image and video preprocessing, and a collection of high-performance deep learning vision operators. The project is distinguished by its hardware-accelerated kernels for complex operations such as deformable convolutions and region pooling. It features a configuration-driven framework that allows for the dynamic instantiation of network layers and the registration of custom modules without modifying code. The library covers a broad
Extracts fixed-size feature maps from variable-sized regions of interest using pooling operations.
Yolact es un framework de visión artificial y modelo de segmentación de instancias en tiempo real. Utiliza una red neuronal totalmente convolucional para detectar objetos y generar máscaras a nivel de píxel para imágenes y flujos de video. El sistema emplea la generación de máscaras prototípicas para crear prototipos de máscara globales que se combinan linealmente para obtener resultados específicos de instancia. Incorpora capas convolucionales deformables y agrupación de regiones de interés (RoI) deformable para adaptar el muestreo espacial a las formas irregulares de los objetos. El framework cubre el ciclo de vida completo de desarrollo del modelo, incluyendo el entrenamiento en conjuntos de datos personalizados, evaluación de precisión mediante precisión media promedio (mAP) y el uso de entrenamiento distribuido multi-GPU para escalar la velocidad de procesamiento. También proporciona utilidades de procesamiento de medios para aplicar máscaras de segmentación a imágenes y exportar archivos de video anotados. El proyecto incluye herramientas de persistencia de estado para la gestión de puntos de control y reanudación del entrenamiento, junto con registro para grabar métricas y valores de pérdida.
Extracts feature maps by pooling data according to the geometry of detected bounding boxes.
Deformable-ConvNets es un framework de visión artificial y una colección de componentes de redes neuronales diseñados para implementar redes neuronales convolucionales deformables. Proporciona capas convolucionales adaptativas e implementaciones de pooling que modifican sus campos receptivos basándose en las características de entrada para capturar mejor la geometría de los objetos dentro de las imágenes. El proyecto permite el uso de offsets de muestreo aprendibles y máscaras de modulación para alinear las rejillas convolucionales con las formas de los objetos objetivo. Incluye herramientas especializadas para visualizar los offsets aprendidos en las capas de convolución y pooling, permitiendo analizar cómo la red adapta su campo receptivo espacial. Estas capacidades se aplican para mejorar la precisión en la detección de objetos y refinar la segmentación semántica. El framework admite la extracción de características de regiones de interés mediante pooling deformable para alinear las áreas de muestreo con los límites reales de los objetos. La implementación incluye un pipeline de entrenamiento para ejecutar y evaluar estas arquitecturas de red especializadas.
Implements a deformable ROI pooling mechanism that aligns feature extraction grids with the actual geometry of target objects.
Este proyecto es una implementación en PyTorch de la arquitectura Faster R-CNN para la detección de objetos. Proporciona un framework para identificar múltiples clases de objetos y sus cajas delimitadoras (bounding boxes) correspondientes dentro de imágenes utilizando un sistema de aprendizaje profundo. La implementación incluye un pipeline de entrenamiento para optimizar modelos en datasets personalizados y una utilidad para convertir pesos preentrenados de formatos externos a una estructura compatible para la inicialización del modelo. El sistema cubre un pipeline de detección de dos etapas que comprende una red de propuesta de regiones y una capa de pooling ROI. Incorpora funciones de pérdida multitarea y regresión de cajas delimitadoras basada en anclas para refinar las ubicaciones de los objetos. El proyecto incluye herramientas para la visualización en tiempo real de la pérdida de entrenamiento y la precisión de predicción para monitorear el rendimiento del modelo.
Implements an ROI pooling layer to provide consistent feature map sizes for the classification head.