2 repositorios
Optimized data loading flows for decoding and resizing images for model training.
Distinct from Image Processing Pipelines: Focuses on training data loading/optimization, distinct from general multimedia processing pipelines.
Explore 2 awesome GitHub repositories matching graphics & multimedia · ML Image Input Pipelines. Refine with filters or upvote what's useful.
This project is a structured learning curriculum and technical reference for mastering deep learning with TensorFlow. It provides a comprehensive guide for building, training, and deploying neural networks, combining theoretical fundamentals with practical implementation examples. The repository distinguishes itself by covering the end-to-end machine learning workflow, from low-level tensor mathematics and linear algebra to the creation of complex model architectures. It includes specific guidance on developing data pipelines for diverse data types, such as images, text, and time-series seque
Constructs data loading flows that decode, resize, and optimize image files using parallel processing.
mmocr es un framework de reconocimiento óptico de caracteres basado en PyTorch diseñado para entrenar y desplegar modelos de detección de texto, reconocimiento y extracción de información clave. Sirve como una caja de herramientas integral para la detección y reconocimiento de texto en escenas, proporcionando bibliotecas especializadas para localizar regiones de texto y convertir texto visual en cadenas codificadas por máquina. El proyecto se distingue por un framework de investigación para la extracción de información clave y capacidades avanzadas de detección de texto. Estas incluyen la detección basada en puntos utilizando transformers y el uso de curvas de Bezier parametrizadas para identificar y transcribir texto con formas arbitrarias. El framework cubre una amplia superficie de capacidades de visión artificial, incluyendo la gestión de pipelines de datos para aumentar y estandarizar diversos conjuntos de datos OCR, entrenamiento de modelos con escalado distribuido y evaluación del rendimiento utilizando métricas OCR estándar. También proporciona utilidades para la manipulación de polígonos geométricos y visualización de resultados para auditar predicciones contra anotaciones de verdad fundamental. El sistema está implementado en Python y admite la instalación mediante empaquetado de entorno Docker.
Provides optimized data loading flows that package images and annotations into structures required by detection, recognition, or KIE models.