10 repositorios
Pipelines that handle image batches as multi-dimensional arrays for parallel GPU execution.
Distinct from Image Processing Pipelines: Focuses on GPU-accelerated tensor data flow for ML rather than sequential image manipulation steps.
Explore 10 awesome GitHub repositories matching graphics & multimedia · Tensor Processing Pipelines. Refine with filters or upvote what's useful.
This project is a collection of pre-trained machine learning models and conversion pipelines designed for running inference directly in the browser using TensorFlow.js. It provides a library of ready-to-use models for computer vision, audio classification, and natural language processing tasks. The suite includes specialized tools for transforming Python-based Keras models into JSON formats compatible with web environments. It enables the deployment of these models by fetching architectures and weight shards via HTTP for client-side execution. The project covers a broad range of capabilities
Transforms raw pixels or audio samples into multidimensional arrays for parallel GPU execution within the model pipeline.
Final2x is an AI image super-resolution tool and neural network inference engine designed to increase image resolution and reconstruct missing details while reducing noise. It functions as a cross-platform image upscaler that executes consistent super-resolution logic across different operating systems. The project serves as a custom model inference engine and upscaling interface, allowing for the import and application of user-defined super-resolution weights and architectures to tailor the visual output of enlarged images. The system utilizes hardware-accelerated processing to offload comp
Processes image batches as multi-dimensional arrays to enable parallel GPU execution for neural network inference.
Darkflow es un framework de detección de objetos y pipeline de visión artificial que proporciona una interfaz programática para realizar análisis de imágenes y detección de objetos en tiempo real. Funciona como una herramienta para cargar pesos, ajustar modelos y ejecutar inferencia tanto en imágenes estáticas como en feeds de video. El proyecto sirve como un convertidor que traduce configuraciones y pesos de Darknet a grafos de TensorFlow para permitir el reentrenamiento y el despliegue. Incluye un exportador de modelos que guarda los grafos entrenados en archivos protobuf portátiles para su uso en dispositivos móviles y nativos. El sistema cubre capacidades para entrenar y ajustar modelos de detección en datasets personalizados, con puntos de control de progreso para la recuperación del entrenamiento. También proporciona herramientas para la traducción de mapeo de pesos y el procesamiento de datos de imagen crudos a través de operaciones de tensores para producir cajas delimitadoras y puntuaciones de confianza.
Implements a tensor processing pipeline that handles image batches as multi-dimensional arrays for GPU-accelerated inference.
Clarity-upscaler es una herramienta de IA para el escalado y mejora de imágenes que utiliza modelos de aprendizaje profundo para aumentar la resolución y restaurar detalles visuales. Funciona como un motor de inferencia de superresolución que emplea redes neuronales para predecir píxeles faltantes y sintetizar detalles de alta frecuencia a partir de fuentes de baja resolución. El proyecto se entrega como una API programable, permitiendo la integración de procesamiento y enfoque automático de imágenes de alta resolución en aplicaciones y flujos de trabajo externos. Esta interfaz permite el escalado programático de imágenes para crear activos de alta resolución. El sistema proporciona capacidades para la mejora automática de imágenes, eliminando ruido y mejorando la claridad para producir versiones más nítidas de imágenes de baja calidad. Gestiona estas tareas mediante una arquitectura desacoplada de cliente-servidor que maneja la naturaleza intensiva en cómputo de la inferencia de aprendizaje automático.
Processes image batches as multi-dimensional tensors to perform mathematical transformations for sharpening on GPUs.
This project is an AI upscaling framework and deep learning image restorer designed to estimate original source pixels from low-resolution inputs. It functions as a super-resolution reconstruction system that transforms pixelated images into high-resolution versions by restoring high-frequency details and sharpening edges. The system utilizes a convolutional neural network pipeline to analyze pixel data and perform digital image restoration. It employs pixel-shuffle upsampling to rearrange channel dimensions into spatial dimensions, which increases resolution while reducing checkerboard artif
Handles image batches as multi-dimensional arrays to allow parallel processing of pixels across graphics processing units.
RestorePhotos es una herramienta de restauración facial por IA y un escalador de imágenes de deep learning diseñado para eliminar el desenfoque y reconstruir detalles perdidos en fotografías faciales degradadas. Funciona como un potenciador de fotos faciales y un procesador de imágenes de redes generativas antagónicas (GAN) que transforma píxeles de baja calidad en rasgos faciales de alta resolución. El sistema utiliza un motor de inferencia acelerado por GPU para ejecutar modelos de machine learning para la restauración de imágenes en tiempo real. Esta aceleración de hardware admite las pesadas multiplicaciones de matrices y operaciones basadas en tensores necesarias para enfocar imágenes faciales y mejorar la fidelidad visual. El proyecto cubre la restauración de fotos por IA y la restauración de archivos digitales, centrándose específicamente en la mejora de imágenes faciales. Emplea un pipeline de procesamiento secuencial para realizar el escalado de imágenes mediante deep learning, aumentando la resolución y claridad de las imágenes al reconstruir los detalles faltantes.
Processes image data as multi-dimensional arrays for parallel GPU execution during sharpening.
Este proyecto es una suite de preprocesamiento de ComfyUI ControlNet y un kit de herramientas de análisis de visión artificial. Funciona como un preprocesador de imágenes de difusión estable que extrae pistas estructurales de las imágenes para guiar los flujos de trabajo de difusión latente. El sistema proporciona modelos especializados para la estimación de poses humanas, incluyendo puntos clave esqueléticos y mallas faciales, y mapeo de escenas en 3D a través de la estimación de profundidad y normales de superficie. También incluye herramientas para el control de movimiento de video por IA utilizando análisis de flujo óptico. La superficie de capacidad más amplia cubre el análisis estructural de imágenes —como arte lineal, extracción de bordes y segmentación semántica— así como el aislamiento de luminancia y la generación de pistas de color y estilo. Estos procesos están respaldados por runtimes acelerados por hardware y almacenamiento en caché de puntos de control de modelos para reducir la latencia de inferencia.
Manipulates visual data as multi-dimensional tensors to pass information efficiently between preprocessor stages.
Esta es una librería de arquitecturas de modelos generativos construidas utilizando el framework TensorFlow. Proporciona implementaciones para producir datos sintéticos e imágenes realistas, centrándose específicamente en Variational Autoencoders y varias variantes de Generative Adversarial Networks. La colección incluye arquitecturas GAN específicas como WGAN-GP, LSGAN, InfoGAN y EBGAN. También cuenta con Variational Autoencoders diseñados para aprender representaciones latentes y sintetizar nuevas muestras a partir de distribuciones aprendidas. El proyecto cubre pipelines de procesamiento de imágenes para normalizar y recortar datos, así como un kit de herramientas de capas de redes neuronales que incluye convoluciones 2D y transformaciones lineales. Proporciona capacidades para la manipulación del espacio latente, inyección de vectores de condicionamiento y estabilización de modelos a través de funciones de pérdida específicas.
Includes a pipeline for normalizing, cropping, and grid-merging image tensors to prepare data for neural network training.
pytorch-fid is a PyTorch-based evaluator and image distribution analysis library used to calculate the Fréchet Inception Distance. It functions as a benchmarking tool that maps image pixels to high-dimensional feature vectors using a pre-trained convolutional neural network to measure the mathematical divergence between real and synthetic datasets. The library quantifies the quality and diversity of generative models by representing image feature sets as mean and covariance matrices. It allows for the extraction of latent representations from specific neural network layers, with configurable
Implements tensor processing pipelines to handle image batches for parallel GPU execution during statistical analysis.
Este proyecto es un framework de PyTorch orientado a la investigación diseñado para la implementación y entrenamiento de modelos de difusión de video generativos. Proporciona un kit de herramientas modular que extiende las técnicas de difusión basadas en imágenes estándar a tres dimensiones, permitiendo la síntesis de secuencias de video coherentes a través de procesos de eliminación de ruido iterativos. El framework destaca por utilizar atención espacio-temporal factorizada, que descompone los datos de video de alta dimensión en capas espaciales y temporales separadas para mantener la consistencia del movimiento mientras gestiona la complejidad computacional. Admite entrenamiento multimodal procesando imágenes estáticas y secuencias de video simultáneamente, e incorpora guía latente condicionada por texto para dirigir el proceso de generación de acuerdo con descripciones específicas en lenguaje natural. La biblioteca incluye pipelines integrales para gestionar el entrenamiento de extremo a extremo de estos modelos, cubriendo la ingesta de conjuntos de datos, la optimización de parámetros y la exportación periódica de muestras. Está estructurada para apoyar la investigación de deep learning en modelado temporal y la alineación de salidas generativas con prompts semánticos.
Treats video sequences as volumetric data blocks to capture motion across time using multi-dimensional tensor processing.