3 repositorios
Pipelines that convert various data types like text, images, and audio into tensors.
Distinct from Text Processing Pipelines: Expands beyond text-only processing to include image and audio feature extraction pipelines.
Explore 3 awesome GitHub repositories matching data & databases · Multimodal Pre-Processing. Refine with filters or upvote what's useful.
Transformers.js is a JavaScript library and web machine learning framework designed to run pretrained transformer models directly in the browser. It serves as a client-side inference engine and a wrapper for the ONNX Runtime, enabling the execution of multimodal AI tasks on user devices without the need for a backend server. The library distinguishes itself by providing a unified toolkit for processing text, image, and audio data locally. This architecture supports privacy-preserving model inference and reduces latency by performing all computations on the client's hardware. Its capabilities
Implements structured tokenizers and feature extractors to convert raw multimodal input into numerical tensors.
Neuraltalk2 es un sistema de visión de aprendizaje profundo diseñado para el subtitulado automático de imágenes. Construido con PyTorch, utiliza una arquitectura híbrida que combina un codificador de red neuronal convolucional con un decodificador de red neuronal recurrente para generar descripciones textuales a partir de entradas visuales. El proyecto cuenta con una tubería de entrenamiento acelerada por GPU capaz de distribuir cargas de trabajo a través de múltiples unidades de procesamiento gráfico mediante distribución multiproceso. Admite la generación de descripciones tanto para archivos de imagen estáticos como para flujos de video en tiempo real. El framework incluye capacidades para el ajuste fino del codificador, muestreo de texto mediante búsqueda de haz (beam search) con control de temperatura y el uso de métricas de lenguaje estándar de la industria para evaluar la precisión y fluidez de los subtítulos. También proporciona utilidades para el preprocesamiento de conjuntos de datos, persistencia de puntos de control del modelo y exportación de predicciones a archivos JSON estructurados. La implementación se proporciona como un Jupyter Notebook.
Implements a pipeline to convert raw image and text pairs into tensors for optimized model training.
mmaction2 es un kit de herramientas de comprensión de video de PyTorch diseñado para entrenar y evaluar modelos de aprendizaje profundo. Sirve como un framework para el reconocimiento de acciones, localización temporal y detección de acciones espaciotemporales, proporcionando herramientas especializadas tanto para el análisis de video basado en píxeles como para el reconocimiento de acciones basado en esqueletos. El proyecto se distingue por una arquitectura modular que cuenta con descubrimiento de componentes basado en registro y ensamblaje de modelos jerárquico impulsado por configuración. Admite la fusión de características multimodales, integrando marcos RGB, flujo óptico y audio, e incluye capacidades para la recuperación de clips de video mediante texto y predicción de video zero-shot. A grandes rasgos, el framework cubre la ingeniería de conjuntos de datos de video, incluyendo la estandarización de anotaciones y el muestreo de fotogramas, así como el entrenamiento y evaluación integral de modelos. Proporciona utilidades para el entrenamiento distribuido, destilación de conocimientos y optimización de inferencia mediante reparametrización de modelos. La base de código admite la exportación de modelos ONNX y la contenerización del entorno para el despliegue a través de diferentes nodos de cómputo.
Extracts and processes 3D and 2D skeletal pose information from video for pose-based recognition.