14 repositorios
Automated workflows for performing the same operations across multiple video files.
Distinct from Batch Processing: Existing batch candidates are for audio, cloud trials, or data inputs, not video file sets.
Explore 14 awesome GitHub repositories matching graphics & multimedia · Batch Video Processing. Refine with filters or upvote what's useful.
Perfect Green Screen Keys
Processes multiple video files in one run, applying background removal to each clip automatically.
This project is an optical character recognition tool designed to extract hardcoded subtitles from video frames and convert them into synchronized subtitle files. It functions as a text processor that transforms embedded visual text into a written format to improve video accessibility and translation. The system uses graphics processing units to increase the speed and accuracy of text recognition. It includes a subtitle cleaning tool that applies custom mapping configurations to filter out watermarks, channel logos, and duplicate lines from the extracted text. The tool supports batch process
Enables subtitles to be extracted from multiple video files simultaneously when resolution and text regions are identical.
Gyroflow is a gyroscope video stabilization software and IMU telemetry processor designed to remove camera shake from video files. It functions as a hardware-accelerated video renderer and lens calibration tool, utilizing embedded or external gyroscope and accelerometer data to perform pixel-level stabilization. The system is distinguished by its ability to integrate with professional non-linear video editing software via plugins, allowing stabilization to be applied directly to timelines without transcoding original footage. It supports diverse telemetry ingestion from camera brands, flight
Applies uniform smoothness, horizon locking, and zoom configurations across multiple video files.
Backgroundremover is an AI-powered tool that removes backgrounds from both images and videos, accessible through a command-line interface and a Python API. At its core, it uses a pre-trained deep learning model to classify each pixel as foreground or background, producing a binary mask for removal. The tool distinguishes itself through multiple integration methods and output capabilities. It can process images and videos via Unix pipeline data streams, operate as an HTTP API server, or be called programmatically within Python scripts. Users can choose among different AI models to balance proc
Processes images and videos from the terminal with batch operations, Unix pipes, and model selection.
MoneyPrinterPlus is an automated video production system designed for the mass creation of short-form AI content. It functions as an end-to-end pipeline that uses large language models to generate scripts, synthesize voiceovers, and produce visual assets to assemble complete videos. The project is distinguished by its ability to batch-process high volumes of unique content through automated mixing and randomized asset pairing. It includes a social media auto-publisher that uses browser simulation to automate the upload and distribution of generated videos to platforms such as TikTok and Xiaoh
Produces large quantities of non-duplicate short videos through automated mixing and batch editing.
Manages multiple encoding jobs in a queue for efficient batch processing of video files.
Esta es una aplicación de Windows para el reconocimiento automático de voz que transcribe audio hablado de archivos de vídeo a archivos de subtítulos SRT con marca de tiempo. Sirve como un generador de subtítulos y herramienta de traducción que convierte el habla de los medios en texto sincronizado. El software funciona como un transcriptor de medios por lotes, permitiendo el procesamiento simultáneo de múltiples archivos de audio y vídeo para generar subtítulos de forma masiva. Incluye un flujo de trabajo de traducción para convertir transcripciones entre diferentes idiomas para la creación de archivos bilingües o localizados. El sistema también proporciona capacidades de refinamiento de texto, utilizando expresiones regulares y filtros personalizados para limpiar transcripciones eliminando palabras de relleno y patrones no deseados. Esto está soportado por una interfaz gráfica de usuario nativa de Windows.
Automates the creation of subtitles across multiple video files using batch workflows.
node-ytdl-core es una biblioteca de JavaScript para Node.js diseñada para extraer metadatos y transmitir contenido de video y audio desde YouTube. Sirve como un descargador de medios y buscador de flujos, permitiendo a los usuarios recuperar detalles de video y datos de medios de fuentes remotas. La biblioteca proporciona capacidades especializadas para la extracción de video, incluyendo la capacidad de analizar URLs de medios para identificadores únicos y analizar los formatos disponibles. Permite la selección y filtrado de flujos específicos de video y audio basados en criterios de calidad y resolución. El proyecto gestiona el tráfico de red mediante la evitación de límites de tasa y la gestión de cookies de autenticación. Utiliza flujos legibles para el piping de datos y admite solicitudes de rango de bytes para recuperar segmentos específicos de archivos de medios.
Parses URLs and strings to retrieve one or more unique video identifiers for batch retrieval.
Automatic Optical Disc Ripping Server is a headless system that detects inserted CDs, DVDs, and Blu-rays to automatically extract media, transcode video, and eject discs. It functions as a multi-drive media digitizer using a concurrent processing pipeline to rip and transcode media from several optical drives simultaneously without queuing. The system includes an asynchronous video transcoding pipeline that batches conversion tasks to run during scheduled off-peak hours. It also serves as a media server automation tool, fetching metadata from online APIs to name folders and trigger library re
Implements a batch processing system that converts ripped video files into target formats during scheduled off-peak hours.
SmartSub es una aplicación de escritorio multiplataforma para la transcripción de video y generación de subtítulos impulsada por IA. Convierte archivos de audio y video en subtítulos de texto utilizando modelos de IA locales e incorpora aceleración de hardware para aumentar la velocidad de procesamiento. La herramienta cuenta con un traductor de subtítulos que aprovecha modelos de lenguaje grandes, como OpenAI y DeepSeek, para convertir subtítulos entre diferentes idiomas. Incluye un editor visual para corregir y pulir el texto transcrito, junto con una vista previa de video para una sincronización precisa por fotograma. El software admite el procesamiento por lotes de múltiples archivos multimedia y proporciona utilidades para incrustar subtítulos como pistas suaves conmutables o grabarlos permanentemente en los fotogramas de video. También incluye sistemas para gestionar archivos de modelos de transcripción y configurar parámetros de servicios de IA externos.
Automates the transcription and translation process across multiple video files simultaneously.
Squirrel-RIFE is a GPU-accelerated video processing tool that uses a neural network to generate intermediate frames between existing video frames, enabling smooth slow-motion effects and frame rate conversion. It is built around the RIFE (Real-Time Intermediate Flow Estimation) model, which analyzes motion between consecutive frames to predict and insert new frames, and leverages NVIDIA CUDA for parallel processing to achieve high-speed inference. The tool distinguishes itself by combining neural frame interpolation with practical video preprocessing features, including pixel-level duplicate
Processes multiple video frames in parallel batches on NVIDIA GPUs to maximize throughput and reduce per-frame overhead.
Short video factory is a local AI content generator and automated video editing tool. It provides a production pipeline that uses large language models to transform text prompts into marketing scripts and rendered short-form videos. The system is designed for local-first execution, running all processing and asset management on the host machine to maintain data privacy. It distinguishes itself through a batch-processing workflow that can sequentially execute copywriting and rendering for multiple items using predefined presets. The software covers a broad range of media capabilities, includi
Automatically produces a sequence of videos by batching the copywriting and rendering processes.
ComfyUI-SeedVR2_VideoUpscaler is an AI video upscaling tool that uses diffusion models to increase the resolution of videos and images while maintaining visual consistency across frames. The project implements distributed video rendering by splitting datasets into chunks for parallel processing across multiple GPUs. It utilizes model compilation and specialized attention backends to reduce inference latency and increase throughput. Additional capabilities include video color correction using wavelet and LAB matching methods to preserve color fidelity. Hardware memory is managed through block
Offers automated workflows for performing resolution enhancement across multiple video files via CLI.
Este proyecto es un framework de deep learning construido para detectar y rastrear puntos clave del cuerpo humano en imágenes y flujos de video. Funciona tanto como un sistema de seguimiento de movimiento en tiempo real como un entorno de machine learning para entrenar y evaluar modelos de estimación de pose. El sistema utiliza una red neuronal convolucional de dos ramas para predecir las ubicaciones de las partes del cuerpo y sus conexiones direccionales simultáneamente. Emplea refinamiento de características multietapa para mejorar la precisión de la localización de puntos clave y utiliza algoritmos de análisis codicioso y emparejamiento bipartito para asociar las partes detectadas en esqueletos individuales. Para mantener el rendimiento durante el análisis de video en vivo, el framework ejecuta inferencia paralela a través de regiones de imagen utilizando procesamiento por lotes basado en tensores. Más allá del seguimiento en tiempo real, la biblioteca proporciona herramientas para entrenar modelos en conjuntos de datos anotados y calcular la precisión media promedio (mAP) frente a benchmarks estandarizados para verificar la calidad de la detección. El repositorio incluye los componentes necesarios para gestionar el ciclo de vida completo de la estimación de pose, desde el entrenamiento inicial del modelo hasta la validación del rendimiento.
Executes parallel tensor-based batch processing to maintain high frame rates during real-time video analysis.