4 repositorios
Techniques specifically designed to improve the memory and speed efficiency of AI video synthesis models.
Distinct from AI Video Generators: Focuses on the optimization layer (quantization, caching) specifically for video generation, not general AI video generation.
Explore 4 awesome GitHub repositories matching artificial intelligence & ml · Video Generation Optimizations. Refine with filters or upvote what's useful.
LiveTalking is an interactive talking head engine and AI avatar management platform designed to synchronize synthetic speech with facial movements. It functions as a real-time orchestrator that connects large language models and text-to-speech services to neural-rendered digital humans. The project distinguishes itself through low-latency streaming capabilities and the ability to handle real-time conversational interruptions. It supports advanced audio-visual customization, including human voice cloning and the ability to drive avatar expressions using real-time webcam data. The platform cov
Manage resources and cache data to maintain high performance when generating long-form video content.
AniPortrait es un pipeline de síntesis de video por IA diseñado para generar retratos parlantes fotorrealistas y animaciones faciales. Funciona como un generador de cabezas parlantes y animador impulsado por audio que sincroniza los movimientos de los labios, las expresiones y las poses de la cabeza con fuentes de voz o video de referencia. El sistema incluye una herramienta de transferencia de expresiones faciales para recrear movimientos de un video fuente en una imagen de referencia estática. Utiliza un modelo de difusión latente con condicionamiento de imagen basado en referencia para mantener la identidad visual y la consistencia a través de los fotogramas generados. El pipeline cubre el mapeo de audio a expresión, el control de movimiento guiado por pose y la síntesis de video fotorrealista. Incorpora un upsampling de interpolación de fotogramas para acelerar el proceso de generación y reducir el tiempo total de renderizado.
Optimizes rendering speed and efficiency by utilizing frame interpolation during the video synthesis process.
LongCat-Video es una colección de modelos especializados para síntesis de video, que cuenta con una arquitectura basada en modelos de lenguaje grandes para crear videos de alta resolución a partir de texto, imágenes o secuencias existentes. Incluye sistemas dedicados para la generación de texto a video, animación de imagen a video y la creación de avatares parlantes. El proyecto proporciona capacidades específicas para extender la duración de clips existentes a través de un modelo de continuación de video que predice los fotogramas subsiguientes. También permite la sincronización de los movimientos labiales de los personajes con audio y prompts de texto para producir videos hablados. El sistema incorpora varias técnicas de optimización para gestionar la eficiencia de la generación, incluyendo muestreo basado en destilación y cuantización para reducir el uso de memoria y la latencia de inferencia. Los componentes estructurales adicionales cubren la compresión en el espacio latente y el modelado espacio-temporal para mantener la consistencia a través del tiempo y el espacio.
Optimizes AI video synthesis through distillation-based sampling and weight quantization.
Lingbot-world is an interactive world simulator and framework for generating high-fidelity video environments from text and image prompts. It functions as a video generation system designed to create controllable simulations for applications such as robotics learning and gaming. The project includes a video motion controller that directs camera and object movement using transformation matrices and action strings. It utilizes a quantized inference engine to reduce memory usage and accelerate the generation of video sequences. The system covers a range of optimization techniques, including fou
Improves the speed and memory efficiency of video models through four-bit quantization and KV-caching.