3 dépôts
Architectures that combine diverse inputs like text and melody to guide audio generation.
Distinct from Diffusion Conditioning Architectures: Specializes conditioning architectures for combined text and melodic audio inputs
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Audio Multi-Conditioning. Refine with filters or upvote what's useful.
Audiocraft is a deep learning audio library and machine learning framework designed for training, fine-tuning, and evaluating generative models for music and sound effects. It functions as a text-to-music generative model and a neural audio codec, providing the tools necessary to compress audio signals into discrete representations and synthesize high-fidelity waveforms from textual descriptions. The framework is distinguished by its ability to combine multiple conditioning signals, allowing for the generation of audio based on text prompts, melodic excerpts, or style-based audio clips. It al
Combines textual prompts and melodic excerpts into a shared embedding space to guide the generative process.
LatentSync est un générateur de vidéo piloté par l'audio et un modèle de synchronisation labiale par diffusion latente conçu pour synchroniser les mouvements des lèvres d'un locuteur dans une vidéo avec une piste audio cible. Il fournit un framework d'entraînement de synchronisation labiale pour développer des réseaux de synchronisation sur des jeux de données vidéo et audio personnalisés. Le système utilise un pipeline de prétraitement vidéo pour nettoyer, segmenter et aligner les données faciales. Il inclut un outil d'évaluation de synchronisation visuelle qui calcule des scores de confiance pour mesurer la précision de l'alignement audio et visuel dans les vidéos générées. Le projet couvre des capacités pour le développement de réseaux de synchronisation personnalisés, la gestion de la configuration d'entraînement pour la mémoire matérielle et la résolution, ainsi que l'évaluation de vidéo synthétique.
Implements conditioning that injects audio features and facial landmarks to guide the synthesis of synchronized lip movements.
EchoMimic est un framework d'animation de portrait piloté par l'audio et un générateur de vidéo par diffusion latente. Il transforme des images de référence statiques en vidéos de têtes parlantes dynamiques en synchronisant les mouvements faciaux avec des pistes audio et des pilotes de mouvement. Le système fonctionne comme un moteur de synthèse de mouvement hybride qui combine des entrées audio et des données de pose. Il utilise un contrôleur de mouvement de points de repère faciaux pour éditer les marqueurs de positionnement, permettant une synchronisation précise et un transfert de pose vidéo-à-vidéo. Le pipeline couvre l'animation image-à-vidéo par diffusion latente et le conditionnement par points de repère faciaux. Cela permet une animation de portrait pilotée par l'audio, la pose, ou une combinaison des deux sources de guidage.
Integrates audio signals and visual landmarks to condition the generation of facial movements.