2 dépôts
Conditioning mechanisms that combine audio signals and visual landmarks to guide generative models.
Distinct from Audio Multi-Conditioning: Distinct from Audio Multi-Conditioning as it specifically integrates facial visual landmarks for lip sync, not just text/melody.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Audio-Visual Conditioning. Refine with filters or upvote what's useful.
LatentSync est un générateur de vidéo piloté par l'audio et un modèle de synchronisation labiale par diffusion latente conçu pour synchroniser les mouvements des lèvres d'un locuteur dans une vidéo avec une piste audio cible. Il fournit un framework d'entraînement de synchronisation labiale pour développer des réseaux de synchronisation sur des jeux de données vidéo et audio personnalisés. Le système utilise un pipeline de prétraitement vidéo pour nettoyer, segmenter et aligner les données faciales. Il inclut un outil d'évaluation de synchronisation visuelle qui calcule des scores de confiance pour mesurer la précision de l'alignement audio et visuel dans les vidéos générées. Le projet couvre des capacités pour le développement de réseaux de synchronisation personnalisés, la gestion de la configuration d'entraînement pour la mémoire matérielle et la résolution, ainsi que l'évaluation de vidéo synthétique.
Implements conditioning that injects audio features and facial landmarks to guide the synthesis of synchronized lip movements.
EchoMimic est un framework d'animation de portrait piloté par l'audio et un générateur de vidéo par diffusion latente. Il transforme des images de référence statiques en vidéos de têtes parlantes dynamiques en synchronisant les mouvements faciaux avec des pistes audio et des pilotes de mouvement. Le système fonctionne comme un moteur de synthèse de mouvement hybride qui combine des entrées audio et des données de pose. Il utilise un contrôleur de mouvement de points de repère faciaux pour éditer les marqueurs de positionnement, permettant une synchronisation précise et un transfert de pose vidéo-à-vidéo. Le pipeline couvre l'animation image-à-vidéo par diffusion latente et le conditionnement par points de repère faciaux. Cela permet une animation de portrait pilotée par l'audio, la pose, ou une combinaison des deux sources de guidage.
Integrates audio signals and visual landmarks to condition the generation of facial movements.