2 repository-uri
Conditioning mechanisms that combine audio signals and visual landmarks to guide generative models.
Distinct from Audio Multi-Conditioning: Distinct from Audio Multi-Conditioning as it specifically integrates facial visual landmarks for lip sync, not just text/melody.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Audio-Visual Conditioning. Refine with filters or upvote what's useful.
LatentSync este un generator video audio-driven și un model de lip sync cu difuzie latentă, conceput pentru a sincroniza mișcările buzelor unui vorbitor într-un video cu o pistă audio țintă. Oferă un framework de antrenament pentru sincronizarea buzelor, pentru dezvoltarea rețelelor de sincronizare pe seturi de date video și audio personalizate. Sistemul utilizează un pipeline de preprocesare video pentru a curăța, segmenta și alinia datele faciale. Include un instrument de evaluare a sincronizării vizuale care calculează scoruri de încredere pentru a măsura acuratețea alinierii audio și vizuale în videoclipurile generate. Proiectul acoperă capabilități pentru dezvoltarea rețelelor de sincronizare personalizate, gestionarea configurației de antrenament pentru memoria hardware și rezoluție, precum și evaluarea video sintetică.
Implements conditioning that injects audio features and facial landmarks to guide the synthesis of synchronized lip movements.
EchoMimic este un framework de animație a portretelor bazat pe audio și un generator video de difuzie latentă. Acesta transformă imaginile de referință statice în videoclipuri dinamice cu capete vorbitoare prin sincronizarea mișcărilor faciale cu piesele audio și driverele de mișcare. Sistemul funcționează ca un motor hibrid de sinteză a mișcării care combină input-urile audio și datele de postură. Utilizează un controler de mișcare a punctelor de reper faciale pentru a edita markerii de poziționare, permițând sincronizarea precisă și transferul de postură video-la-video. Conducta acoperă animația imagine-la-video prin difuzie latentă și condiționarea punctelor de reper faciale. Acest lucru permite animația portretelor condusă de audio, postură sau o combinație a ambelor surse de ghidare.
Integrates audio signals and visual landmarks to condition the generation of facial movements.