awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 repository-uri

Awesome GitHub RepositoriesAudio-Visual Conditioning

Conditioning mechanisms that combine audio signals and visual landmarks to guide generative models.

Distinct from Audio Multi-Conditioning: Distinct from Audio Multi-Conditioning as it specifically integrates facial visual landmarks for lip sync, not just text/melody.

Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Audio-Visual Conditioning. Refine with filters or upvote what's useful.

Awesome Audio-Visual Conditioning GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • bytedance/latentsyncAvatar bytedance

    bytedance/LatentSync

    5,806Vezi pe GitHub↗

    LatentSync este un generator video audio-driven și un model de lip sync cu difuzie latentă, conceput pentru a sincroniza mișcările buzelor unui vorbitor într-un video cu o pistă audio țintă. Oferă un framework de antrenament pentru sincronizarea buzelor, pentru dezvoltarea rețelelor de sincronizare pe seturi de date video și audio personalizate. Sistemul utilizează un pipeline de preprocesare video pentru a curăța, segmenta și alinia datele faciale. Include un instrument de evaluare a sincronizării vizuale care calculează scoruri de încredere pentru a măsura acuratețea alinierii audio și vizuale în videoclipurile generate. Proiectul acoperă capabilități pentru dezvoltarea rețelelor de sincronizare personalizate, gestionarea configurației de antrenament pentru memoria hardware și rezoluție, precum și evaluarea video sintetică.

    Implements conditioning that injects audio features and facial landmarks to guide the synthesis of synchronized lip movements.

    Python
    Vezi pe GitHub↗5,806
  • badtobest/echomimicAvatar BadToBest

    BadToBest/EchoMimic

    4,258Vezi pe GitHub↗

    EchoMimic este un framework de animație a portretelor bazat pe audio și un generator video de difuzie latentă. Acesta transformă imaginile de referință statice în videoclipuri dinamice cu capete vorbitoare prin sincronizarea mișcărilor faciale cu piesele audio și driverele de mișcare. Sistemul funcționează ca un motor hibrid de sinteză a mișcării care combină input-urile audio și datele de postură. Utilizează un controler de mișcare a punctelor de reper faciale pentru a edita markerii de poziționare, permițând sincronizarea precisă și transferul de postură video-la-video. Conducta acoperă animația imagine-la-video prin difuzie latentă și condiționarea punctelor de reper faciale. Acest lucru permite animația portretelor condusă de audio, postură sau o combinație a ambelor surse de ghidare.

    Integrates audio signals and visual landmarks to condition the generation of facial movements.

    Python
    Vezi pe GitHub↗4,258
  1. Home
  2. Artificial Intelligence & ML
  3. Diffusion Conditioning Architectures
  4. Audio Multi-Conditioning
  5. Audio-Visual Conditioning