awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 dépôts

Awesome GitHub RepositoriesAudio Multi-Conditioning

Architectures that combine diverse inputs like text and melody to guide audio generation.

Distinct from Diffusion Conditioning Architectures: Specializes conditioning architectures for combined text and melodic audio inputs

Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Audio Multi-Conditioning. Refine with filters or upvote what's useful.

Awesome Audio Multi-Conditioning GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • facebookresearch/audiocraftAvatar de facebookresearch

    facebookresearch/audiocraft

    23,379Voir sur GitHub↗

    Audiocraft is a deep learning audio library and machine learning framework designed for training, fine-tuning, and evaluating generative models for music and sound effects. It functions as a text-to-music generative model and a neural audio codec, providing the tools necessary to compress audio signals into discrete representations and synthesize high-fidelity waveforms from textual descriptions. The framework is distinguished by its ability to combine multiple conditioning signals, allowing for the generation of audio based on text prompts, melodic excerpts, or style-based audio clips. It al

    Combines textual prompts and melodic excerpts into a shared embedding space to guide the generative process.

    Jupyter Notebook
    Voir sur GitHub↗23,379
  • bytedance/latentsyncAvatar de bytedance

    bytedance/LatentSync

    5,806Voir sur GitHub↗

    LatentSync est un générateur de vidéo piloté par l'audio et un modèle de synchronisation labiale par diffusion latente conçu pour synchroniser les mouvements des lèvres d'un locuteur dans une vidéo avec une piste audio cible. Il fournit un framework d'entraînement de synchronisation labiale pour développer des réseaux de synchronisation sur des jeux de données vidéo et audio personnalisés. Le système utilise un pipeline de prétraitement vidéo pour nettoyer, segmenter et aligner les données faciales. Il inclut un outil d'évaluation de synchronisation visuelle qui calcule des scores de confiance pour mesurer la précision de l'alignement audio et visuel dans les vidéos générées. Le projet couvre des capacités pour le développement de réseaux de synchronisation personnalisés, la gestion de la configuration d'entraînement pour la mémoire matérielle et la résolution, ainsi que l'évaluation de vidéo synthétique.

    Implements conditioning that injects audio features and facial landmarks to guide the synthesis of synchronized lip movements.

    Python
    Voir sur GitHub↗5,806
  • badtobest/echomimicAvatar de BadToBest

    BadToBest/EchoMimic

    4,258Voir sur GitHub↗

    EchoMimic est un framework d'animation de portrait piloté par l'audio et un générateur de vidéo par diffusion latente. Il transforme des images de référence statiques en vidéos de têtes parlantes dynamiques en synchronisant les mouvements faciaux avec des pistes audio et des pilotes de mouvement. Le système fonctionne comme un moteur de synthèse de mouvement hybride qui combine des entrées audio et des données de pose. Il utilise un contrôleur de mouvement de points de repère faciaux pour éditer les marqueurs de positionnement, permettant une synchronisation précise et un transfert de pose vidéo-à-vidéo. Le pipeline couvre l'animation image-à-vidéo par diffusion latente et le conditionnement par points de repère faciaux. Cela permet une animation de portrait pilotée par l'audio, la pose, ou une combinaison des deux sources de guidage.

    Integrates audio signals and visual landmarks to condition the generation of facial movements.

    Python
    Voir sur GitHub↗4,258
  1. Home
  2. Artificial Intelligence & ML
  3. Diffusion Conditioning Architectures
  4. Audio Multi-Conditioning

Explorer les sous-tags

  • Audio-Visual ConditioningConditioning mechanisms that combine audio signals and visual landmarks to guide generative models. **Distinct from Audio Multi-Conditioning:** Distinct from Audio Multi-Conditioning as it specifically integrates facial visual landmarks for lip sync, not just text/melody.