awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

14 dépôts

Awesome GitHub RepositoriesDeep Learning Audio Libraries

Libraries focused on high-fidelity audio synthesis and processing using neural architectures.

Distinct from Deep Learning Libraries: Shortlist targets general DL libraries or simple audio processing; this is a deep learning library for synthesis.

Explore 14 awesome GitHub repositories matching artificial intelligence & ml · Deep Learning Audio Libraries. Refine with filters or upvote what's useful.

Awesome Deep Learning Audio Libraries GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • deezer/spleeterAvatar de deezer

    deezer/spleeter

    28,252Voir sur GitHub↗

    Spleeter is an AI audio source separation library and deep learning toolkit designed to split mixed music files into individual audio stems, such as vocals and drums. It provides a suite of pretrained models for isolating different instruments and voices from a recording. The toolkit includes capabilities for training and evaluating custom audio separation models using labeled datasets and configuration files. It also features utilities for measuring model performance by comparing separation outputs against reference datasets. The system manages audio processing through spectral representati

    Functions as a deep learning library for splitting music files into individual audio stems.

    Pythonaudio-processingbassdeep-learning
    Voir sur GitHub↗28,252
  • facebookresearch/audiocraftAvatar de facebookresearch

    facebookresearch/audiocraft

    23,379Voir sur GitHub↗

    Audiocraft is a deep learning audio library and machine learning framework designed for training, fine-tuning, and evaluating generative models for music and sound effects. It functions as a text-to-music generative model and a neural audio codec, providing the tools necessary to compress audio signals into discrete representations and synthesize high-fidelity waveforms from textual descriptions. The framework is distinguished by its ability to combine multiple conditioning signals, allowing for the generation of audio based on text prompts, melodic excerpts, or style-based audio clips. It al

    Ships a library for processing and generating high-fidelity audio using neural networks and transformer models.

    Jupyter Notebook
    Voir sur GitHub↗23,379
  • wwmm/easyeffectsAvatar de wwmm

    wwmm/easyeffects

    9,690Voir sur GitHub↗

    EasyEffects is a real-time audio processor and system-wide effects manager designed for PipeWire audio streams. It functions as a comprehensive suite for applying filters, equalizers, and limiters to both input and output audio across the entire system. The project distinguishes itself through its use of deep learning for neural network noise suppression and voice isolation, as well as its ability to simulate physical acoustic environments using impulse-response convolution. It includes a sophisticated preset management system that allows users to associate specific audio configurations with

    Uses deep learning models to isolate voice from ambient noise and preserve speech intelligibility.

    HTMLauto-volumecompressorequalizer
    Voir sur GitHub↗9,690
  • jaywalnut310/vitsAvatar de jaywalnut310

    jaywalnut310/vits

    7,862Voir sur GitHub↗

    This project is an end-to-end text-to-speech engine and deep learning voice synthesizer. It functions as a neural speech synthesis framework that converts written text directly into audio waveforms using a single neural network. The system implements an adversarial framework and a conditional variational autoencoder to generate high-fidelity artificial speech. It utilizes a generative adversarial network to ensure synthesized audio is indistinguishable from real human speech. The toolkit provides capabilities for neural speech synthesis, text-to-audio generation, and the training of custom v

    Functions as a deep learning audio library for training high-fidelity speech models from text and audio.

    Pythondeep-learningpytorchspeech-synthesis
    Voir sur GitHub↗7,862
  • ibab/tensorflow-wavenetAvatar de ibab

    ibab/tensorflow-wavenet

    5,432Voir sur GitHub↗

    Ce projet est une implémentation TensorFlow d'un réseau de neurones pour la génération de formes d'onde audio brutes. Il fonctionne comme un modèle de synthèse vocale conditionnée qui produit des échantillons audio synthétiques en utilisant une architecture de réseau de neurones convolutifs dilatés. Le système prend en charge la modélisation de voix personnalisées en intégrant un conditionnement global et des identifiants catégoriels lors de l'entraînement et de la génération. Cela permet au modèle d'imiter des locuteurs spécifiques ou des caractéristiques audio distinctes pour des applications de synthèse vocale neuronale. Le framework couvre la synthèse audio par deep learning, incluant le traitement de jeux de données audio, l'entraînement de modèles à partir de fichiers de forme d'onde, et la génération de fichiers audio lisibles. Il utilise des composants techniques tels que les convolutions causales dilatées, le companding mu-law et les sorties softmax quantifiées pour gérer les dépendances à long terme dans les données audio.

    Implements a deep learning library for high-fidelity audio synthesis using dilated convolutional architectures.

    Python
    Voir sur GitHub↗5,432
  • microsoft/muzicAvatar de microsoft

    microsoft/muzic

    4,928Voir sur GitHub↗

    Muzic est une plateforme et un framework de deep learning pour l'analyse, la composition et la synthèse musicale assistées par IA. Il fonctionne comme un framework de génération musicale et un outil d'analyse, utilisant des modèles de langage étendus et des agents autonomes pour orchestrer la création et l'interprétation de musique symbolique et audio. Le projet se distingue par ses capacités intermodales, mappant le langage naturel et la musique symbolique dans un espace d'intégration commun pour la classification zero-shot et la recherche d'informations. Il emploie une variété d'architectures spécialisées, notamment des frameworks de diffusion pour la synthèse audio, des mécanismes d'attention à double grain pour la cohérence structurelle des séquences longues, et un système hybride qui combine les règles de théorie musicale avec des réseaux de neurones. La plateforme couvre un large éventail de capacités, y compris la génération de séquences MIDI à partir de texte et de paroles, la synthèse vocale neuronale et la transcription automatisée de paroles. Elle fournit également des outils pour la modélisation de la structure musicale, la génération symbolique basée sur des attributs et l'orchestration d'outils musicaux externes via des agents autonomes. Les utilitaires de support incluent des pipelines d'ingénierie de données pour la binarisation MIDI à grande échelle, l'encodage de jeux de données et le traitement du signal audio pour l'extraction de notes de mélodie et l'alignement parole-phonème.

    Synthesizes musical audio and MIDI sequences using neural networks and deep learning models.

    Pythonai-musicdeep-learningmusic
    Voir sur GitHub↗4,928
  • google/lyraAvatar de google

    google/lyra

    3,964Voir sur GitHub↗

    Lyra est un framework de compression vocale et un codec de parole à faible débit conçu pour transmettre de l'audio de haute qualité sur des réseaux à bande passante limitée. Il utilise un codec audio à débit adaptatif pour équilibrer la qualité audio et la bande passante réseau lors des sessions actives. Le projet emploie la compression audio générative, utilisant des réseaux de neurones pour synthétiser des signaux vocaux à partir de données minimales et reconstruire les détails audio manquants. Cela permet une reconstruction audio vocale de haute qualité à partir de flux d'octets hautement compressés. Le système couvre la voix sur IP optimisée pour la bande passante et la communication vocale en temps réel, en se concentrant sur la compression vocale à faible débit pour maintenir la stabilité des appels. Ses capacités incluent l'ajustement dynamique du débit audio et le traitement audio vocal pour éviter les latences et les pertes de signal dans les environnements réseau instables.

    Recreates high-quality speech signals from compressed byte streams using deep learning models.

    C++
    Voir sur GitHub↗3,964
  • andabi/deep-voice-conversionAvatar de andabi

    andabi/deep-voice-conversion

    3,941Voir sur GitHub↗

    Ce projet est un framework de conversion vocale TensorFlow et une boîte à outils audio de deep learning conçue pour le transfert de style vocal neuronal. Il fonctionne comme un moteur de synthèse vocale qui transforme les caractéristiques spectrales de la voix d'un locuteur source pour correspondre à l'identité vocale d'un locuteur cible. Le système emploie une approche basée sur les phonèmes pour la conversion vocale, classant les énoncés audio en phonèmes indépendants du locuteur et les resynthétisant en utilisant une voix cible. Ce pipeline permet la transformation des caractéristiques vocales en mappant les caractéristiques audio entre différents locuteurs. La boîte à outils inclut des capacités pour l'entraînement de modèles audio sur plusieurs GPU, la normalisation des données de tenseur et la gestion des hyperparamètres du modèle. Elle fournit également des outils pour surveiller les performances, comme la visualisation de la précision de classification via des matrices de confusion.

    Provides a toolkit for training voice models and normalizing tensor data using neural architectures.

    Python
    Voir sur GitHub↗3,941
  • riffusion/riffusion-hobbyAvatar de riffusion

    riffusion/riffusion-hobby

    3,895Voir sur GitHub↗

    Riffusion-hobby est un outil d'IA générative qui crée de la musique en produisant des images de spectrogrammes via Stable Diffusion et en les convertissant en audio jouable. Il fonctionne comme un synthétiseur audio de spectrogramme, utilisant le deep learning pour transformer les représentations fréquentielles du son basées sur l'image en fichiers audio. Le projet fonctionne comme un serveur d'inférence musicale IA, fournissant un endpoint API basé sur le web pour générer de l'audio à partir d'invites textuelles et d'images de départ. Il inclut également une interface de ligne de commande pour exécuter des tâches de génération musicale et configurer des modèles de diffusion pour la création audio automatisée, ainsi qu'un générateur audio en temps réel pour manipuler les représentations sonores. Le système couvre un large éventail de capacités, y compris le déploiement de modèles dans le cloud, l'hébergement d'inférence à distance et le traitement du signal numérique pour la conversion image-audio. Il fournit également un terrain de jeu interactif basé sur le web pour expérimenter les paramètres du modèle et explorer les réglages de génération musicale.

    Uses deep learning models to convert image-based spectrograms into playable audio files.

    Pythonaiaudiodiffusers
    Voir sur GitHub↗3,895
  • stability-ai/stable-audio-toolsAvatar de Stability-AI

    Stability-AI/stable-audio-tools

    3,790Voir sur GitHub↗

    Stable-audio-tools is a toolkit for training and deploying latent diffusion models for high-fidelity audio synthesis. It provides a framework for generating audio by iteratively refining noise within a compressed latent space, using specialized encoders to preserve temporal and spectral features of the audio signal. The project features a system for adapting pre-trained audio checkpoints to new datasets through modular initialization and configuration files. It includes utilities for weight extraction and inference model export, which remove training metadata and optimizer states to create li

    Implements a deep learning library for high-fidelity audio synthesis and processing using neural architectures.

    Python
    Voir sur GitHub↗3,790
  • xiph/opusAvatar de xiph

    xiph/opus

    3,035Voir sur GitHub↗

    Opus is a lossy audio compression standard and codec designed for high-quality speech and music transmission over the internet. It functions as a low-latency audio codec and network-resilient streamer, providing a framework for encoding and decoding digital audio. The project distinguishes itself through the support of multi-channel ambisonics for immersive three-dimensional spatial audio reproduction. It is specifically optimized for real-time interactive communication, utilizing dynamic bitrate adjustment and forward error correction to maintain audio quality on unstable networks. The syst

    Embeds recovery data within packet padding using deep learning to maintain audio quality across lossy networks.

    Caudioccodec
    Voir sur GitHub↗3,035
  • pannous/tensorflow-speech-recognitionAvatar de pannous

    pannous/tensorflow-speech-recognition

    2,172Voir sur GitHub↗

    Cette bibliothèque fournit un framework de deep learning pour entraîner des réseaux de neurones à effectuer la reconnaissance vocale et la classification audio. Elle utilise des architectures séquence-à-séquence pour mapper des entrées audio de longueur variable en sorties textuelles ou numériques, permettant le développement de modèles de transcription parole-vers-texte personnalisés. Le projet se distingue par des capacités de traitement audio intégrées qui transforment les formes d'onde brutes en spectrogrammes et en vecteurs numériques de haute dimension. Ces outils permettent l'extraction de caractéristiques vocales uniques pour identifier les locuteurs, ainsi que la classification de sources audio spécifiques et de chiffres parlés. Pour soutenir le développement de modèles, la bibliothèque inclut des utilitaires pour l'augmentation audio et la reconstruction de signal. En modifiant par programmation des échantillons audio pour simuler divers environnements acoustiques et en vérifiant l'intégrité des caractéristiques apprises par reconstruction dans l'espace latent, le système améliore la robustesse de ses réseaux de neurones sous-jacents.

    Regenerates original spectrograms from compressed latent representations to verify the quality of learned audio features.

    Pythondeep-learningneural-networkspeech-recognition
    Voir sur GitHub↗2,172
  • voice-cloning-app/voice-cloning-appAvatar de voice-cloning-app

    voice-cloning-app/Voice-Cloning-App

    1,438Voir sur GitHub↗

    Cette application est une plateforme pour la synthèse vocale par IA et le clonage de voix neuronal. Elle fournit une boîte à outils complète pour convertir du texte en une parole humaine au son naturel en appliquant des modèles de réseaux de neurones entraînés sur mesure à des échantillons audio spécifiques. Le système facilite l'intégralité du cycle de vie du développement de modèles vocaux, incluant la préparation de livres audio bruts et de transcriptions vidéo en jeux de données d'entraînement structurés. Il prend en charge l'entraînement de ces modèles sur du matériel local ou distant, utilisant le traitement distribué multi-GPU pour gérer des données à grande échelle et accélérer la convergence du modèle. Au-delà de l'entraînement, la plateforme inclut des capacités pour gérer et porter des jeux de données vocaux entre différents environnements de stockage. Les utilisateurs peuvent effectuer l'inférence en ajustant les variables latentes et les paramètres de synthèse pour modifier la prosodie, l'inflexion émotionnelle et les qualités stylistiques de la sortie audio générée. L'application s'appuie sur des techniques de deep learning pour transformer les représentations acoustiques en formes d'onde haute fidélité.

    Provides a toolkit for managing and processing large-scale voice datasets to facilitate high-performance speech synthesis.

    Pythondeep-learningpythonpytorch
    Voir sur GitHub↗1,438
  • bytedance/music_source_separationAvatar de bytedance

    bytedance/music_source_separation

    1,385Voir sur GitHub↗

    Ce projet est une boîte à outils de deep learning conçue pour la séparation de sources audio et la recherche d'informations musicales. Elle fournit un framework pour décomposer les signaux audio polyphoniques en composants distincts, tels que les voix, la batterie et la basse, en traitant les formes d'onde brutes via des architectures de réseaux de neurones. La bibliothèque permet aux utilisateurs d'entraîner des modèles de séparation personnalisés ou d'affiner ceux existants pour améliorer la précision sur des jeux de données audio spécifiques. Elle prend en charge l'intégralité du cycle de vie du modèle, incluant la conversion de l'audio brut en formats structurés et indexés pour optimiser le chargement des données et l'efficacité de l'entraînement. Le système inclut des capacités pour l'extraction de caractéristiques dans le domaine fréquentiel et des pipelines de données basés sur des tenseurs pour faciliter les tâches complexes de traitement du signal. Il est structuré pour soutenir les flux de travail orientés recherche, permettant le raffinement itératif des modèles via la persistance basée sur des points de contrôle et l'orchestration automatisée de l'entraînement.

    Provides a toolkit for training and fine-tuning neural networks to perform complex signal separation on audio waveforms.

    Pythonresearch
    Voir sur GitHub↗1,385
  1. Home
  2. Artificial Intelligence & ML
  3. Deep Learning Audio Libraries

Explorer les sous-tags

  • Audio Synthesis Models1 sous-tagNeural network models specifically designed to generate high-fidelity audio waveforms. **Distinct from Deep Learning Audio Libraries:** Focuses on the model implementation for audio generation rather than a general-purpose library of audio tools.
  • Neural Audio Reconstruction1 sous-tagUsing deep learning to fill gaps or recover audio quality in lossy streams. **Distinct from Deep Learning Audio Libraries:** Distinct from Deep Learning Audio Libraries: specifically applied to the problem of packet loss recovery in network streams.
  • Voice Isolation ModelsNeural network models specifically designed to separate human speech from ambient background noise. **Distinct from Deep Learning Audio Libraries:** Focuses on the application of speech isolation rather than general audio synthesis or library infrastructure.