14 dépôts
Libraries focused on high-fidelity audio synthesis and processing using neural architectures.
Distinct from Deep Learning Libraries: Shortlist targets general DL libraries or simple audio processing; this is a deep learning library for synthesis.
Explore 14 awesome GitHub repositories matching artificial intelligence & ml · Deep Learning Audio Libraries. Refine with filters or upvote what's useful.
Spleeter is an AI audio source separation library and deep learning toolkit designed to split mixed music files into individual audio stems, such as vocals and drums. It provides a suite of pretrained models for isolating different instruments and voices from a recording. The toolkit includes capabilities for training and evaluating custom audio separation models using labeled datasets and configuration files. It also features utilities for measuring model performance by comparing separation outputs against reference datasets. The system manages audio processing through spectral representati
Functions as a deep learning library for splitting music files into individual audio stems.
Audiocraft is a deep learning audio library and machine learning framework designed for training, fine-tuning, and evaluating generative models for music and sound effects. It functions as a text-to-music generative model and a neural audio codec, providing the tools necessary to compress audio signals into discrete representations and synthesize high-fidelity waveforms from textual descriptions. The framework is distinguished by its ability to combine multiple conditioning signals, allowing for the generation of audio based on text prompts, melodic excerpts, or style-based audio clips. It al
Ships a library for processing and generating high-fidelity audio using neural networks and transformer models.
EasyEffects is a real-time audio processor and system-wide effects manager designed for PipeWire audio streams. It functions as a comprehensive suite for applying filters, equalizers, and limiters to both input and output audio across the entire system. The project distinguishes itself through its use of deep learning for neural network noise suppression and voice isolation, as well as its ability to simulate physical acoustic environments using impulse-response convolution. It includes a sophisticated preset management system that allows users to associate specific audio configurations with
Uses deep learning models to isolate voice from ambient noise and preserve speech intelligibility.
This project is an end-to-end text-to-speech engine and deep learning voice synthesizer. It functions as a neural speech synthesis framework that converts written text directly into audio waveforms using a single neural network. The system implements an adversarial framework and a conditional variational autoencoder to generate high-fidelity artificial speech. It utilizes a generative adversarial network to ensure synthesized audio is indistinguishable from real human speech. The toolkit provides capabilities for neural speech synthesis, text-to-audio generation, and the training of custom v
Functions as a deep learning audio library for training high-fidelity speech models from text and audio.
Ce projet est une implémentation TensorFlow d'un réseau de neurones pour la génération de formes d'onde audio brutes. Il fonctionne comme un modèle de synthèse vocale conditionnée qui produit des échantillons audio synthétiques en utilisant une architecture de réseau de neurones convolutifs dilatés. Le système prend en charge la modélisation de voix personnalisées en intégrant un conditionnement global et des identifiants catégoriels lors de l'entraînement et de la génération. Cela permet au modèle d'imiter des locuteurs spécifiques ou des caractéristiques audio distinctes pour des applications de synthèse vocale neuronale. Le framework couvre la synthèse audio par deep learning, incluant le traitement de jeux de données audio, l'entraînement de modèles à partir de fichiers de forme d'onde, et la génération de fichiers audio lisibles. Il utilise des composants techniques tels que les convolutions causales dilatées, le companding mu-law et les sorties softmax quantifiées pour gérer les dépendances à long terme dans les données audio.
Implements a deep learning library for high-fidelity audio synthesis using dilated convolutional architectures.
Muzic est une plateforme et un framework de deep learning pour l'analyse, la composition et la synthèse musicale assistées par IA. Il fonctionne comme un framework de génération musicale et un outil d'analyse, utilisant des modèles de langage étendus et des agents autonomes pour orchestrer la création et l'interprétation de musique symbolique et audio. Le projet se distingue par ses capacités intermodales, mappant le langage naturel et la musique symbolique dans un espace d'intégration commun pour la classification zero-shot et la recherche d'informations. Il emploie une variété d'architectures spécialisées, notamment des frameworks de diffusion pour la synthèse audio, des mécanismes d'attention à double grain pour la cohérence structurelle des séquences longues, et un système hybride qui combine les règles de théorie musicale avec des réseaux de neurones. La plateforme couvre un large éventail de capacités, y compris la génération de séquences MIDI à partir de texte et de paroles, la synthèse vocale neuronale et la transcription automatisée de paroles. Elle fournit également des outils pour la modélisation de la structure musicale, la génération symbolique basée sur des attributs et l'orchestration d'outils musicaux externes via des agents autonomes. Les utilitaires de support incluent des pipelines d'ingénierie de données pour la binarisation MIDI à grande échelle, l'encodage de jeux de données et le traitement du signal audio pour l'extraction de notes de mélodie et l'alignement parole-phonème.
Synthesizes musical audio and MIDI sequences using neural networks and deep learning models.
Lyra est un framework de compression vocale et un codec de parole à faible débit conçu pour transmettre de l'audio de haute qualité sur des réseaux à bande passante limitée. Il utilise un codec audio à débit adaptatif pour équilibrer la qualité audio et la bande passante réseau lors des sessions actives. Le projet emploie la compression audio générative, utilisant des réseaux de neurones pour synthétiser des signaux vocaux à partir de données minimales et reconstruire les détails audio manquants. Cela permet une reconstruction audio vocale de haute qualité à partir de flux d'octets hautement compressés. Le système couvre la voix sur IP optimisée pour la bande passante et la communication vocale en temps réel, en se concentrant sur la compression vocale à faible débit pour maintenir la stabilité des appels. Ses capacités incluent l'ajustement dynamique du débit audio et le traitement audio vocal pour éviter les latences et les pertes de signal dans les environnements réseau instables.
Recreates high-quality speech signals from compressed byte streams using deep learning models.
Ce projet est un framework de conversion vocale TensorFlow et une boîte à outils audio de deep learning conçue pour le transfert de style vocal neuronal. Il fonctionne comme un moteur de synthèse vocale qui transforme les caractéristiques spectrales de la voix d'un locuteur source pour correspondre à l'identité vocale d'un locuteur cible. Le système emploie une approche basée sur les phonèmes pour la conversion vocale, classant les énoncés audio en phonèmes indépendants du locuteur et les resynthétisant en utilisant une voix cible. Ce pipeline permet la transformation des caractéristiques vocales en mappant les caractéristiques audio entre différents locuteurs. La boîte à outils inclut des capacités pour l'entraînement de modèles audio sur plusieurs GPU, la normalisation des données de tenseur et la gestion des hyperparamètres du modèle. Elle fournit également des outils pour surveiller les performances, comme la visualisation de la précision de classification via des matrices de confusion.
Provides a toolkit for training voice models and normalizing tensor data using neural architectures.
Riffusion-hobby est un outil d'IA générative qui crée de la musique en produisant des images de spectrogrammes via Stable Diffusion et en les convertissant en audio jouable. Il fonctionne comme un synthétiseur audio de spectrogramme, utilisant le deep learning pour transformer les représentations fréquentielles du son basées sur l'image en fichiers audio. Le projet fonctionne comme un serveur d'inférence musicale IA, fournissant un endpoint API basé sur le web pour générer de l'audio à partir d'invites textuelles et d'images de départ. Il inclut également une interface de ligne de commande pour exécuter des tâches de génération musicale et configurer des modèles de diffusion pour la création audio automatisée, ainsi qu'un générateur audio en temps réel pour manipuler les représentations sonores. Le système couvre un large éventail de capacités, y compris le déploiement de modèles dans le cloud, l'hébergement d'inférence à distance et le traitement du signal numérique pour la conversion image-audio. Il fournit également un terrain de jeu interactif basé sur le web pour expérimenter les paramètres du modèle et explorer les réglages de génération musicale.
Uses deep learning models to convert image-based spectrograms into playable audio files.
Stable-audio-tools is a toolkit for training and deploying latent diffusion models for high-fidelity audio synthesis. It provides a framework for generating audio by iteratively refining noise within a compressed latent space, using specialized encoders to preserve temporal and spectral features of the audio signal. The project features a system for adapting pre-trained audio checkpoints to new datasets through modular initialization and configuration files. It includes utilities for weight extraction and inference model export, which remove training metadata and optimizer states to create li
Implements a deep learning library for high-fidelity audio synthesis and processing using neural architectures.
Opus is a lossy audio compression standard and codec designed for high-quality speech and music transmission over the internet. It functions as a low-latency audio codec and network-resilient streamer, providing a framework for encoding and decoding digital audio. The project distinguishes itself through the support of multi-channel ambisonics for immersive three-dimensional spatial audio reproduction. It is specifically optimized for real-time interactive communication, utilizing dynamic bitrate adjustment and forward error correction to maintain audio quality on unstable networks. The syst
Embeds recovery data within packet padding using deep learning to maintain audio quality across lossy networks.
Cette bibliothèque fournit un framework de deep learning pour entraîner des réseaux de neurones à effectuer la reconnaissance vocale et la classification audio. Elle utilise des architectures séquence-à-séquence pour mapper des entrées audio de longueur variable en sorties textuelles ou numériques, permettant le développement de modèles de transcription parole-vers-texte personnalisés. Le projet se distingue par des capacités de traitement audio intégrées qui transforment les formes d'onde brutes en spectrogrammes et en vecteurs numériques de haute dimension. Ces outils permettent l'extraction de caractéristiques vocales uniques pour identifier les locuteurs, ainsi que la classification de sources audio spécifiques et de chiffres parlés. Pour soutenir le développement de modèles, la bibliothèque inclut des utilitaires pour l'augmentation audio et la reconstruction de signal. En modifiant par programmation des échantillons audio pour simuler divers environnements acoustiques et en vérifiant l'intégrité des caractéristiques apprises par reconstruction dans l'espace latent, le système améliore la robustesse de ses réseaux de neurones sous-jacents.
Regenerates original spectrograms from compressed latent representations to verify the quality of learned audio features.
Cette application est une plateforme pour la synthèse vocale par IA et le clonage de voix neuronal. Elle fournit une boîte à outils complète pour convertir du texte en une parole humaine au son naturel en appliquant des modèles de réseaux de neurones entraînés sur mesure à des échantillons audio spécifiques. Le système facilite l'intégralité du cycle de vie du développement de modèles vocaux, incluant la préparation de livres audio bruts et de transcriptions vidéo en jeux de données d'entraînement structurés. Il prend en charge l'entraînement de ces modèles sur du matériel local ou distant, utilisant le traitement distribué multi-GPU pour gérer des données à grande échelle et accélérer la convergence du modèle. Au-delà de l'entraînement, la plateforme inclut des capacités pour gérer et porter des jeux de données vocaux entre différents environnements de stockage. Les utilisateurs peuvent effectuer l'inférence en ajustant les variables latentes et les paramètres de synthèse pour modifier la prosodie, l'inflexion émotionnelle et les qualités stylistiques de la sortie audio générée. L'application s'appuie sur des techniques de deep learning pour transformer les représentations acoustiques en formes d'onde haute fidélité.
Provides a toolkit for managing and processing large-scale voice datasets to facilitate high-performance speech synthesis.
Ce projet est une boîte à outils de deep learning conçue pour la séparation de sources audio et la recherche d'informations musicales. Elle fournit un framework pour décomposer les signaux audio polyphoniques en composants distincts, tels que les voix, la batterie et la basse, en traitant les formes d'onde brutes via des architectures de réseaux de neurones. La bibliothèque permet aux utilisateurs d'entraîner des modèles de séparation personnalisés ou d'affiner ceux existants pour améliorer la précision sur des jeux de données audio spécifiques. Elle prend en charge l'intégralité du cycle de vie du modèle, incluant la conversion de l'audio brut en formats structurés et indexés pour optimiser le chargement des données et l'efficacité de l'entraînement. Le système inclut des capacités pour l'extraction de caractéristiques dans le domaine fréquentiel et des pipelines de données basés sur des tenseurs pour faciliter les tâches complexes de traitement du signal. Il est structuré pour soutenir les flux de travail orientés recherche, permettant le raffinement itératif des modèles via la persistance basée sur des points de contrôle et l'orchestration automatisée de l'entraînement.
Provides a toolkit for training and fine-tuning neural networks to perform complex signal separation on audio waveforms.