awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

14 repositorios

Awesome GitHub RepositoriesDeep Learning Audio Libraries

Libraries focused on high-fidelity audio synthesis and processing using neural architectures.

Distinct from Deep Learning Libraries: Shortlist targets general DL libraries or simple audio processing; this is a deep learning library for synthesis.

Explore 14 awesome GitHub repositories matching artificial intelligence & ml · Deep Learning Audio Libraries. Refine with filters or upvote what's useful.

Awesome Deep Learning Audio Libraries GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • deezer/spleeterAvatar de deezer

    deezer/spleeter

    28,252Ver en GitHub↗

    Spleeter is an AI audio source separation library and deep learning toolkit designed to split mixed music files into individual audio stems, such as vocals and drums. It provides a suite of pretrained models for isolating different instruments and voices from a recording. The toolkit includes capabilities for training and evaluating custom audio separation models using labeled datasets and configuration files. It also features utilities for measuring model performance by comparing separation outputs against reference datasets. The system manages audio processing through spectral representati

    Functions as a deep learning library for splitting music files into individual audio stems.

    Pythonaudio-processingbassdeep-learning
    Ver en GitHub↗28,252
  • facebookresearch/audiocraftAvatar de facebookresearch

    facebookresearch/audiocraft

    23,379Ver en GitHub↗

    Audiocraft is a deep learning audio library and machine learning framework designed for training, fine-tuning, and evaluating generative models for music and sound effects. It functions as a text-to-music generative model and a neural audio codec, providing the tools necessary to compress audio signals into discrete representations and synthesize high-fidelity waveforms from textual descriptions. The framework is distinguished by its ability to combine multiple conditioning signals, allowing for the generation of audio based on text prompts, melodic excerpts, or style-based audio clips. It al

    Ships a library for processing and generating high-fidelity audio using neural networks and transformer models.

    Jupyter Notebook
    Ver en GitHub↗23,379
  • wwmm/easyeffectsAvatar de wwmm

    wwmm/easyeffects

    9,690Ver en GitHub↗

    EasyEffects is a real-time audio processor and system-wide effects manager designed for PipeWire audio streams. It functions as a comprehensive suite for applying filters, equalizers, and limiters to both input and output audio across the entire system. The project distinguishes itself through its use of deep learning for neural network noise suppression and voice isolation, as well as its ability to simulate physical acoustic environments using impulse-response convolution. It includes a sophisticated preset management system that allows users to associate specific audio configurations with

    Uses deep learning models to isolate voice from ambient noise and preserve speech intelligibility.

    HTMLauto-volumecompressorequalizer
    Ver en GitHub↗9,690
  • jaywalnut310/vitsAvatar de jaywalnut310

    jaywalnut310/vits

    7,862Ver en GitHub↗

    This project is an end-to-end text-to-speech engine and deep learning voice synthesizer. It functions as a neural speech synthesis framework that converts written text directly into audio waveforms using a single neural network. The system implements an adversarial framework and a conditional variational autoencoder to generate high-fidelity artificial speech. It utilizes a generative adversarial network to ensure synthesized audio is indistinguishable from real human speech. The toolkit provides capabilities for neural speech synthesis, text-to-audio generation, and the training of custom v

    Functions as a deep learning audio library for training high-fidelity speech models from text and audio.

    Pythondeep-learningpytorchspeech-synthesis
    Ver en GitHub↗7,862
  • ibab/tensorflow-wavenetAvatar de ibab

    ibab/tensorflow-wavenet

    5,432Ver en GitHub↗

    Este proyecto es una implementación en TensorFlow de una red neuronal para la generación de formas de onda de audio crudas. Funciona como un modelo de síntesis de voz condicionado que produce muestras de audio sintéticas utilizando una arquitectura de red neuronal convolucional dilatada. El sistema admite el modelado de voz personalizado mediante la incorporación de condicionamiento global e identificadores categóricos durante el entrenamiento y la generación. Esto permite que el modelo imite hablantes específicos o características de audio distintas para aplicaciones de texto a voz neuronal. El framework cubre la síntesis de audio mediante aprendizaje profundo, incluyendo el procesamiento de datasets de audio, entrenamiento de modelos a partir de archivos de forma de onda y la generación de archivos de audio reproducibles. Utiliza componentes técnicos como convoluciones causales dilatadas, companding mu-law y salidas softmax cuantizadas para manejar dependencias de largo alcance en datos de audio.

    Implements a deep learning library for high-fidelity audio synthesis using dilated convolutional architectures.

    Python
    Ver en GitHub↗5,432
  • microsoft/muzicAvatar de microsoft

    microsoft/muzic

    4,928Ver en GitHub↗

    Muzic es una plataforma y framework de deep learning para el análisis, composición y síntesis de música impulsada por IA. Funciona como un framework de generación de música y herramienta de análisis, utilizando modelos de lenguaje grandes y agentes autónomos para orquestar la creación e interpretación de música simbólica y de audio. El proyecto se distingue por sus capacidades multimodales, mapeando el lenguaje natural y la música simbólica en un espacio de incrustación (embedding) conjunto compartido para clasificación zero-shot y recuperación de información. Emplea una variedad de arquitecturas especializadas, incluyendo frameworks de difusión para síntesis de audio, mecanismos de atención de grano dual para consistencia estructural de secuencias largas y un sistema híbrido que combina reglas de teoría musical con redes neuronales. La plataforma cubre una amplia gama de capacidades, incluyendo la generación de secuencias MIDI a partir de texto y letras, síntesis de voz cantada neuronal y transcripción automatizada de letras. También proporciona herramientas para el modelado de estructuras musicales, generación simbólica basada en atributos y la orquestación de herramientas musicales externas a través de agentes autónomos. Las utilidades de soporte incluyen pipelines de ingeniería de datos para la binarización de MIDI a gran escala, codificación de conjuntos de datos y procesamiento de señales de audio para la extracción de notas de melodía y alineación de voz a fonema.

    Synthesizes musical audio and MIDI sequences using neural networks and deep learning models.

    Pythonai-musicdeep-learningmusic
    Ver en GitHub↗4,928
  • google/lyraAvatar de google

    google/lyra

    3,964Ver en GitHub↗

    Lyra es un framework de compresión de voz y códec de voz de baja tasa de bits diseñado para transmitir audio de alta calidad a través de redes con ancho de banda limitado. Utiliza un códec de audio de tasa de bits adaptativa para equilibrar la calidad del audio y el ancho de banda de la red durante sesiones activas. El proyecto emplea compresión de audio generativa, utilizando redes neuronales para sintetizar señales de voz a partir de datos mínimos y reconstruir detalles de audio faltantes. Esto permite la reconstrucción de voz de alta calidad a partir de flujos de bytes altamente comprimidos. El sistema cubre voz sobre IP optimizada para ancho de banda y comunicación de voz en tiempo real, centrándose en la compresión de voz de baja tasa de bits para mantener la estabilidad de las llamadas. Sus capacidades incluyen el ajuste dinámico de la tasa de bits de audio y el procesamiento de voz para evitar retrasos y caídas de señal en entornos de red inestables.

    Recreates high-quality speech signals from compressed byte streams using deep learning models.

    C++
    Ver en GitHub↗3,964
  • andabi/deep-voice-conversionAvatar de andabi

    andabi/deep-voice-conversion

    3,941Ver en GitHub↗

    This project is a TensorFlow voice conversion framework and deep learning audio toolkit designed for neural voice style transfer. It functions as a speech synthesis engine that transforms the spectral characteristics of a source speaker's voice to match the vocal identity of a target speaker. The system employs a phoneme-based approach to voice conversion, classifying audio utterances into speaker-independent phonemes and resynthesizing them using a target voice. This pipeline allows for the transformation of voice characteristics by mapping audio features between different speakers. The too

    Provides a toolkit for training voice models and normalizing tensor data using neural architectures.

    Python
    Ver en GitHub↗3,941
  • riffusion/riffusion-hobbyAvatar de riffusion

    riffusion/riffusion-hobby

    3,895Ver en GitHub↗

    Riffusion-hobby is a generative AI tool that creates music by producing spectrogram images via Stable Diffusion and converting them into playable audio. It functions as a spectrogram audio synthesizer, utilizing deep learning to transform image-based frequency representations of sound into audio files. The project operates as an AI music inference server, providing a web-based API endpoint to generate audio from text prompts and seed images. It also includes a command line interface for executing music generation tasks and configuring diffusion models for automated audio creation, as well as

    Uses deep learning models to convert image-based spectrograms into playable audio files.

    Pythonaiaudiodiffusers
    Ver en GitHub↗3,895
  • stability-ai/stable-audio-toolsAvatar de Stability-AI

    Stability-AI/stable-audio-tools

    3,790Ver en GitHub↗

    Stable-audio-tools is a toolkit for training and deploying latent diffusion models for high-fidelity audio synthesis. It provides a framework for generating audio by iteratively refining noise within a compressed latent space, using specialized encoders to preserve temporal and spectral features of the audio signal. The project features a system for adapting pre-trained audio checkpoints to new datasets through modular initialization and configuration files. It includes utilities for weight extraction and inference model export, which remove training metadata and optimizer states to create li

    Implements a deep learning library for high-fidelity audio synthesis and processing using neural architectures.

    Python
    Ver en GitHub↗3,790
  • xiph/opusAvatar de xiph

    xiph/opus

    3,035Ver en GitHub↗

    Opus is a lossy audio compression standard and codec designed for high-quality speech and music transmission over the internet. It functions as a low-latency audio codec and network-resilient streamer, providing a framework for encoding and decoding digital audio. The project distinguishes itself through the support of multi-channel ambisonics for immersive three-dimensional spatial audio reproduction. It is specifically optimized for real-time interactive communication, utilizing dynamic bitrate adjustment and forward error correction to maintain audio quality on unstable networks. The syst

    Embeds recovery data within packet padding using deep learning to maintain audio quality across lossy networks.

    Caudioccodec
    Ver en GitHub↗3,035
  • pannous/tensorflow-speech-recognitionAvatar de pannous

    pannous/tensorflow-speech-recognition

    2,172Ver en GitHub↗

    Esta librería proporciona un framework de deep learning para entrenar redes neuronales para realizar reconocimiento de voz y clasificación de audio. Utiliza arquitecturas de secuencia a secuencia para mapear entradas de audio de longitud variable en salidas de texto o numéricas, permitiendo el desarrollo de modelos personalizados de transcripción de voz a texto. El proyecto destaca por sus capacidades integradas de procesamiento de audio que transforman formas de onda crudas en espectrogramas y vectores numéricos de alta dimensión. Estas herramientas permiten la extracción de características vocales únicas para identificar hablantes, así como la clasificación de fuentes de audio específicas y dígitos hablados. Para apoyar el desarrollo de modelos, la librería incluye utilidades para aumento de audio y reconstrucción de señales. Al modificar programáticamente muestras de audio para simular diversos entornos acústicos y verificar la integridad de las características aprendidas mediante la reconstrucción del espacio latente, el sistema mejora la robustez de sus redes neuronales subyacentes.

    Regenerates original spectrograms from compressed latent representations to verify the quality of learned audio features.

    Pythondeep-learningneural-networkspeech-recognition
    Ver en GitHub↗2,172
  • voice-cloning-app/voice-cloning-appAvatar de voice-cloning-app

    voice-cloning-app/Voice-Cloning-App

    1,438Ver en GitHub↗

    Esta aplicación es una plataforma para la síntesis de voz por IA y la clonación de voz neuronal. Proporciona un kit de herramientas integral para convertir texto en voz humana con sonido natural aplicando modelos de redes neuronales entrenados a medida a muestras de audio específicas. El sistema facilita todo el ciclo de vida del desarrollo de modelos de voz, incluyendo la preparación de audiolibros y transcripciones de video en conjuntos de datos de entrenamiento estructurados. Admite el entrenamiento de estos modelos en hardware local o remoto, utilizando procesamiento distribuido multi-GPU para manejar datos a gran escala y acelerar la convergencia del modelo. Más allá del entrenamiento, la plataforma incluye capacidades para gestionar y portar conjuntos de datos de voz a través de diferentes entornos de almacenamiento. Los usuarios pueden realizar inferencias ajustando variables latentes y parámetros de síntesis para modificar la prosodia, la inflexión emocional y las cualidades estilísticas de la salida de audio generada. La aplicación se basa en técnicas de deep learning para transformar representaciones acústicas en formas de onda de alta fidelidad.

    Provides a toolkit for managing and processing large-scale voice datasets to facilitate high-performance speech synthesis.

    Pythondeep-learningpythonpytorch
    Ver en GitHub↗1,438
  • bytedance/music_source_separationAvatar de bytedance

    bytedance/music_source_separation

    1,385Ver en GitHub↗

    Este proyecto es un kit de herramientas de deep learning diseñado para la separación de fuentes de audio y la recuperación de información musical. Proporciona un framework para descomponer señales de audio polifónicas en componentes distintos, como voces, batería y bajo, procesando formas de onda brutas a través de arquitecturas de redes neuronales. La biblioteca permite a los usuarios entrenar modelos de separación personalizados o ajustar los existentes para mejorar la precisión en conjuntos de datos de audio específicos. Admite todo el ciclo de vida del modelo, incluyendo la conversión de audio bruto en formatos estructurados e indexados para optimizar la carga de datos y la eficiencia del entrenamiento. El sistema incluye capacidades para la extracción de características en el dominio de la frecuencia y pipelines de datos basados en tensores para facilitar tareas complejas de procesamiento de señales. Está estructurado para apoyar flujos de trabajo orientados a la investigación, permitiendo el refinamiento iterativo de modelos a través de persistencia basada en puntos de control y orquestación automatizada de entrenamiento.

    Provides a toolkit for training and fine-tuning neural networks to perform complex signal separation on audio waveforms.

    Pythonresearch
    Ver en GitHub↗1,385
  1. Home
  2. Artificial Intelligence & ML
  3. Deep Learning Audio Libraries

Explorar subetiquetas

  • Audio Synthesis Models1 sub-etiquetaNeural network models specifically designed to generate high-fidelity audio waveforms. **Distinct from Deep Learning Audio Libraries:** Focuses on the model implementation for audio generation rather than a general-purpose library of audio tools.
  • Neural Audio Reconstruction1 sub-etiquetaUsing deep learning to fill gaps or recover audio quality in lossy streams. **Distinct from Deep Learning Audio Libraries:** Distinct from Deep Learning Audio Libraries: specifically applied to the problem of packet loss recovery in network streams.
  • Voice Isolation ModelsNeural network models specifically designed to separate human speech from ambient background noise. **Distinct from Deep Learning Audio Libraries:** Focuses on the application of speech isolation rather than general audio synthesis or library infrastructure.