14 repositorios
Libraries focused on high-fidelity audio synthesis and processing using neural architectures.
Distinct from Deep Learning Libraries: Shortlist targets general DL libraries or simple audio processing; this is a deep learning library for synthesis.
Explore 14 awesome GitHub repositories matching artificial intelligence & ml · Deep Learning Audio Libraries. Refine with filters or upvote what's useful.
Spleeter is an AI audio source separation library and deep learning toolkit designed to split mixed music files into individual audio stems, such as vocals and drums. It provides a suite of pretrained models for isolating different instruments and voices from a recording. The toolkit includes capabilities for training and evaluating custom audio separation models using labeled datasets and configuration files. It also features utilities for measuring model performance by comparing separation outputs against reference datasets. The system manages audio processing through spectral representati
Functions as a deep learning library for splitting music files into individual audio stems.
Audiocraft is a deep learning audio library and machine learning framework designed for training, fine-tuning, and evaluating generative models for music and sound effects. It functions as a text-to-music generative model and a neural audio codec, providing the tools necessary to compress audio signals into discrete representations and synthesize high-fidelity waveforms from textual descriptions. The framework is distinguished by its ability to combine multiple conditioning signals, allowing for the generation of audio based on text prompts, melodic excerpts, or style-based audio clips. It al
Ships a library for processing and generating high-fidelity audio using neural networks and transformer models.
EasyEffects is a real-time audio processor and system-wide effects manager designed for PipeWire audio streams. It functions as a comprehensive suite for applying filters, equalizers, and limiters to both input and output audio across the entire system. The project distinguishes itself through its use of deep learning for neural network noise suppression and voice isolation, as well as its ability to simulate physical acoustic environments using impulse-response convolution. It includes a sophisticated preset management system that allows users to associate specific audio configurations with
Uses deep learning models to isolate voice from ambient noise and preserve speech intelligibility.
This project is an end-to-end text-to-speech engine and deep learning voice synthesizer. It functions as a neural speech synthesis framework that converts written text directly into audio waveforms using a single neural network. The system implements an adversarial framework and a conditional variational autoencoder to generate high-fidelity artificial speech. It utilizes a generative adversarial network to ensure synthesized audio is indistinguishable from real human speech. The toolkit provides capabilities for neural speech synthesis, text-to-audio generation, and the training of custom v
Functions as a deep learning audio library for training high-fidelity speech models from text and audio.
Este proyecto es una implementación en TensorFlow de una red neuronal para la generación de formas de onda de audio crudas. Funciona como un modelo de síntesis de voz condicionado que produce muestras de audio sintéticas utilizando una arquitectura de red neuronal convolucional dilatada. El sistema admite el modelado de voz personalizado mediante la incorporación de condicionamiento global e identificadores categóricos durante el entrenamiento y la generación. Esto permite que el modelo imite hablantes específicos o características de audio distintas para aplicaciones de texto a voz neuronal. El framework cubre la síntesis de audio mediante aprendizaje profundo, incluyendo el procesamiento de datasets de audio, entrenamiento de modelos a partir de archivos de forma de onda y la generación de archivos de audio reproducibles. Utiliza componentes técnicos como convoluciones causales dilatadas, companding mu-law y salidas softmax cuantizadas para manejar dependencias de largo alcance en datos de audio.
Implements a deep learning library for high-fidelity audio synthesis using dilated convolutional architectures.
Muzic es una plataforma y framework de deep learning para el análisis, composición y síntesis de música impulsada por IA. Funciona como un framework de generación de música y herramienta de análisis, utilizando modelos de lenguaje grandes y agentes autónomos para orquestar la creación e interpretación de música simbólica y de audio. El proyecto se distingue por sus capacidades multimodales, mapeando el lenguaje natural y la música simbólica en un espacio de incrustación (embedding) conjunto compartido para clasificación zero-shot y recuperación de información. Emplea una variedad de arquitecturas especializadas, incluyendo frameworks de difusión para síntesis de audio, mecanismos de atención de grano dual para consistencia estructural de secuencias largas y un sistema híbrido que combina reglas de teoría musical con redes neuronales. La plataforma cubre una amplia gama de capacidades, incluyendo la generación de secuencias MIDI a partir de texto y letras, síntesis de voz cantada neuronal y transcripción automatizada de letras. También proporciona herramientas para el modelado de estructuras musicales, generación simbólica basada en atributos y la orquestación de herramientas musicales externas a través de agentes autónomos. Las utilidades de soporte incluyen pipelines de ingeniería de datos para la binarización de MIDI a gran escala, codificación de conjuntos de datos y procesamiento de señales de audio para la extracción de notas de melodía y alineación de voz a fonema.
Synthesizes musical audio and MIDI sequences using neural networks and deep learning models.
Lyra es un framework de compresión de voz y códec de voz de baja tasa de bits diseñado para transmitir audio de alta calidad a través de redes con ancho de banda limitado. Utiliza un códec de audio de tasa de bits adaptativa para equilibrar la calidad del audio y el ancho de banda de la red durante sesiones activas. El proyecto emplea compresión de audio generativa, utilizando redes neuronales para sintetizar señales de voz a partir de datos mínimos y reconstruir detalles de audio faltantes. Esto permite la reconstrucción de voz de alta calidad a partir de flujos de bytes altamente comprimidos. El sistema cubre voz sobre IP optimizada para ancho de banda y comunicación de voz en tiempo real, centrándose en la compresión de voz de baja tasa de bits para mantener la estabilidad de las llamadas. Sus capacidades incluyen el ajuste dinámico de la tasa de bits de audio y el procesamiento de voz para evitar retrasos y caídas de señal en entornos de red inestables.
Recreates high-quality speech signals from compressed byte streams using deep learning models.
This project is a TensorFlow voice conversion framework and deep learning audio toolkit designed for neural voice style transfer. It functions as a speech synthesis engine that transforms the spectral characteristics of a source speaker's voice to match the vocal identity of a target speaker. The system employs a phoneme-based approach to voice conversion, classifying audio utterances into speaker-independent phonemes and resynthesizing them using a target voice. This pipeline allows for the transformation of voice characteristics by mapping audio features between different speakers. The too
Provides a toolkit for training voice models and normalizing tensor data using neural architectures.
Riffusion-hobby is a generative AI tool that creates music by producing spectrogram images via Stable Diffusion and converting them into playable audio. It functions as a spectrogram audio synthesizer, utilizing deep learning to transform image-based frequency representations of sound into audio files. The project operates as an AI music inference server, providing a web-based API endpoint to generate audio from text prompts and seed images. It also includes a command line interface for executing music generation tasks and configuring diffusion models for automated audio creation, as well as
Uses deep learning models to convert image-based spectrograms into playable audio files.
Stable-audio-tools is a toolkit for training and deploying latent diffusion models for high-fidelity audio synthesis. It provides a framework for generating audio by iteratively refining noise within a compressed latent space, using specialized encoders to preserve temporal and spectral features of the audio signal. The project features a system for adapting pre-trained audio checkpoints to new datasets through modular initialization and configuration files. It includes utilities for weight extraction and inference model export, which remove training metadata and optimizer states to create li
Implements a deep learning library for high-fidelity audio synthesis and processing using neural architectures.
Opus is a lossy audio compression standard and codec designed for high-quality speech and music transmission over the internet. It functions as a low-latency audio codec and network-resilient streamer, providing a framework for encoding and decoding digital audio. The project distinguishes itself through the support of multi-channel ambisonics for immersive three-dimensional spatial audio reproduction. It is specifically optimized for real-time interactive communication, utilizing dynamic bitrate adjustment and forward error correction to maintain audio quality on unstable networks. The syst
Embeds recovery data within packet padding using deep learning to maintain audio quality across lossy networks.
Esta librería proporciona un framework de deep learning para entrenar redes neuronales para realizar reconocimiento de voz y clasificación de audio. Utiliza arquitecturas de secuencia a secuencia para mapear entradas de audio de longitud variable en salidas de texto o numéricas, permitiendo el desarrollo de modelos personalizados de transcripción de voz a texto. El proyecto destaca por sus capacidades integradas de procesamiento de audio que transforman formas de onda crudas en espectrogramas y vectores numéricos de alta dimensión. Estas herramientas permiten la extracción de características vocales únicas para identificar hablantes, así como la clasificación de fuentes de audio específicas y dígitos hablados. Para apoyar el desarrollo de modelos, la librería incluye utilidades para aumento de audio y reconstrucción de señales. Al modificar programáticamente muestras de audio para simular diversos entornos acústicos y verificar la integridad de las características aprendidas mediante la reconstrucción del espacio latente, el sistema mejora la robustez de sus redes neuronales subyacentes.
Regenerates original spectrograms from compressed latent representations to verify the quality of learned audio features.
Esta aplicación es una plataforma para la síntesis de voz por IA y la clonación de voz neuronal. Proporciona un kit de herramientas integral para convertir texto en voz humana con sonido natural aplicando modelos de redes neuronales entrenados a medida a muestras de audio específicas. El sistema facilita todo el ciclo de vida del desarrollo de modelos de voz, incluyendo la preparación de audiolibros y transcripciones de video en conjuntos de datos de entrenamiento estructurados. Admite el entrenamiento de estos modelos en hardware local o remoto, utilizando procesamiento distribuido multi-GPU para manejar datos a gran escala y acelerar la convergencia del modelo. Más allá del entrenamiento, la plataforma incluye capacidades para gestionar y portar conjuntos de datos de voz a través de diferentes entornos de almacenamiento. Los usuarios pueden realizar inferencias ajustando variables latentes y parámetros de síntesis para modificar la prosodia, la inflexión emocional y las cualidades estilísticas de la salida de audio generada. La aplicación se basa en técnicas de deep learning para transformar representaciones acústicas en formas de onda de alta fidelidad.
Provides a toolkit for managing and processing large-scale voice datasets to facilitate high-performance speech synthesis.
Este proyecto es un kit de herramientas de deep learning diseñado para la separación de fuentes de audio y la recuperación de información musical. Proporciona un framework para descomponer señales de audio polifónicas en componentes distintos, como voces, batería y bajo, procesando formas de onda brutas a través de arquitecturas de redes neuronales. La biblioteca permite a los usuarios entrenar modelos de separación personalizados o ajustar los existentes para mejorar la precisión en conjuntos de datos de audio específicos. Admite todo el ciclo de vida del modelo, incluyendo la conversión de audio bruto en formatos estructurados e indexados para optimizar la carga de datos y la eficiencia del entrenamiento. El sistema incluye capacidades para la extracción de características en el dominio de la frecuencia y pipelines de datos basados en tensores para facilitar tareas complejas de procesamiento de señales. Está estructurado para apoyar flujos de trabajo orientados a la investigación, permitiendo el refinamiento iterativo de modelos a través de persistencia basada en puntos de control y orquestación automatizada de entrenamiento.
Provides a toolkit for training and fine-tuning neural networks to perform complex signal separation on audio waveforms.