12 repositorios
Resources for generating visual representations from audio input data.
Explore 12 awesome GitHub repositories matching graphics & multimedia · Audio Visualization Tools. Refine with filters or upvote what's useful.
This project is a terminal-based music controller that provides a text-based interface for managing audio streaming, library navigation, and playback device selection. It functions as a client for remote music services, allowing users to browse catalogs, control playback states, and manage their streaming accounts directly from the command line. The application distinguishes itself through a highly customizable interface and automation capabilities. Users can modify the visual layout, adjust themes, and define custom keyboard shortcuts to create a personalized control workflow. Beyond interac
Renders real-time visual animations of audio pitch and track analysis data directly within the terminal.
Pipecat is a framework and software development kit for building real-time multimodal AI agents and speech-to-speech systems. It utilizes a frame-based data pipeline to route audio, video, and text through a modular sequence of processors, enabling the orchestration of low-latency conversational AI. The project is distinguished by its ability to coordinate complex multimodal services, including speech-to-text, language models, and text-to-speech, within a single pipeline. It features semantic voice activity detection for natural turn-taking, state-machine conversation flows for dialogue manag
Renders a dynamic visual bar graph representing real-time audio input levels.
wavesurfer.js is a WebAudio playback library and interactive waveform visualizer that renders audio data onto an HTML5 canvas. It enables users to see and navigate sound files through a visual representation of audio peaks, allowing for direct seeking and playback control within a web browser. The project is distinguished by its flexible rendering model, which can use precomputed peak data to display waveforms without downloading or decoding the full audio file. It utilizes a plugin-based extension model to integrate advanced tools such as spectrograms, interactive audio timelines, and real-t
Renders interactive audio waveforms and spectrograms on a web canvas for audio navigation and analysis.
EmotiVoice is an emotional text-to-speech engine and bilingual speech synthesizer designed to generate synthetic audio in English and Chinese. It utilizes a deep learning architecture to produce high-fidelity speech with controllable emotional states and timbres. The project includes a voice cloning framework for replicating specific speaker identities by training custom acoustic models on personal audio datasets. It employs a jointly-trained acoustic-vocoder pipeline and style-embedding-based synthesis to manage expression and reduce audio artifacts. The system covers a broad range of speec
Generates mel spectrogram plots to visualize and compare predicted audio quality against target speech signals.
Dejavu is a Python audio fingerprinting library and recognition engine. It functions as a digital audio signature tool used to analyze sound waves and create unique identifiers for the purposes of audio search and retrieval. The project enables automatic music identification by matching live audio feeds or recorded clips against a database of fingerprints. It covers audio content matching and digital audio archiving to identify original source recordings from a stored collection. The system incorporates capabilities for generating audio fingerprints, identifying audio tracks, and recognizing
Analyzes spectrograms to identify peak energy points, creating unique digital signatures for audio tracks.
pyAudioAnalysis es una librería y framework de Python para el procesamiento y análisis de señales de audio. Proporciona herramientas para extraer representaciones matemáticas del sonido, como espectrogramas, e implementa un sistema para entrenar y evaluar modelos de machine learning para clasificar segmentos de audio basados en patrones acústicos. El proyecto incluye utilidades dedicadas para la segmentación de audio, que permiten la eliminación de silencios y la detección de eventos de audio específicos para dividir grabaciones en secciones significativas. También proporciona capacidades de visualización de datos que utilizan reducción de dimensionalidad para mapear similitudes de contenido e identificar clusters dentro de los datos de sonido. La librería cubre un amplio rango de capacidades de procesamiento de señales, incluyendo extracción de características en el dominio espectral, análisis temporal y regresión de audio para estimar valores continuos. Estas funciones son accesibles tanto como librería programable como a través de una interfaz de línea de comandos para el procesamiento por lotes de archivos de audio.
Provides data visualization capabilities that use dimensionality reduction to map content similarities and identify clusters within sound data.
EZAudio es una librería de audio para plataformas Apple que proporciona interfaces estandarizadas para la captura de micrófono, reproducción de archivos y salida de hardware. Funciona como un procesador de audio de baja latencia y un framework de visualización diseñado para manipular buffers de audio y enrutar señales con un retraso mínimo. El proyecto cuenta con un renderizador de formas de onda acelerado por hardware para dibujar amplitudes de audio en tiempo real y gráficos dinámicos. También incluye un analizador de Transformada Rápida de Fourier que convierte muestras de audio del dominio del tiempo en datos del dominio de la frecuencia para el análisis espectral. La librería cubre una amplia gama de capacidades, incluyendo la grabación de audio digital en disco y la gestión de la reproducción de archivos de audio con controles de búsqueda y volumen. Admite el procesamiento de audio en tiempo real mediante el encadenamiento de efectos de audio y el enrutamiento de la entrada del micrófono directamente a la salida de hardware.
Supplies a framework for real-time audio processing and spectral visualization using Core Audio.
nlpaug es una librería de aumento de datos diseñada para generar texto sintético, audio y datos de espectrogramas con el fin de mejorar la robustez de los modelos de machine learning. Funciona como un sintetizador de datos textuales y un aumentador de señales de audio, proporcionando herramientas especializadas para expandir datasets mediante diversos métodos de transformación. El proyecto se distingue por su capacidad para orquestar flujos de trabajo complejos mediante un orquestador de pipelines, que permite encadenar múltiples funciones de aumento de forma secuencial o aleatoria. Soporta síntesis de texto sofisticada mediante back-translation, embeddings de palabras contextuales e integración de modelos de lenguaje pre-entrenados, además de ofrecer aumento de imágenes de espectrogramas mediante enmascaramiento de tiempo y frecuencia. La librería cubre un amplio rango de capacidades, incluyendo modificación de señales de audio con inyección de ruido y pitch shifting, alteraciones de texto basadas en reglas para simular errores tipográficos y ortográficos, y expansión de datasets mediante generación de oraciones y sustitución semántica. También proporciona controles para el volumen de aumento y filtrado de objetivos mediante expresiones regulares para proteger tokens específicos de la modificación.
Transforms audio spectrograms using time and frequency masking to improve speech recognition robustness.
AmplitudeJS es una biblioteca y framework de JavaScript para construir reproductores de audio HTML5 personalizados. Sirve como un gestor de listas de reproducción del lado del cliente y controlador de medios que cierra la brecha entre los elementos HTML y la Web Audio API, permitiendo a los desarrolladores crear interfaces de medios con marca propia sin depender de los estilos predeterminados del navegador. El proyecto se distingue por su uso de enlace DOM basado en clases CSS y mapeo de estado de atributos de datos, que vincula los elementos HTML directamente a los controles de reproducción y metadatos de pistas. Incluye un sistema de visualización dedicado que utiliza la Web Audio API para renderizar formas de onda SVG en tiempo real y efectos visuales específicos de la canción basados en datos de frecuencia de audio. La biblioteca proporciona capacidades integrales para la gestión de bibliotecas de medios, incluyendo secuenciación de listas de reproducción, lógica de reproducción aleatoria y repetición, y población de metadatos. Maneja controles de reproducción como gestión de volumen, ajuste de velocidad de reproducción y búsqueda de marcas de tiempo, mientras ofrece un sistema de callback basado en eventos para sincronizar los cambios de la interfaz de usuario con hitos de reproducción específicos. El framework admite además el mapeo de entradas externas para atajos de teclado e incluye cambio de eventos consciente del dispositivo para optimizar las interacciones para pantallas táctiles móviles.
Renders real-time SVG waveforms and frequency-based visual effects using audio signal data.
Spek is an acoustic spectrum tool and audio frequency visualizer designed to decode audio streams and analyze their spectral density. It functions as an audio spectrogram analyzer that displays frequency distributions to help identify the sonic characteristics of audio files. The tool specifically includes capabilities as a lossy compression detector, allowing for the identification of encoding artifacts and frequency cut-offs caused by lossy transcoding. The software covers audio file inspection and spectral analysis, providing the ability to select individual audio streams and channels. Us
Generates frequency-based heat maps to analyze audio content over time as spectrograms.
This project is a steganography analysis toolkit and digital forensics suite designed to detect, extract, and embed hidden data within image and audio files. It provides a dockerized security environment that bundles various analysis tools into a containerized workspace, including a media spectrogram visualizer for revealing visually hidden patterns. The toolkit features a dedicated brute force system for recovering password-protected messages using automated wordlists and candidate password testing. It distinguishes itself by providing rule-based wordlist generation that uses expansion patte
Includes a graphical interface to render audio spectrograms for revealing visually hidden patterns.
Divides the time-frequency display into cached image tiles recomputed only on zoom or pan changes.