awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

12 repositorios

Awesome GitHub RepositoriesAudio Visualization Tools

Resources for generating visual representations from audio input data.

Explore 12 awesome GitHub repositories matching graphics & multimedia · Audio Visualization Tools. Refine with filters or upvote what's useful.

Awesome Audio Visualization Tools GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • rigellute/spotify-tuiAvatar de Rigellute

    Rigellute/spotify-tui

    19,019Ver en GitHub↗

    This project is a terminal-based music controller that provides a text-based interface for managing audio streaming, library navigation, and playback device selection. It functions as a client for remote music services, allowing users to browse catalogs, control playback states, and manage their streaming accounts directly from the command line. The application distinguishes itself through a highly customizable interface and automation capabilities. Users can modify the visual layout, adjust themes, and define custom keyboard shortcuts to create a personalized control workflow. Beyond interac

    Renders real-time visual animations of audio pitch and track analysis data directly within the terminal.

    Rustclirustspotify
    Ver en GitHub↗19,019
  • pipecat-ai/pipecatAvatar de pipecat-ai

    pipecat-ai/pipecat

    12,846Ver en GitHub↗

    Pipecat is a framework and software development kit for building real-time multimodal AI agents and speech-to-speech systems. It utilizes a frame-based data pipeline to route audio, video, and text through a modular sequence of processors, enabling the orchestration of low-latency conversational AI. The project is distinguished by its ability to coordinate complex multimodal services, including speech-to-text, language models, and text-to-speech, within a single pipeline. It features semantic voice activity detection for natural turn-taking, state-machine conversation flows for dialogue manag

    Renders a dynamic visual bar graph representing real-time audio input levels.

    Pythonaichatbot-frameworkchatbots
    Ver en GitHub↗12,846
  • katspaugh/wavesurfer.jsAvatar de katspaugh

    katspaugh/wavesurfer.js

    10,114Ver en GitHub↗

    wavesurfer.js is a WebAudio playback library and interactive waveform visualizer that renders audio data onto an HTML5 canvas. It enables users to see and navigate sound files through a visual representation of audio peaks, allowing for direct seeking and playback control within a web browser. The project is distinguished by its flexible rendering model, which can use precomputed peak data to display waveforms without downloading or decoding the full audio file. It utilizes a plugin-based extension model to integrate advanced tools such as spectrograms, interactive audio timelines, and real-t

    Renders interactive audio waveforms and spectrograms on a web canvas for audio navigation and analysis.

    TypeScriptaudiojavascriptmusic
    Ver en GitHub↗10,114
  • netease-youdao/emotivoiceAvatar de netease-youdao

    netease-youdao/EmotiVoice

    8,446Ver en GitHub↗

    EmotiVoice is an emotional text-to-speech engine and bilingual speech synthesizer designed to generate synthetic audio in English and Chinese. It utilizes a deep learning architecture to produce high-fidelity speech with controllable emotional states and timbres. The project includes a voice cloning framework for replicating specific speaker identities by training custom acoustic models on personal audio datasets. It employs a jointly-trained acoustic-vocoder pipeline and style-embedding-based synthesis to manage expression and reduce audio artifacts. The system covers a broad range of speec

    Generates mel spectrogram plots to visualize and compare predicted audio quality against target speech signals.

    Pythonaideep-learningemotion
    Ver en GitHub↗8,446
  • worldveil/dejavuAvatar de worldveil

    worldveil/dejavu

    6,764Ver en GitHub↗

    Dejavu is a Python audio fingerprinting library and recognition engine. It functions as a digital audio signature tool used to analyze sound waves and create unique identifiers for the purposes of audio search and retrieval. The project enables automatic music identification by matching live audio feeds or recorded clips against a database of fingerprints. It covers audio content matching and digital audio archiving to identify original source recordings from a stored collection. The system incorporates capabilities for generating audio fingerprints, identifying audio tracks, and recognizing

    Analyzes spectrograms to identify peak energy points, creating unique digital signatures for audio tracks.

    Python
    Ver en GitHub↗6,764
  • tyiannak/pyaudioanalysisAvatar de tyiannak

    tyiannak/pyAudioAnalysis

    6,242Ver en GitHub↗

    pyAudioAnalysis es una librería y framework de Python para el procesamiento y análisis de señales de audio. Proporciona herramientas para extraer representaciones matemáticas del sonido, como espectrogramas, e implementa un sistema para entrenar y evaluar modelos de machine learning para clasificar segmentos de audio basados en patrones acústicos. El proyecto incluye utilidades dedicadas para la segmentación de audio, que permiten la eliminación de silencios y la detección de eventos de audio específicos para dividir grabaciones en secciones significativas. También proporciona capacidades de visualización de datos que utilizan reducción de dimensionalidad para mapear similitudes de contenido e identificar clusters dentro de los datos de sonido. La librería cubre un amplio rango de capacidades de procesamiento de señales, incluyendo extracción de características en el dominio espectral, análisis temporal y regresión de audio para estimar valores continuos. Estas funciones son accesibles tanto como librería programable como a través de una interfaz de línea de comandos para el procesamiento por lotes de archivos de audio.

    Provides data visualization capabilities that use dimensionality reduction to map content similarities and identify clusters within sound data.

    Python
    Ver en GitHub↗6,242
  • syedhali/ezaudioAvatar de syedhali

    syedhali/EZAudio

    4,991Ver en GitHub↗

    EZAudio es una librería de audio para plataformas Apple que proporciona interfaces estandarizadas para la captura de micrófono, reproducción de archivos y salida de hardware. Funciona como un procesador de audio de baja latencia y un framework de visualización diseñado para manipular buffers de audio y enrutar señales con un retraso mínimo. El proyecto cuenta con un renderizador de formas de onda acelerado por hardware para dibujar amplitudes de audio en tiempo real y gráficos dinámicos. También incluye un analizador de Transformada Rápida de Fourier que convierte muestras de audio del dominio del tiempo en datos del dominio de la frecuencia para el análisis espectral. La librería cubre una amplia gama de capacidades, incluyendo la grabación de audio digital en disco y la gestión de la reproducción de archivos de audio con controles de búsqueda y volumen. Admite el procesamiento de audio en tiempo real mediante el encadenamiento de efectos de audio y el enrutamiento de la entrada del micrófono directamente a la salida de hardware.

    Supplies a framework for real-time audio processing and spectral visualization using Core Audio.

    Objective-C
    Ver en GitHub↗4,991
  • makcedward/nlpaugAvatar de makcedward

    makcedward/nlpaug

    4,658Ver en GitHub↗

    nlpaug es una librería de aumento de datos diseñada para generar texto sintético, audio y datos de espectrogramas con el fin de mejorar la robustez de los modelos de machine learning. Funciona como un sintetizador de datos textuales y un aumentador de señales de audio, proporcionando herramientas especializadas para expandir datasets mediante diversos métodos de transformación. El proyecto se distingue por su capacidad para orquestar flujos de trabajo complejos mediante un orquestador de pipelines, que permite encadenar múltiples funciones de aumento de forma secuencial o aleatoria. Soporta síntesis de texto sofisticada mediante back-translation, embeddings de palabras contextuales e integración de modelos de lenguaje pre-entrenados, además de ofrecer aumento de imágenes de espectrogramas mediante enmascaramiento de tiempo y frecuencia. La librería cubre un amplio rango de capacidades, incluyendo modificación de señales de audio con inyección de ruido y pitch shifting, alteraciones de texto basadas en reglas para simular errores tipográficos y ortográficos, y expansión de datasets mediante generación de oraciones y sustitución semántica. También proporciona controles para el volumen de aumento y filtrado de objetivos mediante expresiones regulares para proteger tokens específicos de la modificación.

    Transforms audio spectrograms using time and frequency masking to improve speech recognition robustness.

    Jupyter Notebook
    Ver en GitHub↗4,658
  • serversideup/amplitudejsAvatar de serversideup

    serversideup/amplitudejs

    4,313Ver en GitHub↗

    AmplitudeJS es una biblioteca y framework de JavaScript para construir reproductores de audio HTML5 personalizados. Sirve como un gestor de listas de reproducción del lado del cliente y controlador de medios que cierra la brecha entre los elementos HTML y la Web Audio API, permitiendo a los desarrolladores crear interfaces de medios con marca propia sin depender de los estilos predeterminados del navegador. El proyecto se distingue por su uso de enlace DOM basado en clases CSS y mapeo de estado de atributos de datos, que vincula los elementos HTML directamente a los controles de reproducción y metadatos de pistas. Incluye un sistema de visualización dedicado que utiliza la Web Audio API para renderizar formas de onda SVG en tiempo real y efectos visuales específicos de la canción basados en datos de frecuencia de audio. La biblioteca proporciona capacidades integrales para la gestión de bibliotecas de medios, incluyendo secuenciación de listas de reproducción, lógica de reproducción aleatoria y repetición, y población de metadatos. Maneja controles de reproducción como gestión de volumen, ajuste de velocidad de reproducción y búsqueda de marcas de tiempo, mientras ofrece un sistema de callback basado en eventos para sincronizar los cambios de la interfaz de usuario con hitos de reproducción específicos. El framework admite además el mapeo de entradas externas para atajos de teclado e incluye cambio de eventos consciente del dispositivo para optimizar las interacciones para pantallas táctiles móviles.

    Renders real-time SVG waveforms and frequency-based visual effects using audio signal data.

    JavaScriptcsshtmlhtml5
    Ver en GitHub↗4,313
  • alexkay/spekAvatar de alexkay

    alexkay/spek

    3,185Ver en GitHub↗

    Spek is an acoustic spectrum tool and audio frequency visualizer designed to decode audio streams and analyze their spectral density. It functions as an audio spectrogram analyzer that displays frequency distributions to help identify the sonic characteristics of audio files. The tool specifically includes capabilities as a lossy compression detector, allowing for the identification of encoding artifacts and frequency cut-offs caused by lossy transcoding. The software covers audio file inspection and spectral analysis, providing the ability to select individual audio streams and channels. Us

    Generates frequency-based heat maps to analyze audio content over time as spectrograms.

    C++
    Ver en GitHub↗3,185
  • dominicbreuker/stego-toolkitAvatar de DominicBreuker

    DominicBreuker/stego-toolkit

    2,636Ver en GitHub↗

    This project is a steganography analysis toolkit and digital forensics suite designed to detect, extract, and embed hidden data within image and audio files. It provides a dockerized security environment that bundles various analysis tools into a containerized workspace, including a media spectrogram visualizer for revealing visually hidden patterns. The toolkit features a dedicated brute force system for recovering password-protected messages using automated wordlists and candidate password testing. It distinguishes itself by providing rule-based wordlist generation that uses expansion patte

    Includes a graphical interface to render audio spectrograms for revealing visually hidden patterns.

    Shellctf-toolsdocker-imagesteganography
    Ver en GitHub↗2,636
  • miek/inspectrumAvatar de miek

    miek/inspectrum

    2,466Ver en GitHub↗

    Divides the time-frequency display into cached image tiles recomputed only on zoom or pan changes.

    C++dspsdr
    Ver en GitHub↗2,466
  1. Home
  2. Graphics & Multimedia
  3. Media Processing and Analysis
  4. Media Manipulation
  5. Media Processing
  6. Audio Visualization Tools

Explorar subetiquetas

  • Dimensionality Reduction VisualizationTools that project high-dimensional audio features into lower dimensions to visualize clusters and similarities. **Distinct from Audio Visualization Tools:** Specifically handles dimensionality reduction for audio feature sets rather than general visual representations of audio input
  • Metadata OverlaysVisual representations of audio properties such as frequency spectrums, time labels, and region markers. **Distinct from Audio Visualization Tools:** Adds technical context (markers, labels) over the waveform, whereas the parent is general visualization.
  • Spectrogram Renderers3 sub-etiquetasTools that generate frequency-based heat maps to analyze audio content over time. **Distinct from Audio Visualization Tools:** Specifically focuses on the generation of spectrograms rather than general audio visualization or feature extraction.