5 repository-uri
Software implementations that translate compressed audio bitstreams back into raw waveforms.
Distinct from Audio Format Decoders: Candidates focus on resampling or specific sample extraction, not the core decoding process of a codec.
Explore 5 awesome GitHub repositories matching graphics & multimedia · Audio Codec Decoders. Refine with filters or upvote what's useful.
This project is a Python speech recognition library that serves as a unified interface for converting spoken audio into text. It functions as a bridge between Python applications and a variety of speech-to-text engines, providing a consistent way to interact with both local and cloud-based recognition services. The library distinguishes itself as a multi-engine transcription tool, wrapping diverse online APIs and offline recognition backends into a standardized format. This allows for interchangeable recognition engines and supports multilingual audio transcription through various language pa
Translates various audio file containers like WAV and FLAC into raw waveforms for transcription processing.
LAVFilters is an open-source media filter pack consisting of splitters and decoders designed for the DirectShow framework. It functions as a set of software components that convert compressed media data into raw formats for hardware or software rendering. The collection includes a media splitter to separate combined audio and video container formats into individual streams, as well as a specialized Blu-ray disc player filter used to identify and extract movie titles and playlists from disc structures. The project provides capabilities for audio and video stream decoding, media stream demuxin
Translates compressed audio bitstreams back into raw waveforms compatible with system hardware.
Opus is a lossy audio compression standard and codec designed for high-quality speech and music transmission over the internet. It functions as a low-latency audio codec and network-resilient streamer, providing a framework for encoding and decoding digital audio. The project distinguishes itself through the support of multi-channel ambisonics for immersive three-dimensional spatial audio reproduction. It is specifically optimized for real-time interactive communication, utilizing dynamic bitrate adjustment and forward error correction to maintain audio quality on unstable networks. The syst
Translates compressed bitstreams back into raw audio for playback or further processing.
MPD is a headless music server daemon that indexes audio libraries and streams music to local or remote outputs. It functions as a music library manager and network audio streamer, providing a remote audio control protocol that allows external clients to manage playback, playlists, and database queries. The system acts as a multiroom audio coordinator, synchronizing audio distribution across multiple networked clients and hardware devices. It supports a variety of remote management capabilities, including a dedicated control API and the ability to broadcast audio streams over network protocol
Parses various compressed and lossless audio formats into raw waveforms for playback.
Acest proiect este un toolkit cuprinzător pentru recunoașterea vocală on-device, sinteză și procesare audio, conceput special pentru Apple Silicon. Oferă un framework pentru construirea de agenți vocali full-duplex în timp real care operează complet offline, valorificând accelerarea hardware nativă pentru a menține performanța și confidențialitatea. Prin utilizarea modelelor de machine learning optimizate, biblioteca permite execuția locală a sarcinilor audio complexe fără dependență de servicii cloud externe. Biblioteca se distinge prin accentul său specializat pe interacțiunea vocală locală, de înaltă performanță. Include orchestrare sofisticată pentru pipeline-uri audio de streaming, permițând transcrierea în timp real, sinteza vocală și clonarea vocii cu latență scăzută. Sistemul este conceput pentru a gestiona conversații interactive, continue, având mecanisme încorporate pentru a preveni buclele de feedback audio și a gestiona sesiunile de streaming persistente. Dincolo de interacțiunea de bază, proiectul oferă o suită largă de capabilități de îmbunătățire și gestionare audio. Suportă procesarea avansată a semnalului, inclusiv separarea surselor, reducerea zgomotului și upsampling audio, alături de instrumente pentru diarizarea vorbitorilor și extracția de embedding-uri. Framework-ul oferă, de asemenea, utilitare extinse de gestionare a modelelor, cum ar fi controale de cuantizare, gestionarea memoriei și suport pentru încărcarea ponderilor de modele personalizate, asigurându-se că dezvoltatorii pot echilibra viteza de procesare și consumul de resurse pe hardware local. Proiectul include o interfață CLI pentru executarea sarcinilor audio și conversia ponderilor modelelor în formate optimizate. De asemenea, expune endpoint-uri HTTP și WebSocket pentru a facilita integrarea cu interfețele standard din industrie.
Translates compressed audio bitstreams back into raw waveforms.