awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

12 repository-uri

Awesome GitHub RepositoriesOn-Device Speech Recognizers

Speech recognition systems that perform transcription entirely on-device without network connectivity.

Distinct from Automatic Speech Recognition: Distinct from Automatic Speech Recognition: focuses on local-only inference for privacy and offline operation, not cloud-based or hybrid ASR.

Explore 12 awesome GitHub repositories matching artificial intelligence & ml · On-Device Speech Recognizers. Refine with filters or upvote what's useful.

Awesome On-Device Speech Recognizers GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • uberi/speech_recognitionAvatar Uberi

    Uberi/speech_recognition

    8,973Vezi pe GitHub↗

    This project is a Python speech recognition library that serves as a unified interface for converting spoken audio into text. It functions as a bridge between Python applications and a variety of speech-to-text engines, providing a consistent way to interact with both local and cloud-based recognition services. The library distinguishes itself as a multi-engine transcription tool, wrapping diverse online APIs and offline recognition backends into a standardized format. This allows for interchangeable recognition engines and supports multilingual audio transcription through various language pa

    Provides a unified interface to local recognition engines for offline speech-to-text transcription.

    Pythonaudiopythonspeech-recognition
    Vezi pe GitHub↗8,973
  • argmaxinc/whisperkitAvatar argmaxinc

    argmaxinc/WhisperKit

    5,639Vezi pe GitHub↗

    Ships an on-device speech recognition SDK using Core ML models for private, offline transcription.

    Swiftinferenceiosmacos
    Vezi pe GitHub↗5,639
  • cactus-compute/cactusAvatar cactus-compute

    cactus-compute/cactus

    5,363Vezi pe GitHub↗

    Cactus este un motor de inferență AI on-device conceput pentru executarea modelelor de limbaj mari (LLM), a modelelor de viziune și a sistemelor de tip speech-to-text pe hardware mobil și wearable. Oferă un graf de calcul tensorial programabil pentru definirea secvențelor de operații matriceale și funcții de activare, alături de un framework local de tip retrieval augmented generation (RAG) care fundamentează răspunsurile modelului folosind fișiere text locale. Proiectul include un SDK multiplatformă cu binding-uri de limbaj pentru integrarea capacităților AI în aplicații mobile și un sistem de conversie a modelelor care transformă formatele externe pentru execuție locală optimizată. Utilizează un sistem de rutare hibrid pentru a redirecționa sarcinile de lucru între execuția on-device și furnizorii cloud, în funcție de capacitatea hardware-ului. Motorul acoperă o suprafață largă de capabilități, inclusiv procesarea audio on-device pentru detectarea activității vocale și transcriere, generarea de vectori embedding pentru căutarea prin similaritate și integrarea de instrumente pentru parsarea output-urilor modelului în apeluri de funcții externe. Aceste procese sunt susținute de nuclee native optimizate, reglate pentru performanță cu latență scăzută pe hardware mobil.

    Performs local speech-to-text transcription and voice activity detection on handheld and wearable devices.

    C++aiandroidarm
    Vezi pe GitHub↗5,363
  • picovoice/porcupineAvatar Picovoice

    Picovoice/porcupine

    4,694Vezi pe GitHub↗

    Porcupine is an on-device wake word detection engine that listens for a specific spoken phrase in real-time audio and triggers actions, all processed locally without any cloud connectivity. It includes a custom wake word model creator that generates production-ready models from just a few spoken examples in seconds, requiring no training data. Beyond wake word detection, Porcupine also provides on-device speech recognition for real-time transcription with custom vocabulary, an on-device audio content searcher that indexes and finds spoken phrases in audio files or streams, and a lightweight vo

    Transcribes spoken words into text in real time on the device using domain-specific vocabulary with no cloud data sent.

    Pythonhandsfreehotwordhotword-detection
    Vezi pe GitHub↗4,694
  • opennmt/ctranslate2Avatar OpenNMT

    OpenNMT/CTranslate2

    4,319Vezi pe GitHub↗

    CTranslate2 is a C++ inference engine and runtime for Transformer models, designed to execute models on both CPU and GPU with optimizations for speed and memory efficiency. It functions as a model format converter, quantization tool, and REST API server, enabling deployment of neural machine translation, automatic speech recognition, and text generation models. The engine distinguishes itself through a suite of runtime optimizations including layer fusion, weight-matrix quantization, batch-by-length grouping, and a caching allocator that reuses GPU memory. It supports tensor-parallel model di

    CTranslate2 transcribes audio to text using Transformer-based speech recognition models with accelerated inference.

    C++avxavx2cpp
    Vezi pe GitHub↗4,319
  • cmusphinx/pocketsphinxAvatar cmusphinx

    cmusphinx/pocketsphinx

    4,276Vezi pe GitHub↗

    PocketSphinx is an offline speech recognition engine that converts raw audio from files or live microphone streams into written text without requiring a network connection. It functions as a speech-to-text library, a real-time transcription engine, and a voice command processor, capable of detecting and transcribing spoken commands from continuous audio streams with configurable acoustic and language models. The engine uses weighted finite-state transducers to represent acoustic, phonetic, and language models as a single search graph for efficient decoding. It employs fixed-point acoustic mod

    Reads single-channel 16-bit PCM audio from files or standard input and outputs recognized text as line-delimited JSON.

    Ccpythonspeech-recognition
    Vezi pe GitHub↗4,276
  • gali8/tesseract-ocr-iosAvatar gali8

    gali8/Tesseract-OCR-iOS

    4,222Vezi pe GitHub↗

    Tesseract-OCR-iOS este o integrare nativă a motorului Tesseract pentru aplicații iOS. Oferă recunoaștere de imagini pe dispozitiv pentru a identifica și extrage textul tipărit din imagini, convertindu-l în șiruri de caractere editabile. Proiectul permite execuția locală pe dispozitiv, ceea ce înseamnă că procesarea imaginilor și extragerea textului au loc în întregime pe hardware, fără utilizarea serviciilor cloud externe sau a cererilor de rețea. Utilizează un wrapper C++ și un bridge Objective-C pentru a interfața API-urile iOS de nivel înalt cu motorul Tesseract subiacent și biblioteca de procesare a imaginilor Leptonica. Biblioteca suportă fluxuri de lucru de digitizare a documentelor și dezvoltarea de instrumente de accesibilitate care citesc textul de la cameră sau din fotografii. Gestionează încărcarea fișierelor de date antrenate specifice limbii direct din bundle-ul aplicației.

    Processes images locally on iOS devices to extract text without relying on external cloud services.

    C
    Vezi pe GitHub↗4,222
  • rmtheis/tess-twoAvatar rmtheis

    rmtheis/tess-two

    3,765Vezi pe GitHub↗

    Tess-two is an optical character recognition tool and Android application designed to extract written text from images using the Tesseract engine. It functions as an image analysis utility for detecting visual artifacts, blur, and optical flow within local image files on Android devices. The project includes an image pre-processing suite used to clean and manipulate images to increase the accuracy of text recognition. This involves a pipeline that applies grayscale conversion and binarization before the recognition process. The software integrates native image processing and character analys

    Performs visual character and artifact recognition entirely on local Android hardware.

    C
    Vezi pe GitHub↗3,765
  • microsoft/foundry-localAvatar microsoft

    microsoft/Foundry-Local

    2,380Vezi pe GitHub↗

    Foundry-Local este un instrument de dezvoltare machine learning conceput pentru a facilita inferența privată, pe dispozitiv, și gestionarea modelelor. Oferă un mediu de server local care găzduiește modele de machine learning direct pe hardware-ul utilizatorului, asigurându-se că toată procesarea datelor, inclusiv gestionarea prompt-urilor și transcrierea audio, rămâne în mediul local fără a necesita conectivitate externă la cloud. Proiectul se distinge prin automatizarea întregului ciclu de viață al modelului, inclusiv descoperirea, descărcarea și versionarea activelor pentru a menține compatibilitatea cu hardware-ul gazdă. Dispune de un strat de abstractizare hardware care detectează și selectează automat cel mai eficient procesor disponibil pentru sarcini intensive de calcul, permițând execuția accelerată hardware fără configurare manuală. Dincolo de inferența de bază, instrumentul include o interfață CLI pentru explorarea interactivă a modelelor și verificarea performanței. De asemenea, oferă proxy-ing API standardizat, care mapează cererile primite către endpoint-urile modelelor locale folosind protocoale standard din industrie pentru a susține integrarea cu framework-uri software externe.

    Transcribes spoken language into text using local neural models to provide fast speech recognition without cloud services.

    C++ai-sdkchat-completionsfoundry-local
    Vezi pe GitHub↗2,380
  • k2-fsa/sherpa-ncnnAvatar k2-fsa

    k2-fsa/sherpa-ncnn

    1,743Vezi pe GitHub↗

    Sherpa-ncnn is an edge-based speech recognition and synthesis engine designed to run neural network models locally on mobile, embedded, and desktop hardware. It provides a cross-platform framework for offline speech-to-text transcription and text-to-speech synthesis, ensuring that all audio processing occurs on-device without requiring an internet connection or external cloud services. The project distinguishes itself through its use of the ncnn inference engine, which is optimized for low-latency execution on resource-constrained devices. It incorporates on-device model quantization to reduc

    Performs private, offline speech-to-text transcription using on-device neural network inference.

    C++asrccpp
    Vezi pe GitHub↗1,743
  • soniqo/speech-swiftAvatar soniqo

    soniqo/speech-swift

    896Vezi pe GitHub↗

    Acest proiect este un toolkit cuprinzător pentru recunoașterea vocală on-device, sinteză și procesare audio, conceput special pentru Apple Silicon. Oferă un framework pentru construirea de agenți vocali full-duplex în timp real care operează complet offline, valorificând accelerarea hardware nativă pentru a menține performanța și confidențialitatea. Prin utilizarea modelelor de machine learning optimizate, biblioteca permite execuția locală a sarcinilor audio complexe fără dependență de servicii cloud externe. Biblioteca se distinge prin accentul său specializat pe interacțiunea vocală locală, de înaltă performanță. Include orchestrare sofisticată pentru pipeline-uri audio de streaming, permițând transcrierea în timp real, sinteza vocală și clonarea vocii cu latență scăzută. Sistemul este conceput pentru a gestiona conversații interactive, continue, având mecanisme încorporate pentru a preveni buclele de feedback audio și a gestiona sesiunile de streaming persistente. Dincolo de interacțiunea de bază, proiectul oferă o suită largă de capabilități de îmbunătățire și gestionare audio. Suportă procesarea avansată a semnalului, inclusiv separarea surselor, reducerea zgomotului și upsampling audio, alături de instrumente pentru diarizarea vorbitorilor și extracția de embedding-uri. Framework-ul oferă, de asemenea, utilitare extinse de gestionare a modelelor, cum ar fi controale de cuantizare, gestionarea memoriei și suport pentru încărcarea ponderilor de modele personalizate, asigurându-se că dezvoltatorii pot echilibra viteza de procesare și consumul de resurse pe hardware local. Proiectul include o interfață CLI pentru executarea sarcinilor audio și conversia ponderilor modelelor în formate optimizate. De asemenea, expune endpoint-uri HTTP și WebSocket pentru a facilita integrarea cu interfețele standard din industrie.

    Transcribes spoken audio into text entirely on-device without requiring network connectivity.

    Swiftapple-siliconasrcoreml
    Vezi pe GitHub↗896
  • jamsch/expo-speech-recognitionAvatar jamsch

    jamsch/expo-speech-recognition

    541Vezi pe GitHub↗

    Expo Speech Recognition is a cross-platform mobile module that converts live microphone audio and pre-recorded files into text using native speech engines. It provides offline speech recognition capabilities by downloading and verifying local speech models to enable on-device processing without an active network connection. The library includes session lifecycle management to start, stop, or abort recording, alongside real-time spoken language detection with confidence scoring. It emits volume change events for metering interfaces, handles audio session configuration and routing, and persist

    Performs on-device speech recognition without network connectivity using local models.

    TypeScriptexporeact-nativespeech-recognition
    Vezi pe GitHub↗541
  1. Home
  2. Artificial Intelligence & ML
  3. Machine Learning
  4. Speech Processing
  5. Automatic Speech Recognition
  6. On-Device Speech Recognizers

Explorează sub-etichetele

  • Accelerated Speech RecognizersSpeech recognition systems that transcribe audio to text using Transformer models with optimized inference for speed and memory efficiency. **Distinct from On-Device Speech Recognizers:** Distinct from On-Device Speech Recognizers: focuses on accelerated inference via quantization and runtime optimizations, not specifically on local-only processing.
  • Model VerifiersModules that download and verify local offline speech recognition models. **Distinct from On-Device Speech Recognizers:** Distinct from On-Device Speech Recognizers: specifically targets model downloading and verification routines rather than the runtime inference engine.
  • Multilingual SupportAbility to recognize and transcribe speech across various languages using specific language packs. **Distinct from On-Device Speech Recognizers:** Focuses on language diversity within the recognition process, whereas On-Device Speech Recognizers focuses on the location of the inference.
  • On-Device Image RecognizersSystems that perform visual character and object recognition entirely on local hardware. **Distinct from On-Device Speech Recognizers:** Specializes on-device recognition from speech-specific recognizers to visual/image data.