awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

12 repositorios

Awesome GitHub RepositoriesOn-Device Speech Recognizers

Speech recognition systems that perform transcription entirely on-device without network connectivity.

Distinct from Automatic Speech Recognition: Distinct from Automatic Speech Recognition: focuses on local-only inference for privacy and offline operation, not cloud-based or hybrid ASR.

Explore 12 awesome GitHub repositories matching artificial intelligence & ml · On-Device Speech Recognizers. Refine with filters or upvote what's useful.

Awesome On-Device Speech Recognizers GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • uberi/speech_recognitionAvatar de Uberi

    Uberi/speech_recognition

    8,973Ver en GitHub↗

    This project is a Python speech recognition library that serves as a unified interface for converting spoken audio into text. It functions as a bridge between Python applications and a variety of speech-to-text engines, providing a consistent way to interact with both local and cloud-based recognition services. The library distinguishes itself as a multi-engine transcription tool, wrapping diverse online APIs and offline recognition backends into a standardized format. This allows for interchangeable recognition engines and supports multilingual audio transcription through various language pa

    Provides a unified interface to local recognition engines for offline speech-to-text transcription.

    Pythonaudiopythonspeech-recognition
    Ver en GitHub↗8,973
  • argmaxinc/whisperkitAvatar de argmaxinc

    argmaxinc/WhisperKit

    5,639Ver en GitHub↗

    Ships an on-device speech recognition SDK using Core ML models for private, offline transcription.

    Swiftinferenceiosmacos
    Ver en GitHub↗5,639
  • cactus-compute/cactusAvatar de cactus-compute

    cactus-compute/cactus

    5,363Ver en GitHub↗

    Cactus es un motor de inferencia de IA en el dispositivo diseñado para ejecutar modelos de lenguaje de gran tamaño (LLM), modelos de visión y sistemas de voz a texto en hardware móvil y wearable. Proporciona un grafo de computación tensorial programable para definir secuencias de operaciones matriciales y funciones de activación, junto con un framework de RAG (generación aumentada por recuperación) local que fundamenta las respuestas del modelo utilizando archivos de texto locales. El proyecto cuenta con un SDK multiplataforma con bindings de lenguaje para integrar capacidades de IA en aplicaciones móviles y un sistema de conversión de modelos que transforma formatos externos para una ejecución local optimizada. Utiliza un sistema de enrutamiento híbrido para redirigir cargas de trabajo entre la ejecución en el dispositivo y proveedores en la nube según la capacidad del hardware. El motor cubre una amplia superficie de capacidades, incluyendo procesamiento de audio en el dispositivo para detección de actividad de voz y transcripción, generación de embeddings vectoriales para búsqueda por similitud e integración de herramientas para analizar salidas del modelo en llamadas a funciones externas. Estos procesos están respaldados por kernels nativos optimizados para un rendimiento de baja latencia en hardware móvil.

    Performs local speech-to-text transcription and voice activity detection on handheld and wearable devices.

    C++aiandroidarm
    Ver en GitHub↗5,363
  • picovoice/porcupineAvatar de Picovoice

    Picovoice/porcupine

    4,694Ver en GitHub↗

    Porcupine is an on-device wake word detection engine that listens for a specific spoken phrase in real-time audio and triggers actions, all processed locally without any cloud connectivity. It includes a custom wake word model creator that generates production-ready models from just a few spoken examples in seconds, requiring no training data. Beyond wake word detection, Porcupine also provides on-device speech recognition for real-time transcription with custom vocabulary, an on-device audio content searcher that indexes and finds spoken phrases in audio files or streams, and a lightweight vo

    Transcribes spoken words into text in real time on the device using domain-specific vocabulary with no cloud data sent.

    Pythonhandsfreehotwordhotword-detection
    Ver en GitHub↗4,694
  • opennmt/ctranslate2Avatar de OpenNMT

    OpenNMT/CTranslate2

    4,319Ver en GitHub↗

    CTranslate2 is a C++ inference engine and runtime for Transformer models, designed to execute models on both CPU and GPU with optimizations for speed and memory efficiency. It functions as a model format converter, quantization tool, and REST API server, enabling deployment of neural machine translation, automatic speech recognition, and text generation models. The engine distinguishes itself through a suite of runtime optimizations including layer fusion, weight-matrix quantization, batch-by-length grouping, and a caching allocator that reuses GPU memory. It supports tensor-parallel model di

    CTranslate2 transcribes audio to text using Transformer-based speech recognition models with accelerated inference.

    C++avxavx2cpp
    Ver en GitHub↗4,319
  • cmusphinx/pocketsphinxAvatar de cmusphinx

    cmusphinx/pocketsphinx

    4,276Ver en GitHub↗

    PocketSphinx is an offline speech recognition engine that converts raw audio from files or live microphone streams into written text without requiring a network connection. It functions as a speech-to-text library, a real-time transcription engine, and a voice command processor, capable of detecting and transcribing spoken commands from continuous audio streams with configurable acoustic and language models. The engine uses weighted finite-state transducers to represent acoustic, phonetic, and language models as a single search graph for efficient decoding. It employs fixed-point acoustic mod

    Reads single-channel 16-bit PCM audio from files or standard input and outputs recognized text as line-delimited JSON.

    Ccpythonspeech-recognition
    Ver en GitHub↗4,276
  • gali8/tesseract-ocr-iosAvatar de gali8

    gali8/Tesseract-OCR-iOS

    4,222Ver en GitHub↗

    Tesseract-OCR-iOS es una integración nativa del motor Tesseract para aplicaciones iOS. Proporciona reconocimiento de imágenes en el dispositivo para identificar y extraer texto impreso de imágenes, convirtiéndolo en cadenas de texto editables. El proyecto permite la ejecución local en el dispositivo, lo que significa que el procesamiento de imágenes y la extracción de texto ocurren completamente en el hardware sin el uso de servicios en la nube externos o solicitudes de red. Utiliza un wrapper de C++ y un puente de Objective-C para interconectar las APIs de alto nivel de iOS con el motor Tesseract subyacente y la librería de procesamiento de imágenes Leptonica. La librería admite flujos de trabajo de digitalización de documentos y el desarrollo de herramientas de accesibilidad que leen texto desde la cámara o fotos. Gestiona la carga de archivos de datos entrenados específicos de cada idioma directamente desde el paquete de la aplicación.

    Processes images locally on iOS devices to extract text without relying on external cloud services.

    C
    Ver en GitHub↗4,222
  • rmtheis/tess-twoAvatar de rmtheis

    rmtheis/tess-two

    3,765Ver en GitHub↗

    Tess-two is an optical character recognition tool and Android application designed to extract written text from images using the Tesseract engine. It functions as an image analysis utility for detecting visual artifacts, blur, and optical flow within local image files on Android devices. The project includes an image pre-processing suite used to clean and manipulate images to increase the accuracy of text recognition. This involves a pipeline that applies grayscale conversion and binarization before the recognition process. The software integrates native image processing and character analys

    Performs visual character and artifact recognition entirely on local Android hardware.

    C
    Ver en GitHub↗3,765
  • microsoft/foundry-localAvatar de microsoft

    microsoft/Foundry-Local

    2,380Ver en GitHub↗

    Foundry-Local es una herramienta de desarrollo de aprendizaje automático diseñada para facilitar la inferencia privada en el dispositivo y la gestión de modelos. Proporciona un entorno de servidor local que aloja modelos de aprendizaje automático directamente en el hardware del usuario, asegurando que todo el procesamiento de datos, incluido el manejo de avisos y la transcripción de audio, permanezca dentro del entorno local sin requerir conectividad externa a la nube. El proyecto se distingue por automatizar todo el ciclo de vida del modelo, incluido el descubrimiento, la descarga y el versionado de activos para mantener la compatibilidad con el hardware host. Cuenta con una capa de abstracción de hardware que detecta y selecciona automáticamente el procesador disponible más eficiente para tareas intensivas de cómputo, permitiendo la ejecución acelerada por hardware sin configuración manual. Más allá de la inferencia central, la herramienta incluye una interfaz de línea de comandos para la exploración interactiva de modelos y la verificación del rendimiento. También proporciona proxy de API estandarizado, que mapea las solicitudes entrantes a puntos finales de modelos locales utilizando protocolos estándar de la industria para apoyar la integración con marcos de software externos.

    Transcribes spoken language into text using local neural models to provide fast speech recognition without cloud services.

    C++ai-sdkchat-completionsfoundry-local
    Ver en GitHub↗2,380
  • k2-fsa/sherpa-ncnnAvatar de k2-fsa

    k2-fsa/sherpa-ncnn

    1,743Ver en GitHub↗

    Sherpa-ncnn is an edge-based speech recognition and synthesis engine designed to run neural network models locally on mobile, embedded, and desktop hardware. It provides a cross-platform framework for offline speech-to-text transcription and text-to-speech synthesis, ensuring that all audio processing occurs on-device without requiring an internet connection or external cloud services. The project distinguishes itself through its use of the ncnn inference engine, which is optimized for low-latency execution on resource-constrained devices. It incorporates on-device model quantization to reduc

    Performs private, offline speech-to-text transcription using on-device neural network inference.

    C++asrccpp
    Ver en GitHub↗1,743
  • soniqo/speech-swiftAvatar de soniqo

    soniqo/speech-swift

    896Ver en GitHub↗

    Este proyecto es un toolkit integral para el reconocimiento de voz, síntesis y procesamiento de audio en el dispositivo, diseñado específicamente para Apple Silicon. Proporciona un framework para construir agentes de voz full-duplex en tiempo real que operan completamente offline, aprovechando la aceleración de hardware nativa para mantener el rendimiento y la privacidad. Al utilizar modelos de machine learning optimizados, la biblioteca permite la ejecución local de tareas de audio complejas sin depender de servicios externos en la nube. La biblioteca se distingue por su enfoque especializado en la interacción de voz local de alto rendimiento. Incluye una orquestación sofisticada para pipelines de audio en streaming, permitiendo la transcripción en tiempo real, síntesis de voz y clonación de voz con baja latencia. El sistema está diseñado para manejar conversaciones interactivas continuas, presentando mecanismos integrados para evitar bucles de retroalimentación de audio y gestionar sesiones de streaming persistentes. Más allá de la interacción central, el proyecto ofrece un amplio conjunto de capacidades de mejora y gestión de audio. Admite procesamiento de señales avanzado, incluyendo separación de fuentes, reducción de ruido y sobremuestreo de audio, junto con herramientas para diarización de hablantes y extracción de embeddings. El framework también proporciona amplias utilidades de gestión de modelos, como controles de cuantización, gestión de memoria y soporte para la carga de pesos de modelos personalizados, asegurando que los desarrolladores puedan equilibrar la velocidad de procesamiento y el consumo de recursos en hardware local. El proyecto incluye una interfaz de línea de comandos para ejecutar tareas de audio y convertir pesos de modelos en formatos optimizados. También expone endpoints HTTP y WebSocket para facilitar la integración con interfaces estándar de la industria.

    Transcribes spoken audio into text entirely on-device without requiring network connectivity.

    Swiftapple-siliconasrcoreml
    Ver en GitHub↗896
  • jamsch/expo-speech-recognitionAvatar de jamsch

    jamsch/expo-speech-recognition

    541Ver en GitHub↗

    Expo Speech Recognition is a cross-platform mobile module that converts live microphone audio and pre-recorded files into text using native speech engines. It provides offline speech recognition capabilities by downloading and verifying local speech models to enable on-device processing without an active network connection. The library includes session lifecycle management to start, stop, or abort recording, alongside real-time spoken language detection with confidence scoring. It emits volume change events for metering interfaces, handles audio session configuration and routing, and persist

    Performs on-device speech recognition without network connectivity using local models.

    TypeScriptexporeact-nativespeech-recognition
    Ver en GitHub↗541
  1. Home
  2. Artificial Intelligence & ML
  3. Machine Learning
  4. Speech Processing
  5. Automatic Speech Recognition
  6. On-Device Speech Recognizers

Explorar subetiquetas

  • Accelerated Speech RecognizersSpeech recognition systems that transcribe audio to text using Transformer models with optimized inference for speed and memory efficiency. **Distinct from On-Device Speech Recognizers:** Distinct from On-Device Speech Recognizers: focuses on accelerated inference via quantization and runtime optimizations, not specifically on local-only processing.
  • Model VerifiersModules that download and verify local offline speech recognition models. **Distinct from On-Device Speech Recognizers:** Distinct from On-Device Speech Recognizers: specifically targets model downloading and verification routines rather than the runtime inference engine.
  • Multilingual SupportAbility to recognize and transcribe speech across various languages using specific language packs. **Distinct from On-Device Speech Recognizers:** Focuses on language diversity within the recognition process, whereas On-Device Speech Recognizers focuses on the location of the inference.
  • On-Device Image RecognizersSystems that perform visual character and object recognition entirely on local hardware. **Distinct from On-Device Speech Recognizers:** Specializes on-device recognition from speech-specific recognizers to visual/image data.