12 repositorios
Speech recognition systems that perform transcription entirely on-device without network connectivity.
Distinct from Automatic Speech Recognition: Distinct from Automatic Speech Recognition: focuses on local-only inference for privacy and offline operation, not cloud-based or hybrid ASR.
Explore 12 awesome GitHub repositories matching artificial intelligence & ml · On-Device Speech Recognizers. Refine with filters or upvote what's useful.
This project is a Python speech recognition library that serves as a unified interface for converting spoken audio into text. It functions as a bridge between Python applications and a variety of speech-to-text engines, providing a consistent way to interact with both local and cloud-based recognition services. The library distinguishes itself as a multi-engine transcription tool, wrapping diverse online APIs and offline recognition backends into a standardized format. This allows for interchangeable recognition engines and supports multilingual audio transcription through various language pa
Provides a unified interface to local recognition engines for offline speech-to-text transcription.
Ships an on-device speech recognition SDK using Core ML models for private, offline transcription.
Cactus es un motor de inferencia de IA en el dispositivo diseñado para ejecutar modelos de lenguaje de gran tamaño (LLM), modelos de visión y sistemas de voz a texto en hardware móvil y wearable. Proporciona un grafo de computación tensorial programable para definir secuencias de operaciones matriciales y funciones de activación, junto con un framework de RAG (generación aumentada por recuperación) local que fundamenta las respuestas del modelo utilizando archivos de texto locales. El proyecto cuenta con un SDK multiplataforma con bindings de lenguaje para integrar capacidades de IA en aplicaciones móviles y un sistema de conversión de modelos que transforma formatos externos para una ejecución local optimizada. Utiliza un sistema de enrutamiento híbrido para redirigir cargas de trabajo entre la ejecución en el dispositivo y proveedores en la nube según la capacidad del hardware. El motor cubre una amplia superficie de capacidades, incluyendo procesamiento de audio en el dispositivo para detección de actividad de voz y transcripción, generación de embeddings vectoriales para búsqueda por similitud e integración de herramientas para analizar salidas del modelo en llamadas a funciones externas. Estos procesos están respaldados por kernels nativos optimizados para un rendimiento de baja latencia en hardware móvil.
Performs local speech-to-text transcription and voice activity detection on handheld and wearable devices.
Porcupine is an on-device wake word detection engine that listens for a specific spoken phrase in real-time audio and triggers actions, all processed locally without any cloud connectivity. It includes a custom wake word model creator that generates production-ready models from just a few spoken examples in seconds, requiring no training data. Beyond wake word detection, Porcupine also provides on-device speech recognition for real-time transcription with custom vocabulary, an on-device audio content searcher that indexes and finds spoken phrases in audio files or streams, and a lightweight vo
Transcribes spoken words into text in real time on the device using domain-specific vocabulary with no cloud data sent.
CTranslate2 is a C++ inference engine and runtime for Transformer models, designed to execute models on both CPU and GPU with optimizations for speed and memory efficiency. It functions as a model format converter, quantization tool, and REST API server, enabling deployment of neural machine translation, automatic speech recognition, and text generation models. The engine distinguishes itself through a suite of runtime optimizations including layer fusion, weight-matrix quantization, batch-by-length grouping, and a caching allocator that reuses GPU memory. It supports tensor-parallel model di
CTranslate2 transcribes audio to text using Transformer-based speech recognition models with accelerated inference.
PocketSphinx is an offline speech recognition engine that converts raw audio from files or live microphone streams into written text without requiring a network connection. It functions as a speech-to-text library, a real-time transcription engine, and a voice command processor, capable of detecting and transcribing spoken commands from continuous audio streams with configurable acoustic and language models. The engine uses weighted finite-state transducers to represent acoustic, phonetic, and language models as a single search graph for efficient decoding. It employs fixed-point acoustic mod
Reads single-channel 16-bit PCM audio from files or standard input and outputs recognized text as line-delimited JSON.
Tesseract-OCR-iOS es una integración nativa del motor Tesseract para aplicaciones iOS. Proporciona reconocimiento de imágenes en el dispositivo para identificar y extraer texto impreso de imágenes, convirtiéndolo en cadenas de texto editables. El proyecto permite la ejecución local en el dispositivo, lo que significa que el procesamiento de imágenes y la extracción de texto ocurren completamente en el hardware sin el uso de servicios en la nube externos o solicitudes de red. Utiliza un wrapper de C++ y un puente de Objective-C para interconectar las APIs de alto nivel de iOS con el motor Tesseract subyacente y la librería de procesamiento de imágenes Leptonica. La librería admite flujos de trabajo de digitalización de documentos y el desarrollo de herramientas de accesibilidad que leen texto desde la cámara o fotos. Gestiona la carga de archivos de datos entrenados específicos de cada idioma directamente desde el paquete de la aplicación.
Processes images locally on iOS devices to extract text without relying on external cloud services.
Tess-two is an optical character recognition tool and Android application designed to extract written text from images using the Tesseract engine. It functions as an image analysis utility for detecting visual artifacts, blur, and optical flow within local image files on Android devices. The project includes an image pre-processing suite used to clean and manipulate images to increase the accuracy of text recognition. This involves a pipeline that applies grayscale conversion and binarization before the recognition process. The software integrates native image processing and character analys
Performs visual character and artifact recognition entirely on local Android hardware.
Foundry-Local es una herramienta de desarrollo de aprendizaje automático diseñada para facilitar la inferencia privada en el dispositivo y la gestión de modelos. Proporciona un entorno de servidor local que aloja modelos de aprendizaje automático directamente en el hardware del usuario, asegurando que todo el procesamiento de datos, incluido el manejo de avisos y la transcripción de audio, permanezca dentro del entorno local sin requerir conectividad externa a la nube. El proyecto se distingue por automatizar todo el ciclo de vida del modelo, incluido el descubrimiento, la descarga y el versionado de activos para mantener la compatibilidad con el hardware host. Cuenta con una capa de abstracción de hardware que detecta y selecciona automáticamente el procesador disponible más eficiente para tareas intensivas de cómputo, permitiendo la ejecución acelerada por hardware sin configuración manual. Más allá de la inferencia central, la herramienta incluye una interfaz de línea de comandos para la exploración interactiva de modelos y la verificación del rendimiento. También proporciona proxy de API estandarizado, que mapea las solicitudes entrantes a puntos finales de modelos locales utilizando protocolos estándar de la industria para apoyar la integración con marcos de software externos.
Transcribes spoken language into text using local neural models to provide fast speech recognition without cloud services.
Sherpa-ncnn is an edge-based speech recognition and synthesis engine designed to run neural network models locally on mobile, embedded, and desktop hardware. It provides a cross-platform framework for offline speech-to-text transcription and text-to-speech synthesis, ensuring that all audio processing occurs on-device without requiring an internet connection or external cloud services. The project distinguishes itself through its use of the ncnn inference engine, which is optimized for low-latency execution on resource-constrained devices. It incorporates on-device model quantization to reduc
Performs private, offline speech-to-text transcription using on-device neural network inference.
Este proyecto es un toolkit integral para el reconocimiento de voz, síntesis y procesamiento de audio en el dispositivo, diseñado específicamente para Apple Silicon. Proporciona un framework para construir agentes de voz full-duplex en tiempo real que operan completamente offline, aprovechando la aceleración de hardware nativa para mantener el rendimiento y la privacidad. Al utilizar modelos de machine learning optimizados, la biblioteca permite la ejecución local de tareas de audio complejas sin depender de servicios externos en la nube. La biblioteca se distingue por su enfoque especializado en la interacción de voz local de alto rendimiento. Incluye una orquestación sofisticada para pipelines de audio en streaming, permitiendo la transcripción en tiempo real, síntesis de voz y clonación de voz con baja latencia. El sistema está diseñado para manejar conversaciones interactivas continuas, presentando mecanismos integrados para evitar bucles de retroalimentación de audio y gestionar sesiones de streaming persistentes. Más allá de la interacción central, el proyecto ofrece un amplio conjunto de capacidades de mejora y gestión de audio. Admite procesamiento de señales avanzado, incluyendo separación de fuentes, reducción de ruido y sobremuestreo de audio, junto con herramientas para diarización de hablantes y extracción de embeddings. El framework también proporciona amplias utilidades de gestión de modelos, como controles de cuantización, gestión de memoria y soporte para la carga de pesos de modelos personalizados, asegurando que los desarrolladores puedan equilibrar la velocidad de procesamiento y el consumo de recursos en hardware local. El proyecto incluye una interfaz de línea de comandos para ejecutar tareas de audio y convertir pesos de modelos en formatos optimizados. También expone endpoints HTTP y WebSocket para facilitar la integración con interfaces estándar de la industria.
Transcribes spoken audio into text entirely on-device without requiring network connectivity.
Expo Speech Recognition is a cross-platform mobile module that converts live microphone audio and pre-recorded files into text using native speech engines. It provides offline speech recognition capabilities by downloading and verifying local speech models to enable on-device processing without an active network connection. The library includes session lifecycle management to start, stop, or abort recording, alongside real-time spoken language detection with confidence scoring. It emits volume change events for metering interfaces, handles audio session configuration and routing, and persist
Performs on-device speech recognition without network connectivity using local models.