awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoAcerca deCómo clasificamosPrensaServidor MCP
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
pannous avatar

pannous/tensorflow-speech-recognition

0
View on GitHub↗
2,172 estrellas·633 forks·Python·11 vistas

Tensorflow Speech Recognition

Esta librería proporciona un framework de deep learning para entrenar redes neuronales para realizar reconocimiento de voz y clasificación de audio. Utiliza arquitecturas de secuencia a secuencia para mapear entradas de audio de longitud variable en salidas de texto o numéricas, permitiendo el desarrollo de modelos personalizados de transcripción de voz a texto.

El proyecto destaca por sus capacidades integradas de procesamiento de audio que transforman formas de onda crudas en espectrogramas y vectores numéricos de alta dimensión. Estas herramientas permiten la extracción de características vocales únicas para identificar hablantes, así como la clasificación de fuentes de audio específicas y dígitos hablados.

Para apoyar el desarrollo de modelos, la librería incluye utilidades para aumento de audio y reconstrucción de señales. Al modificar programáticamente muestras de audio para simular diversos entornos acústicos y verificar la integridad de las características aprendidas mediante la reconstrucción del espacio latente, el sistema mejora la robustez de sus redes neuronales subyacentes.

Features

  • Speech Transcription - Converts raw audio input into written text sequences using deep learning architectures designed for speech transcription.
  • Automatic Speech Recognition - Provides a framework for building custom models to convert spoken human language into written text.
  • Speech Recognition Libraries - Provides a deep learning framework for training neural networks to transcribe spoken audio and classify voice patterns.
  • Sequence-to-Sequence Models - Implements encoder-decoder architectures to map variable-length audio sequences into text or numerical outputs.
  • Training Data Augmentation - Provides programmatic audio augmentation techniques to simulate diverse acoustic environments for training robust neural networks.
  • Audio Speaker Embeddings - Maps unique vocal characteristics into high-dimensional numerical vectors to isolate speaker identity from speech content.
  • Speaker Identification Frameworks - Extracts unique vocal characteristics from audio recordings to distinguish between different individuals or verify speaker identity.
  • Feature Extraction - Extracts voice characteristics like pitch and speed into numerical vectors to isolate a speaker's unique identity.
  • Audio Classification Models - Classifies audio sources by processing features through deep learning models to distinguish speakers or spoken content.
  • Spoken Digit Recognition - Maps spectrogram data to specific numerical labels to accurately recognize individual digits spoken by a human voice.
  • Spectrogram Processing - Converts raw audio waveforms into spectrograms to enable neural networks to process sound as spatial data.
  • Audio Feature Extraction - Provides utilities for processing raw audio into spectrograms and numerical vectors for speech recognition tasks.

Historial de estrellas

Gráfico del historial de estrellas de pannous/tensorflow-speech-recognitionGráfico del historial de estrellas de pannous/tensorflow-speech-recognition

Búsqueda con IA

Explora más repositorios increíbles

Describe lo que necesitas en lenguaje sencillo: la IA clasifica miles de proyectos open-source curados por relevancia.

Start searching with AI

Colecciones destacadas con Tensorflow Speech Recognition

Colecciones seleccionadas manualmente donde aparece Tensorflow Speech Recognition.
  • Motores de reconocimiento de voz open source
  • Modelos de síntesis y reconocimiento de voz

Alternativas open-source a Tensorflow Speech Recognition

Proyectos open-source similares, clasificados según cuántas características comparten con Tensorflow Speech Recognition.
  • soniqo/speech-swiftAvatar de soniqo

    soniqo/speech-swift

    896Ver en GitHub↗

    This project is a comprehensive toolkit for on-device speech recognition, synthesis, and audio processing, specifically engineered for Apple Silicon. It provides a framework for building real-time, full-duplex voice agents that operate entirely offline, leveraging native hardware acceleration to maintain performance and privacy. By utilizing optimized machine learning models, the library enables local execution of complex audio tasks without reliance on external cloud services. The library distinguishes itself through its specialized focus on local, high-performance voice interaction. It incl

    Swiftapple-siliconasrcoreml
    Ver en GitHub↗896
  • paddlepaddle/paddlespeechAvatar de PaddlePaddle

    PaddlePaddle/PaddleSpeech

    12,626Ver en GitHub↗

    PaddleSpeech is a comprehensive toolkit of neural models for speech recognition, synthesis, and translation built on the PaddlePaddle deep learning framework. It provides a collection of frameworks and tools for converting spoken audio into written text, synthesizing natural audio from text, and performing direct speech translation. The toolkit includes specialized capabilities for keyword spotting to detect trigger words and speaker verification systems that extract unique voiceprints to identify and distinguish between individuals. It also features end-to-end translation tools that map audi

    Pythonasrcode-switchconformer
    Ver en GitHub↗12,626
  • facebookresearch/fairseqAvatar de facebookresearch

    facebookresearch/fairseq

    32,228Ver en GitHub↗

    Fairseq is a PyTorch toolkit for sequence-to-sequence modeling, specializing in neural machine translation, automatic speech recognition, and large-scale language model training. It provides a framework for processing and aligning diverse data sources, including text, audio, and video, to support tasks such as speech-to-text conversion and multimodal sequence learning. The project is distinguished by its distributed training capabilities, which utilize parameter sharding, mixed-precision training, and CPU offloading to handle models that exceed single-device memory. It also includes specializ

    Python
    Ver en GitHub↗32,228
  • alphacep/vosk-apiAvatar de alphacep

    alphacep/vosk-api

    14,853Ver en GitHub↗

    Vosk is an offline speech-to-text engine and API that converts spoken audio into text locally on a device. It provides a cross-platform speech toolkit with language bindings for integrating voice recognition into server environments, Android, iOS, and Raspberry Pi. The project includes a speaker identification tool to distinguish between different voices and an acoustic model trainer for building custom neural network models. These training tools enable speech feature extraction and model accuracy evaluation to improve recognition for specialized domains. The system supports real-time audio

    Jupyter Notebookandroidasrdeep-learning
    Ver en GitHub↗14,853
Ver las 30 alternativas a Tensorflow Speech Recognition→

Preguntas frecuentes

¿Qué hace pannous/tensorflow-speech-recognition?

Esta librería proporciona un framework de deep learning para entrenar redes neuronales para realizar reconocimiento de voz y clasificación de audio. Utiliza arquitecturas de secuencia a secuencia para mapear entradas de audio de longitud variable en salidas de texto o numéricas, permitiendo el desarrollo de modelos personalizados de transcripción de voz a texto.

¿Cuáles son las características principales de pannous/tensorflow-speech-recognition?

Las características principales de pannous/tensorflow-speech-recognition son: Speech Transcription, Automatic Speech Recognition, Speech Recognition Libraries, Sequence-to-Sequence Models, Training Data Augmentation, Audio Speaker Embeddings, Speaker Identification Frameworks, Feature Extraction.

¿Qué alternativas de código abierto existen para pannous/tensorflow-speech-recognition?

Las alternativas de código abierto para pannous/tensorflow-speech-recognition incluyen: soniqo/speech-swift — This project is a comprehensive toolkit for on-device speech recognition, synthesis, and audio processing,… paddlepaddle/paddlespeech — PaddleSpeech is a comprehensive toolkit of neural models for speech recognition, synthesis, and translation built on… facebookresearch/fairseq — Fairseq is a PyTorch toolkit for sequence-to-sequence modeling, specializing in neural machine translation, automatic… alphacep/vosk-api — Vosk is an offline speech-to-text engine and API that converts spoken audio into text locally on a device. It provides… facebookresearch/omnilingual-asr — Omnilingual-ASR is a multilingual automatic speech recognition framework and toolkit designed to transcribe audio… modelscope/funasr — FunASR is an automatic speech recognition toolkit and multilingual speech-to-text engine designed to convert spoken…