2 dépôts
Techniques for quantifying the accuracy of automatic speech recognition systems.
Distinct from Automatic Speech Recognition: Focuses on measuring the success of transcription rather than the act of transcription
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Performance Evaluation. Refine with filters or upvote what's useful.
Fairseq is a PyTorch toolkit for sequence-to-sequence modeling, specializing in neural machine translation, automatic speech recognition, and large-scale language model training. It provides a framework for processing and aligning diverse data sources, including text, audio, and video, to support tasks such as speech-to-text conversion and multimodal sequence learning. The project is distinguished by its distributed training capabilities, which utilize parameter sharding, mixed-precision training, and CPU offloading to handle models that exceed single-device memory. It also includes specializ
Measures speech model performance using external language models and Viterbi decoding for transcription verification.
Ce projet est une boîte à outils de machine learning conçue pour le développement, l'entraînement et le déploiement de moteurs de reconnaissance vocale automatique. Il fournit un framework complet pour convertir l'audio parlé en texte écrit, prenant spécifiquement en charge les modèles entraînés sur des jeux de données en mandarin et en anglais. La bibliothèque utilise une architecture neuronale de bout en bout qui traite l'entrée audio brute directement en séquences de caractères, contournant le besoin d'alignement linguistique intermédiaire. Elle intègre des techniques de traitement du signal pour transformer les ondes sonores en spectrogrammes numériques et en vecteurs de caractéristiques, qui sont ensuite utilisés pour entraîner des modèles acoustiques via des cycles d'apprentissage itératifs accélérés par le matériel. La boîte à outils inclut une suite complète d'utilitaires pour gérer le cycle de vie du modèle, y compris le prétraitement des données, la persistance de l'état basée sur des checkpoints et l'évaluation des performances. Les utilisateurs peuvent évaluer la qualité de la transcription en calculant des métriques telles que la distance d'édition de phonèmes par rapport aux étiquettes de vérité terrain pour quantifier la précision de la conversion parole-texte.
Quantifies the accuracy of speech recognition systems using phoneme edit distance metrics.