2 repository-uri
Techniques for quantifying the accuracy of automatic speech recognition systems.
Distinct from Automatic Speech Recognition: Focuses on measuring the success of transcription rather than the act of transcription
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Performance Evaluation. Refine with filters or upvote what's useful.
Fairseq is a PyTorch toolkit for sequence-to-sequence modeling, specializing in neural machine translation, automatic speech recognition, and large-scale language model training. It provides a framework for processing and aligning diverse data sources, including text, audio, and video, to support tasks such as speech-to-text conversion and multimodal sequence learning. The project is distinguished by its distributed training capabilities, which utilize parameter sharding, mixed-precision training, and CPU offloading to handle models that exceed single-device memory. It also includes specializ
Measures speech model performance using external language models and Viterbi decoding for transcription verification.
Acest proiect este un toolkit de machine learning conceput pentru dezvoltarea, antrenarea și deployment-ul motoarelor de recunoaștere automată a vorbirii (ASR). Oferă un framework cuprinzător pentru conversia audio-ului vorbit în text scris, suportând în mod specific modele antrenate pe seturi de date în mandarină și engleză. Biblioteca utilizează o arhitectură neuronală end-to-end care procesează input-ul audio brut direct în secvențe de caractere, eliminând necesitatea alinierii lingvistice intermediare. Încorporează tehnici de procesare a semnalului pentru a transforma undele sonore în spectrogramă numerice și vectori de caracteristici, care sunt apoi utilizați pentru a antrena modele acustice prin cicluri de învățare iterative, accelerate hardware. Toolkit-ul include o suită completă de utilitare pentru gestionarea ciclului de viață al modelului, inclusiv preprocesarea datelor, persistența stării bazată pe checkpoint-uri și evaluarea performanței. Utilizatorii pot evalua calitatea transcrierii prin calcularea metricilor precum distanța de editare a fonemelor față de etichetele ground truth pentru a cuantifica precizia conversiei speech-to-text.
Quantifies the accuracy of speech recognition systems using phoneme edit distance metrics.