awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

13 repository-uri

Awesome GitHub RepositoriesEvaluation Metrics

Methods and scripts for measuring the performance and accuracy of sequence learning models.

Distinct from Sequence Learning Models: Focuses on the evaluation process and metrics rather than the model architectures themselves

Explore 13 awesome GitHub repositories matching artificial intelligence & ml · Evaluation Metrics. Refine with filters or upvote what's useful.

Awesome Evaluation Metrics GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • facebookresearch/fairseqAvatar facebookresearch

    facebookresearch/fairseq

    32,228Vezi pe GitHub↗

    Fairseq is a PyTorch toolkit for sequence-to-sequence modeling, specializing in neural machine translation, automatic speech recognition, and large-scale language model training. It provides a framework for processing and aligning diverse data sources, including text, audio, and video, to support tasks such as speech-to-text conversion and multimodal sequence learning. The project is distinguished by its distributed training capabilities, which utilize parameter sharding, mixed-precision training, and CPU offloading to handle models that exceed single-device memory. It also includes specializ

    Provides standardized accuracy and quality metrics to evaluate the performance of trained sequence-to-sequence models.

    Python
    Vezi pe GitHub↗32,228
  • thuml/time-series-libraryAvatar thuml

    thuml/Time-Series-Library

    12,494Vezi pe GitHub↗

    This PyTorch-based deep learning library provides a framework for analyzing and forecasting temporal data. It implements specialized architectures for time series forecasting, anomaly detection, data imputation, and classification. The project distinguishes itself through the inclusion of zero-shot inference capabilities, allowing large-scale temporal models to be evaluated on unseen datasets without requiring task-specific fine-tuning. The framework covers a broad range of analytical capabilities, including the recovery of missing values in incomplete datasets, the identification of irregul

    Provides standardized scripts and methods for measuring the accuracy of sequence learning models across datasets.

    Python
    Vezi pe GitHub↗12,494
  • lyhue1991/eat_tensorflow2_in_30_daysAvatar lyhue1991

    lyhue1991/eat_tensorflow2_in_30_days

    9,933Vezi pe GitHub↗

    This project is a structured learning curriculum and technical reference for mastering deep learning with TensorFlow. It provides a comprehensive guide for building, training, and deploying neural networks, combining theoretical fundamentals with practical implementation examples. The repository distinguishes itself by covering the end-to-end machine learning workflow, from low-level tensor mathematics and linear algebra to the creation of complex model architectures. It includes specific guidance on developing data pipelines for diverse data types, such as images, text, and time-series seque

    Implements custom evaluation metrics by extending base metric classes to meet specific project requirements.

    Pythontensorflowtensorflow-examplestensorflow-tutorial
    Vezi pe GitHub↗9,933
  • open-mmlab/mmsegmentationAvatar open-mmlab

    open-mmlab/mmsegmentation

    9,860Vezi pe GitHub↗

    MMSegmentation is an open-source semantic segmentation toolbox built on PyTorch that provides a modular, configurable framework for building, training, evaluating, and deploying segmentation models. At its core, it offers a config-driven pipeline that assembles training, evaluation, and inference workflows by parsing hierarchical configuration files, with a modular component registry that enables plug-and-play composition of neural network modules, optimizers, datasets, and metrics. The framework supports the full model lifecycle through a unified runner interface that controls training, testi

    Allows users to create new evaluation metrics by subclassing a base metric class and implementing custom computation logic.

    Pythondeeplabv3image-segmentationmedical-image-segmentation
    Vezi pe GitHub↗9,860
  • google/adk-samplesAvatar google

    google/adk-samples

    8,476Vezi pe GitHub↗

    This project provides a collection of reference implementations, architectural patterns, and SDK samples for building autonomous agents using large language models. It serves as a multi-language framework for implementing and deploying specialized AI agents across diverse programming environments. The system centers on an orchestration framework that combines deterministic code with adaptive reasoning through structured graph workflows. It utilizes schema-driven integration to connect agents with third-party applications and diverse AI models. The development lifecycle is supported by toolki

    Provides methods for measuring agent reliability by comparing execution outputs against quality benchmarks.

    Pythonadkagent-samplesagents
    Vezi pe GitHub↗8,476
  • deepmipt/deeppavlovAvatar deepmipt

    deepmipt/DeepPavlov

    6,986Vezi pe GitHub↗

    DeepPavlov is a deep learning conversational AI framework designed for building end-to-end dialog systems and chatbots. It functions as an NLP model training library and a pipeline system that connects multiple natural language processing models into a single operational chain. The framework provides a REST API model server to expose trained deep learning models as web endpoints. This allows conversational agents to be deployed as web services that handle incoming HTTP requests and return predictions. The system covers the full lifecycle of conversational AI development, including NLP pipeli

    Ships tools to measure the accuracy and quality of generated responses against gold-standard datasets.

    Python
    Vezi pe GitHub↗6,986
  • open-compass/opencompassAvatar open-compass

    open-compass/opencompass

    6,678Vezi pe GitHub↗

    OpenCompass is an open-source framework for standardized benchmarking of large language models. It provides a configurable evaluation pipeline that supports both objective and subjective assessment, using a dual-engine architecture to handle closed-form answer comparison and open-ended response rating. The framework is designed as a modular platform where datasets, models, and metrics are composed through declarative YAML configuration files. The framework distinguishes itself through its extensible model integration layer, which supports custom models, HuggingFace models, and third-party API

    Allows configuring custom scoring functions and post-processing steps for each evaluation dataset.

    Pythonbenchmarkchatgptevaluation
    Vezi pe GitHub↗6,678
  • facebookresearch/mmfAvatar facebookresearch

    facebookresearch/mmf

    5,635Vezi pe GitHub↗

    MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a configuration-driven experiment system where model, dataset, and training parameters are defined through composable YAML files, alongside a curated model zoo of pretrained checkpoints for state-of-the-art multimodal architectures. The framework includes a multimodal dataset loader that downloads, processes, and batches vision-and-language data, and a vision-language model trainer supporting distributed training, mixed precision, and checkpoint-based resumption. The framework distinguish

    Specifies which metrics to compute during evaluation by listing their registered keys in the configuration file.

    Pythoncaptioningdeep-learningdialog
    Vezi pe GitHub↗5,635
  • awslabs/gluontsAvatar awslabs

    awslabs/gluonts

    5,199Vezi pe GitHub↗

    GluonTS este o bibliotecă de serii temporale probabilistice și un framework de prognoză prin deep learning. Oferă un toolkit pentru construirea, antrenarea și evaluarea arhitecturilor de rețele neuronale care prezic valori viitoare ca distribuții de probabilitate pentru a cuantifica incertitudinea. Proiectul se distinge prin suportul pentru prognoza zero-shot și integrarea unor abordări de modelare diverse, incluzând rețele neuronale probabilistice profunde și wrapper-e pentru biblioteci statistice externe precum Prophet și R forecast. Implementează primitive arhitecturale specializate precum convoluțiile cauzale și rețelele reziduale inversabile pentru a preveni scurgerea informațiilor și a mapa reprezentările latente în distribuții de probabilitate valide. Framework-ul acoperă o suprafață cuprinzătoare de inginerie a datelor, incluzând scalarea seriilor temporale, transformări bijective și modelare ierarhică. Utilizează Apache Arrow și Parquet pentru streaming-ul seturilor de date de înaltă performanță și gestionarea accesului aleatoriu. Pentru evaluarea modelului, include o suită de evaluare pentru măsurarea acurateței prognozei și a acoperirii probabilistice folosind metrici precum quantile loss și continuous rank probability scores. Biblioteca suportă implementarea modelului prin integrarea cu Amazon SageMaker.

    Provides mechanisms to compose multiple simple evaluation metrics into a single derived metric.

    Pythonartificial-intelligenceawsdata-science
    Vezi pe GitHub↗5,199
  • awslabs/gluon-tsAvatar awslabs

    awslabs/gluon-ts

    5,200Vezi pe GitHub↗

    GluonTS este un framework pentru prognoza probabilistică a seriilor temporale, conceput pentru a prezice valori viitoare ca distribuții de probabilitate cu intervale de încredere. Suportă atât antrenarea modelelor tradiționale, cât și prognoza zero-shot, unde modelele preantrenate generează predicții pentru serii noi fără antrenare suplimentară. Proiectul se distinge prin integrarea unei mari varietăți de abordări de prognoză într-un flux de lucru unificat. Aceasta include arhitecturi de deep learning precum rețelele neuronale recurente și convoluțiile cauzale, precum și integrarea modelelor statistice externe, a bibliotecii Prophet și a pachetelor R. Toolkit-ul oferă o suprafață cuprinzătoare pentru ingineria datelor de serii temporale, acoperind scalarea seturilor de date, divizarea și transformarea datelor temporale brute în tensori. Include, de asemenea, o suită de instrumente de evaluare pentru măsurarea acurateței prognozei și a intervalelor de incertitudine, precum și utilitare pentru persistența seturilor de date folosind formate precum Arrow și Parquet. Framework-ul suportă implementarea modelelor de prognoză în cadrul infrastructurii cloud.

    Allows building evaluation measures by combining simple metrics and applying custom post-processing functions.

    Python
    Vezi pe GitHub↗5,200
  • open-mmlab/mmocrAvatar open-mmlab

    open-mmlab/mmocr

    4,739Vezi pe GitHub↗

    mmocr este un framework de recunoaștere optică a caracterelor (OCR) bazat pe PyTorch, conceput pentru antrenarea și deployment-ul modelelor de detectare a textului, recunoaștere și extragere a informațiilor cheie. Servește ca un toolkit cuprinzător pentru detectarea și recunoașterea textului în scene, oferind biblioteci specializate pentru localizarea regiunilor de text și convertirea textului vizual în șiruri de caractere codificate de mașină. Proiectul se distinge printr-un framework de cercetare pentru extragerea informațiilor cheie și capabilități avansate de text spotting. Acestea includ spotting bazat pe puncte folosind transformatoare și utilizarea curbelor Bezier parametrizate pentru a identifica și transcrie text cu forme arbitrare. Framework-ul acoperă o suprafață largă de capabilități de viziune artificială, inclusiv gestionarea pipeline-ului de date pentru augmentarea și standardizarea seturilor de date OCR diverse, antrenarea modelelor cu scalare distribuită și evaluarea performanței folosind metrici OCR standard. Oferă, de asemenea, utilitare pentru manipularea poligoanelor geometrice și vizualizarea rezultatelor pentru auditarea predicțiilor față de adnotările ground truth. Sistemul este implementat în Python și suportă instalarea prin împachetarea mediului Docker.

    Allows for the creation of new evaluation metrics by subclassing a base metric class and implementing custom logic.

    Pythonabcnetabinetcrnn
    Vezi pe GitHub↗4,739
  • snowkylin/tensorflow-handbookAvatar snowkylin

    snowkylin/tensorflow-handbook

    3,927Vezi pe GitHub↗

    Acest proiect este o resursă educațională cuprinzătoare și un manual de tutoriale pentru construirea, antrenarea și implementarea modelelor de machine learning folosind TensorFlow 2. Acesta servește drept ghid de învățare structurat, acoperind concepte fundamentale de deep learning, inclusiv arhitecturi de rețele neuronale, diferențiere automată și operații cu tensori. Manualul oferă îndrumări tehnice pentru optimizarea eficienței execuției prin gestionarea memoriei GPU, antrenarea distribuită și cuantizarea modelelor. Include, de asemenea, manuale detaliate pentru construirea de pipeline-uri de date de înaltă performanță și exportul modelelor pentru servere de producție, dispozitive mobile și browsere web. Materialul acoperă o gamă largă de capabilități, inclusiv dezvoltarea de modele cu rețele convoluționale și recurente, implementarea de funcții de loss și straturi personalizate, precum și utilizarea modelelor pre-antrenate pentru transfer learning. De asemenea, abordează strategii de implementare pentru dispozitive edge și utilizarea runtime-urilor bazate pe cloud pentru accelerare hardware. Resursa este implementată sub forma unei colecții de Jupyter Notebooks.

    Explains how to create new evaluation metrics by subclassing a base metric class and implementing state updates.

    Jupyter Notebook
    Vezi pe GitHub↗3,927
  • zzw922cn/automatic_speech_recognitionAvatar zzw922cn

    zzw922cn/Automatic_Speech_Recognition

    2,834Vezi pe GitHub↗

    Acest proiect este un toolkit de machine learning conceput pentru dezvoltarea, antrenarea și deployment-ul motoarelor de recunoaștere automată a vorbirii (ASR). Oferă un framework cuprinzător pentru conversia audio-ului vorbit în text scris, suportând în mod specific modele antrenate pe seturi de date în mandarină și engleză. Biblioteca utilizează o arhitectură neuronală end-to-end care procesează input-ul audio brut direct în secvențe de caractere, eliminând necesitatea alinierii lingvistice intermediare. Încorporează tehnici de procesare a semnalului pentru a transforma undele sonore în spectrogramă numerice și vectori de caracteristici, care sunt apoi utilizați pentru a antrena modele acustice prin cicluri de învățare iterative, accelerate hardware. Toolkit-ul include o suită completă de utilitare pentru gestionarea ciclului de viață al modelului, inclusiv preprocesarea datelor, persistența stării bazată pe checkpoint-uri și evaluarea performanței. Utilizatorii pot evalua calitatea transcrierii prin calcularea metricilor precum distanța de editare a fonemelor față de etichetele ground truth pentru a cuantifica precizia conversiei speech-to-text.

    Measures transcription quality by calculating edit distance metrics between predicted character sequences and ground truth labels.

    Pythonaudioautomatic-speech-recognitionchinese-speech-recognition
    Vezi pe GitHub↗2,834
  1. Home
  2. Artificial Intelligence & ML
  3. Sequence Learning Models
  4. Evaluation Metrics

Explorează sub-etichetele

  • Custom Metric ImplementationsCreates new evaluation metrics by subclassing a base metric class and implementing process, compute, and evaluate methods. **Distinct from Evaluation Metrics:** Distinct from Evaluation Metrics: focuses on the extensibility mechanism for defining new metrics, not the metrics themselves.
  • Per-Dataset Metric Configurators1 sub-tagMechanisms for defining custom scoring functions and post-processing steps per evaluation dataset. **Distinct from Evaluation Metrics:** Distinct from Evaluation Metrics: focuses on per-dataset configuration of metrics rather than general metric calculation.