awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

13 dépôts

Awesome GitHub RepositoriesEvaluation Metrics

Methods and scripts for measuring the performance and accuracy of sequence learning models.

Distinct from Sequence Learning Models: Focuses on the evaluation process and metrics rather than the model architectures themselves

Explore 13 awesome GitHub repositories matching artificial intelligence & ml · Evaluation Metrics. Refine with filters or upvote what's useful.

Awesome Evaluation Metrics GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • facebookresearch/fairseqAvatar de facebookresearch

    facebookresearch/fairseq

    32,228Voir sur GitHub↗

    Fairseq is a PyTorch toolkit for sequence-to-sequence modeling, specializing in neural machine translation, automatic speech recognition, and large-scale language model training. It provides a framework for processing and aligning diverse data sources, including text, audio, and video, to support tasks such as speech-to-text conversion and multimodal sequence learning. The project is distinguished by its distributed training capabilities, which utilize parameter sharding, mixed-precision training, and CPU offloading to handle models that exceed single-device memory. It also includes specializ

    Provides standardized accuracy and quality metrics to evaluate the performance of trained sequence-to-sequence models.

    Python
    Voir sur GitHub↗32,228
  • thuml/time-series-libraryAvatar de thuml

    thuml/Time-Series-Library

    12,494Voir sur GitHub↗

    This PyTorch-based deep learning library provides a framework for analyzing and forecasting temporal data. It implements specialized architectures for time series forecasting, anomaly detection, data imputation, and classification. The project distinguishes itself through the inclusion of zero-shot inference capabilities, allowing large-scale temporal models to be evaluated on unseen datasets without requiring task-specific fine-tuning. The framework covers a broad range of analytical capabilities, including the recovery of missing values in incomplete datasets, the identification of irregul

    Provides standardized scripts and methods for measuring the accuracy of sequence learning models across datasets.

    Python
    Voir sur GitHub↗12,494
  • lyhue1991/eat_tensorflow2_in_30_daysAvatar de lyhue1991

    lyhue1991/eat_tensorflow2_in_30_days

    9,933Voir sur GitHub↗

    This project is a structured learning curriculum and technical reference for mastering deep learning with TensorFlow. It provides a comprehensive guide for building, training, and deploying neural networks, combining theoretical fundamentals with practical implementation examples. The repository distinguishes itself by covering the end-to-end machine learning workflow, from low-level tensor mathematics and linear algebra to the creation of complex model architectures. It includes specific guidance on developing data pipelines for diverse data types, such as images, text, and time-series seque

    Implements custom evaluation metrics by extending base metric classes to meet specific project requirements.

    Pythontensorflowtensorflow-examplestensorflow-tutorial
    Voir sur GitHub↗9,933
  • open-mmlab/mmsegmentationAvatar de open-mmlab

    open-mmlab/mmsegmentation

    9,860Voir sur GitHub↗

    MMSegmentation is an open-source semantic segmentation toolbox built on PyTorch that provides a modular, configurable framework for building, training, evaluating, and deploying segmentation models. At its core, it offers a config-driven pipeline that assembles training, evaluation, and inference workflows by parsing hierarchical configuration files, with a modular component registry that enables plug-and-play composition of neural network modules, optimizers, datasets, and metrics. The framework supports the full model lifecycle through a unified runner interface that controls training, testi

    Allows users to create new evaluation metrics by subclassing a base metric class and implementing custom computation logic.

    Pythondeeplabv3image-segmentationmedical-image-segmentation
    Voir sur GitHub↗9,860
  • google/adk-samplesAvatar de google

    google/adk-samples

    8,476Voir sur GitHub↗

    This project provides a collection of reference implementations, architectural patterns, and SDK samples for building autonomous agents using large language models. It serves as a multi-language framework for implementing and deploying specialized AI agents across diverse programming environments. The system centers on an orchestration framework that combines deterministic code with adaptive reasoning through structured graph workflows. It utilizes schema-driven integration to connect agents with third-party applications and diverse AI models. The development lifecycle is supported by toolki

    Provides methods for measuring agent reliability by comparing execution outputs against quality benchmarks.

    Pythonadkagent-samplesagents
    Voir sur GitHub↗8,476
  • deepmipt/deeppavlovAvatar de deepmipt

    deepmipt/DeepPavlov

    6,986Voir sur GitHub↗

    DeepPavlov is a deep learning conversational AI framework designed for building end-to-end dialog systems and chatbots. It functions as an NLP model training library and a pipeline system that connects multiple natural language processing models into a single operational chain. The framework provides a REST API model server to expose trained deep learning models as web endpoints. This allows conversational agents to be deployed as web services that handle incoming HTTP requests and return predictions. The system covers the full lifecycle of conversational AI development, including NLP pipeli

    Ships tools to measure the accuracy and quality of generated responses against gold-standard datasets.

    Python
    Voir sur GitHub↗6,986
  • open-compass/opencompassAvatar de open-compass

    open-compass/opencompass

    6,678Voir sur GitHub↗

    OpenCompass is an open-source framework for standardized benchmarking of large language models. It provides a configurable evaluation pipeline that supports both objective and subjective assessment, using a dual-engine architecture to handle closed-form answer comparison and open-ended response rating. The framework is designed as a modular platform where datasets, models, and metrics are composed through declarative YAML configuration files. The framework distinguishes itself through its extensible model integration layer, which supports custom models, HuggingFace models, and third-party API

    Allows configuring custom scoring functions and post-processing steps for each evaluation dataset.

    Pythonbenchmarkchatgptevaluation
    Voir sur GitHub↗6,678
  • facebookresearch/mmfAvatar de facebookresearch

    facebookresearch/mmf

    5,635Voir sur GitHub↗

    MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a configuration-driven experiment system where model, dataset, and training parameters are defined through composable YAML files, alongside a curated model zoo of pretrained checkpoints for state-of-the-art multimodal architectures. The framework includes a multimodal dataset loader that downloads, processes, and batches vision-and-language data, and a vision-language model trainer supporting distributed training, mixed precision, and checkpoint-based resumption. The framework distinguish

    Specifies which metrics to compute during evaluation by listing their registered keys in the configuration file.

    Pythoncaptioningdeep-learningdialog
    Voir sur GitHub↗5,635
  • awslabs/gluontsAvatar de awslabs

    awslabs/gluonts

    5,199Voir sur GitHub↗

    GluonTS est une bibliothèque de séries temporelles probabilistes et un framework de prévision par deep learning. Il fournit une boîte à outils pour construire, entraîner et évaluer des architectures de réseau neuronal qui prédisent les valeurs futures sous forme de distributions de probabilité pour quantifier l'incertitude. Le projet se distingue en prenant en charge la prévision zero-shot et en intégrant diverses approches de modélisation, y compris les réseaux neuronaux probabilistes profonds et des wrappers pour des bibliothèques statistiques externes telles que Prophet et R forecast. Il implémente des primitives architecturales spécialisées comme les convolutions causales et les réseaux résiduels inversibles pour empêcher la fuite d'informations et mapper les représentations latentes en distributions de probabilité valides. Le framework couvre une surface d'ingénierie de données complète, y compris la mise à l'échelle des séries temporelles, les transformations bijectives et la modélisation hiérarchique. Il utilise Apache Arrow et Parquet pour la diffusion d'ensembles de données haute performance et la gestion de l'accès aléatoire. Pour l'évaluation des modèles, il inclut une suite d'évaluation pour mesurer la précision des prévisions et la couverture probabiliste en utilisant des métriques comme la perte quantile et les scores de probabilité de rang continu. La bibliothèque prend en charge le déploiement de modèles via l'intégration avec Amazon SageMaker.

    Provides mechanisms to compose multiple simple evaluation metrics into a single derived metric.

    Pythonartificial-intelligenceawsdata-science
    Voir sur GitHub↗5,199
  • awslabs/gluon-tsAvatar de awslabs

    awslabs/gluon-ts

    5,200Voir sur GitHub↗

    GluonTS est un framework pour la prévision probabiliste de séries temporelles, conçu pour prédire les valeurs futures sous forme de distributions de probabilité avec des intervalles de confiance. Il prend en charge à la fois l'entraînement de modèle traditionnel et la prévision zero-shot, où des modèles pré-entraînés génèrent des prédictions pour de nouvelles séries sans entraînement supplémentaire. Le projet se distingue en intégrant une grande variété d'approches de prévision dans un flux de travail unifié. Cela inclut des architectures de deep learning telles que les réseaux neuronaux récurrents et les convolutions causales, ainsi que l'intégration de modèles statistiques externes, la bibliothèque Prophet et les packages R. La boîte à outils fournit une surface complète pour l'ingénierie des données de séries temporelles, couvrant la mise à l'échelle des ensembles de données, la division et la transformation des données temporelles brutes en tenseurs. Elle inclut également une suite d'outils d'évaluation pour mesurer la précision des prévisions et les intervalles d'incertitude, ainsi que des utilitaires pour la persistance des ensembles de données utilisant des formats comme Arrow et Parquet. Le framework prend en charge le déploiement de modèles de prévision au sein de l'infrastructure cloud.

    Allows building evaluation measures by combining simple metrics and applying custom post-processing functions.

    Python
    Voir sur GitHub↗5,200
  • open-mmlab/mmocrAvatar de open-mmlab

    open-mmlab/mmocr

    4,739Voir sur GitHub↗

    mmocr est un framework de reconnaissance optique de caractères (OCR) basé sur PyTorch conçu pour entraîner et déployer des modèles de détection de texte, de reconnaissance et d'extraction d'informations clés. Il sert de boîte à outils complète pour la détection et la reconnaissance de texte dans les scènes, fournissant des bibliothèques spécialisées pour localiser les régions de texte et convertir le texte visuel en chaînes encodées par machine. Le projet se distingue par un framework de recherche pour l'extraction d'informations clés et des capacités avancées de repérage de texte. Celles-ci incluent le repérage basé sur des points utilisant des transformers et l'utilisation de courbes de Bezier paramétrées pour identifier et transcrire du texte de forme arbitraire. Le framework couvre une large surface de capacités de vision par ordinateur, notamment la gestion de pipeline de données pour augmenter et standardiser divers jeux de données OCR, l'entraînement de modèles avec mise à l'échelle distribuée et l'évaluation des performances utilisant des métriques OCR standard. Il fournit également des utilitaires pour la manipulation de polygones géométriques et la visualisation des résultats pour auditer les prédictions par rapport aux annotations de vérité terrain. Le système est implémenté en Python et prend en charge l'installation via l'empaquetage d'environnement Docker.

    Allows for the creation of new evaluation metrics by subclassing a base metric class and implementing custom logic.

    Pythonabcnetabinetcrnn
    Voir sur GitHub↗4,739
  • snowkylin/tensorflow-handbookAvatar de snowkylin

    snowkylin/tensorflow-handbook

    3,927Voir sur GitHub↗

    Ce projet est une ressource pédagogique complète et un manuel de tutoriels pour construire, entraîner et déployer des modèles de machine learning avec TensorFlow 2. Il sert de guide d'apprentissage structuré couvrant les concepts fondamentaux du deep learning, notamment les architectures de réseaux de neurones, la différenciation automatique et les opérations sur les tenseurs. Le manuel fournit des conseils techniques pour optimiser l'efficacité de l'exécution via la gestion de la mémoire GPU, l'entraînement distribué et la quantification de modèles. Il inclut également des guides détaillés pour construire des pipelines de données haute performance et exporter des modèles vers des serveurs de production, des appareils mobiles et des navigateurs web. Le contenu couvre un large éventail de capacités, incluant le développement de modèles avec des réseaux convolutifs et récurrents, l'implémentation de fonctions de perte et de couches personnalisées, ainsi que l'utilisation de modèles pré-entraînés pour le transfer learning. Il aborde également les stratégies de déploiement pour les appareils edge et l'utilisation d'environnements d'exécution cloud pour l'accélération matérielle. La ressource est implémentée sous forme d'une collection de Jupyter Notebooks.

    Explains how to create new evaluation metrics by subclassing a base metric class and implementing state updates.

    Jupyter Notebook
    Voir sur GitHub↗3,927
  • zzw922cn/automatic_speech_recognitionAvatar de zzw922cn

    zzw922cn/Automatic_Speech_Recognition

    2,834Voir sur GitHub↗

    Ce projet est une boîte à outils de machine learning conçue pour le développement, l'entraînement et le déploiement de moteurs de reconnaissance vocale automatique. Il fournit un framework complet pour convertir l'audio parlé en texte écrit, prenant spécifiquement en charge les modèles entraînés sur des jeux de données en mandarin et en anglais. La bibliothèque utilise une architecture neuronale de bout en bout qui traite l'entrée audio brute directement en séquences de caractères, contournant le besoin d'alignement linguistique intermédiaire. Elle intègre des techniques de traitement du signal pour transformer les ondes sonores en spectrogrammes numériques et en vecteurs de caractéristiques, qui sont ensuite utilisés pour entraîner des modèles acoustiques via des cycles d'apprentissage itératifs accélérés par le matériel. La boîte à outils inclut une suite complète d'utilitaires pour gérer le cycle de vie du modèle, y compris le prétraitement des données, la persistance de l'état basée sur des checkpoints et l'évaluation des performances. Les utilisateurs peuvent évaluer la qualité de la transcription en calculant des métriques telles que la distance d'édition de phonèmes par rapport aux étiquettes de vérité terrain pour quantifier la précision de la conversion parole-texte.

    Measures transcription quality by calculating edit distance metrics between predicted character sequences and ground truth labels.

    Pythonaudioautomatic-speech-recognitionchinese-speech-recognition
    Voir sur GitHub↗2,834
  1. Home
  2. Artificial Intelligence & ML
  3. Sequence Learning Models
  4. Evaluation Metrics

Explorer les sous-tags

  • Custom Metric ImplementationsCreates new evaluation metrics by subclassing a base metric class and implementing process, compute, and evaluate methods. **Distinct from Evaluation Metrics:** Distinct from Evaluation Metrics: focuses on the extensibility mechanism for defining new metrics, not the metrics themselves.
  • Per-Dataset Metric Configurators1 sous-tagMechanisms for defining custom scoring functions and post-processing steps per evaluation dataset. **Distinct from Evaluation Metrics:** Distinct from Evaluation Metrics: focuses on per-dataset configuration of metrics rather than general metric calculation.