13 dépôts
Methods and scripts for measuring the performance and accuracy of sequence learning models.
Distinct from Sequence Learning Models: Focuses on the evaluation process and metrics rather than the model architectures themselves
Explore 13 awesome GitHub repositories matching artificial intelligence & ml · Evaluation Metrics. Refine with filters or upvote what's useful.
Fairseq is a PyTorch toolkit for sequence-to-sequence modeling, specializing in neural machine translation, automatic speech recognition, and large-scale language model training. It provides a framework for processing and aligning diverse data sources, including text, audio, and video, to support tasks such as speech-to-text conversion and multimodal sequence learning. The project is distinguished by its distributed training capabilities, which utilize parameter sharding, mixed-precision training, and CPU offloading to handle models that exceed single-device memory. It also includes specializ
Provides standardized accuracy and quality metrics to evaluate the performance of trained sequence-to-sequence models.
This PyTorch-based deep learning library provides a framework for analyzing and forecasting temporal data. It implements specialized architectures for time series forecasting, anomaly detection, data imputation, and classification. The project distinguishes itself through the inclusion of zero-shot inference capabilities, allowing large-scale temporal models to be evaluated on unseen datasets without requiring task-specific fine-tuning. The framework covers a broad range of analytical capabilities, including the recovery of missing values in incomplete datasets, the identification of irregul
Provides standardized scripts and methods for measuring the accuracy of sequence learning models across datasets.
This project is a structured learning curriculum and technical reference for mastering deep learning with TensorFlow. It provides a comprehensive guide for building, training, and deploying neural networks, combining theoretical fundamentals with practical implementation examples. The repository distinguishes itself by covering the end-to-end machine learning workflow, from low-level tensor mathematics and linear algebra to the creation of complex model architectures. It includes specific guidance on developing data pipelines for diverse data types, such as images, text, and time-series seque
Implements custom evaluation metrics by extending base metric classes to meet specific project requirements.
MMSegmentation is an open-source semantic segmentation toolbox built on PyTorch that provides a modular, configurable framework for building, training, evaluating, and deploying segmentation models. At its core, it offers a config-driven pipeline that assembles training, evaluation, and inference workflows by parsing hierarchical configuration files, with a modular component registry that enables plug-and-play composition of neural network modules, optimizers, datasets, and metrics. The framework supports the full model lifecycle through a unified runner interface that controls training, testi
Allows users to create new evaluation metrics by subclassing a base metric class and implementing custom computation logic.
This project provides a collection of reference implementations, architectural patterns, and SDK samples for building autonomous agents using large language models. It serves as a multi-language framework for implementing and deploying specialized AI agents across diverse programming environments. The system centers on an orchestration framework that combines deterministic code with adaptive reasoning through structured graph workflows. It utilizes schema-driven integration to connect agents with third-party applications and diverse AI models. The development lifecycle is supported by toolki
Provides methods for measuring agent reliability by comparing execution outputs against quality benchmarks.
DeepPavlov is a deep learning conversational AI framework designed for building end-to-end dialog systems and chatbots. It functions as an NLP model training library and a pipeline system that connects multiple natural language processing models into a single operational chain. The framework provides a REST API model server to expose trained deep learning models as web endpoints. This allows conversational agents to be deployed as web services that handle incoming HTTP requests and return predictions. The system covers the full lifecycle of conversational AI development, including NLP pipeli
Ships tools to measure the accuracy and quality of generated responses against gold-standard datasets.
OpenCompass is an open-source framework for standardized benchmarking of large language models. It provides a configurable evaluation pipeline that supports both objective and subjective assessment, using a dual-engine architecture to handle closed-form answer comparison and open-ended response rating. The framework is designed as a modular platform where datasets, models, and metrics are composed through declarative YAML configuration files. The framework distinguishes itself through its extensible model integration layer, which supports custom models, HuggingFace models, and third-party API
Allows configuring custom scoring functions and post-processing steps for each evaluation dataset.
MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a configuration-driven experiment system where model, dataset, and training parameters are defined through composable YAML files, alongside a curated model zoo of pretrained checkpoints for state-of-the-art multimodal architectures. The framework includes a multimodal dataset loader that downloads, processes, and batches vision-and-language data, and a vision-language model trainer supporting distributed training, mixed precision, and checkpoint-based resumption. The framework distinguish
Specifies which metrics to compute during evaluation by listing their registered keys in the configuration file.
GluonTS est une bibliothèque de séries temporelles probabilistes et un framework de prévision par deep learning. Il fournit une boîte à outils pour construire, entraîner et évaluer des architectures de réseau neuronal qui prédisent les valeurs futures sous forme de distributions de probabilité pour quantifier l'incertitude. Le projet se distingue en prenant en charge la prévision zero-shot et en intégrant diverses approches de modélisation, y compris les réseaux neuronaux probabilistes profonds et des wrappers pour des bibliothèques statistiques externes telles que Prophet et R forecast. Il implémente des primitives architecturales spécialisées comme les convolutions causales et les réseaux résiduels inversibles pour empêcher la fuite d'informations et mapper les représentations latentes en distributions de probabilité valides. Le framework couvre une surface d'ingénierie de données complète, y compris la mise à l'échelle des séries temporelles, les transformations bijectives et la modélisation hiérarchique. Il utilise Apache Arrow et Parquet pour la diffusion d'ensembles de données haute performance et la gestion de l'accès aléatoire. Pour l'évaluation des modèles, il inclut une suite d'évaluation pour mesurer la précision des prévisions et la couverture probabiliste en utilisant des métriques comme la perte quantile et les scores de probabilité de rang continu. La bibliothèque prend en charge le déploiement de modèles via l'intégration avec Amazon SageMaker.
Provides mechanisms to compose multiple simple evaluation metrics into a single derived metric.
GluonTS est un framework pour la prévision probabiliste de séries temporelles, conçu pour prédire les valeurs futures sous forme de distributions de probabilité avec des intervalles de confiance. Il prend en charge à la fois l'entraînement de modèle traditionnel et la prévision zero-shot, où des modèles pré-entraînés génèrent des prédictions pour de nouvelles séries sans entraînement supplémentaire. Le projet se distingue en intégrant une grande variété d'approches de prévision dans un flux de travail unifié. Cela inclut des architectures de deep learning telles que les réseaux neuronaux récurrents et les convolutions causales, ainsi que l'intégration de modèles statistiques externes, la bibliothèque Prophet et les packages R. La boîte à outils fournit une surface complète pour l'ingénierie des données de séries temporelles, couvrant la mise à l'échelle des ensembles de données, la division et la transformation des données temporelles brutes en tenseurs. Elle inclut également une suite d'outils d'évaluation pour mesurer la précision des prévisions et les intervalles d'incertitude, ainsi que des utilitaires pour la persistance des ensembles de données utilisant des formats comme Arrow et Parquet. Le framework prend en charge le déploiement de modèles de prévision au sein de l'infrastructure cloud.
Allows building evaluation measures by combining simple metrics and applying custom post-processing functions.
mmocr est un framework de reconnaissance optique de caractères (OCR) basé sur PyTorch conçu pour entraîner et déployer des modèles de détection de texte, de reconnaissance et d'extraction d'informations clés. Il sert de boîte à outils complète pour la détection et la reconnaissance de texte dans les scènes, fournissant des bibliothèques spécialisées pour localiser les régions de texte et convertir le texte visuel en chaînes encodées par machine. Le projet se distingue par un framework de recherche pour l'extraction d'informations clés et des capacités avancées de repérage de texte. Celles-ci incluent le repérage basé sur des points utilisant des transformers et l'utilisation de courbes de Bezier paramétrées pour identifier et transcrire du texte de forme arbitraire. Le framework couvre une large surface de capacités de vision par ordinateur, notamment la gestion de pipeline de données pour augmenter et standardiser divers jeux de données OCR, l'entraînement de modèles avec mise à l'échelle distribuée et l'évaluation des performances utilisant des métriques OCR standard. Il fournit également des utilitaires pour la manipulation de polygones géométriques et la visualisation des résultats pour auditer les prédictions par rapport aux annotations de vérité terrain. Le système est implémenté en Python et prend en charge l'installation via l'empaquetage d'environnement Docker.
Allows for the creation of new evaluation metrics by subclassing a base metric class and implementing custom logic.
Ce projet est une ressource pédagogique complète et un manuel de tutoriels pour construire, entraîner et déployer des modèles de machine learning avec TensorFlow 2. Il sert de guide d'apprentissage structuré couvrant les concepts fondamentaux du deep learning, notamment les architectures de réseaux de neurones, la différenciation automatique et les opérations sur les tenseurs. Le manuel fournit des conseils techniques pour optimiser l'efficacité de l'exécution via la gestion de la mémoire GPU, l'entraînement distribué et la quantification de modèles. Il inclut également des guides détaillés pour construire des pipelines de données haute performance et exporter des modèles vers des serveurs de production, des appareils mobiles et des navigateurs web. Le contenu couvre un large éventail de capacités, incluant le développement de modèles avec des réseaux convolutifs et récurrents, l'implémentation de fonctions de perte et de couches personnalisées, ainsi que l'utilisation de modèles pré-entraînés pour le transfer learning. Il aborde également les stratégies de déploiement pour les appareils edge et l'utilisation d'environnements d'exécution cloud pour l'accélération matérielle. La ressource est implémentée sous forme d'une collection de Jupyter Notebooks.
Explains how to create new evaluation metrics by subclassing a base metric class and implementing state updates.
Ce projet est une boîte à outils de machine learning conçue pour le développement, l'entraînement et le déploiement de moteurs de reconnaissance vocale automatique. Il fournit un framework complet pour convertir l'audio parlé en texte écrit, prenant spécifiquement en charge les modèles entraînés sur des jeux de données en mandarin et en anglais. La bibliothèque utilise une architecture neuronale de bout en bout qui traite l'entrée audio brute directement en séquences de caractères, contournant le besoin d'alignement linguistique intermédiaire. Elle intègre des techniques de traitement du signal pour transformer les ondes sonores en spectrogrammes numériques et en vecteurs de caractéristiques, qui sont ensuite utilisés pour entraîner des modèles acoustiques via des cycles d'apprentissage itératifs accélérés par le matériel. La boîte à outils inclut une suite complète d'utilitaires pour gérer le cycle de vie du modèle, y compris le prétraitement des données, la persistance de l'état basée sur des checkpoints et l'évaluation des performances. Les utilisateurs peuvent évaluer la qualité de la transcription en calculant des métriques telles que la distance d'édition de phonèmes par rapport aux étiquettes de vérité terrain pour quantifier la précision de la conversion parole-texte.
Measures transcription quality by calculating edit distance metrics between predicted character sequences and ground truth labels.