awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

13 repositorios

Awesome GitHub RepositoriesEvaluation Metrics

Methods and scripts for measuring the performance and accuracy of sequence learning models.

Distinct from Sequence Learning Models: Focuses on the evaluation process and metrics rather than the model architectures themselves

Explore 13 awesome GitHub repositories matching artificial intelligence & ml · Evaluation Metrics. Refine with filters or upvote what's useful.

Awesome Evaluation Metrics GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • facebookresearch/fairseqAvatar de facebookresearch

    facebookresearch/fairseq

    32,228Ver en GitHub↗

    Fairseq is a PyTorch toolkit for sequence-to-sequence modeling, specializing in neural machine translation, automatic speech recognition, and large-scale language model training. It provides a framework for processing and aligning diverse data sources, including text, audio, and video, to support tasks such as speech-to-text conversion and multimodal sequence learning. The project is distinguished by its distributed training capabilities, which utilize parameter sharding, mixed-precision training, and CPU offloading to handle models that exceed single-device memory. It also includes specializ

    Provides standardized accuracy and quality metrics to evaluate the performance of trained sequence-to-sequence models.

    Python
    Ver en GitHub↗32,228
  • thuml/time-series-libraryAvatar de thuml

    thuml/Time-Series-Library

    12,494Ver en GitHub↗

    This PyTorch-based deep learning library provides a framework for analyzing and forecasting temporal data. It implements specialized architectures for time series forecasting, anomaly detection, data imputation, and classification. The project distinguishes itself through the inclusion of zero-shot inference capabilities, allowing large-scale temporal models to be evaluated on unseen datasets without requiring task-specific fine-tuning. The framework covers a broad range of analytical capabilities, including the recovery of missing values in incomplete datasets, the identification of irregul

    Provides standardized scripts and methods for measuring the accuracy of sequence learning models across datasets.

    Python
    Ver en GitHub↗12,494
  • lyhue1991/eat_tensorflow2_in_30_daysAvatar de lyhue1991

    lyhue1991/eat_tensorflow2_in_30_days

    9,933Ver en GitHub↗

    This project is a structured learning curriculum and technical reference for mastering deep learning with TensorFlow. It provides a comprehensive guide for building, training, and deploying neural networks, combining theoretical fundamentals with practical implementation examples. The repository distinguishes itself by covering the end-to-end machine learning workflow, from low-level tensor mathematics and linear algebra to the creation of complex model architectures. It includes specific guidance on developing data pipelines for diverse data types, such as images, text, and time-series seque

    Implements custom evaluation metrics by extending base metric classes to meet specific project requirements.

    Pythontensorflowtensorflow-examplestensorflow-tutorial
    Ver en GitHub↗9,933
  • open-mmlab/mmsegmentationAvatar de open-mmlab

    open-mmlab/mmsegmentation

    9,860Ver en GitHub↗

    MMSegmentation is an open-source semantic segmentation toolbox built on PyTorch that provides a modular, configurable framework for building, training, evaluating, and deploying segmentation models. At its core, it offers a config-driven pipeline that assembles training, evaluation, and inference workflows by parsing hierarchical configuration files, with a modular component registry that enables plug-and-play composition of neural network modules, optimizers, datasets, and metrics. The framework supports the full model lifecycle through a unified runner interface that controls training, testi

    Allows users to create new evaluation metrics by subclassing a base metric class and implementing custom computation logic.

    Pythondeeplabv3image-segmentationmedical-image-segmentation
    Ver en GitHub↗9,860
  • google/adk-samplesAvatar de google

    google/adk-samples

    8,476Ver en GitHub↗

    This project provides a collection of reference implementations, architectural patterns, and SDK samples for building autonomous agents using large language models. It serves as a multi-language framework for implementing and deploying specialized AI agents across diverse programming environments. The system centers on an orchestration framework that combines deterministic code with adaptive reasoning through structured graph workflows. It utilizes schema-driven integration to connect agents with third-party applications and diverse AI models. The development lifecycle is supported by toolki

    Provides methods for measuring agent reliability by comparing execution outputs against quality benchmarks.

    Pythonadkagent-samplesagents
    Ver en GitHub↗8,476
  • deepmipt/deeppavlovAvatar de deepmipt

    deepmipt/DeepPavlov

    6,986Ver en GitHub↗

    DeepPavlov is a deep learning conversational AI framework designed for building end-to-end dialog systems and chatbots. It functions as an NLP model training library and a pipeline system that connects multiple natural language processing models into a single operational chain. The framework provides a REST API model server to expose trained deep learning models as web endpoints. This allows conversational agents to be deployed as web services that handle incoming HTTP requests and return predictions. The system covers the full lifecycle of conversational AI development, including NLP pipeli

    Ships tools to measure the accuracy and quality of generated responses against gold-standard datasets.

    Python
    Ver en GitHub↗6,986
  • open-compass/opencompassAvatar de open-compass

    open-compass/opencompass

    6,678Ver en GitHub↗

    OpenCompass is an open-source framework for standardized benchmarking of large language models. It provides a configurable evaluation pipeline that supports both objective and subjective assessment, using a dual-engine architecture to handle closed-form answer comparison and open-ended response rating. The framework is designed as a modular platform where datasets, models, and metrics are composed through declarative YAML configuration files. The framework distinguishes itself through its extensible model integration layer, which supports custom models, HuggingFace models, and third-party API

    Allows configuring custom scoring functions and post-processing steps for each evaluation dataset.

    Pythonbenchmarkchatgptevaluation
    Ver en GitHub↗6,678
  • facebookresearch/mmfAvatar de facebookresearch

    facebookresearch/mmf

    5,635Ver en GitHub↗

    MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a configuration-driven experiment system where model, dataset, and training parameters are defined through composable YAML files, alongside a curated model zoo of pretrained checkpoints for state-of-the-art multimodal architectures. The framework includes a multimodal dataset loader that downloads, processes, and batches vision-and-language data, and a vision-language model trainer supporting distributed training, mixed precision, and checkpoint-based resumption. The framework distinguish

    Specifies which metrics to compute during evaluation by listing their registered keys in the configuration file.

    Pythoncaptioningdeep-learningdialog
    Ver en GitHub↗5,635
  • awslabs/gluontsAvatar de awslabs

    awslabs/gluonts

    5,199Ver en GitHub↗

    GluonTS es una librería de series temporales probabilísticas y framework de pronóstico de aprendizaje profundo. Proporciona un kit de herramientas para construir, entrenar y evaluar arquitecturas de redes neuronales que predicen valores futuros como distribuciones de probabilidad para cuantificar la incertidumbre. El proyecto se distingue por soportar el pronóstico zero-shot e integrar diversos enfoques de modelado, incluyendo redes neuronales probabilísticas profundas y envoltorios para librerías estadísticas externas como Prophet y R forecast. Implementa primitivas arquitectónicas especializadas como convoluciones causales y redes residuales invertibles para prevenir la fuga de información y mapear representaciones latentes en distribuciones de probabilidad válidas. El framework cubre una superficie de ingeniería de datos integral, incluyendo escalado de series temporales, transformaciones biyectivas y modelado jerárquico. Utiliza Apache Arrow y Parquet para el streaming de conjuntos de datos de alto rendimiento y la gestión de acceso aleatorio. Para la evaluación de modelos, incluye una suite de evaluación para medir la precisión del pronóstico y la cobertura probabilística utilizando métricas como la pérdida de cuantiles y puntuaciones de probabilidad de rango continuo. La librería soporta el despliegue de modelos a través de la integración con Amazon SageMaker.

    Provides mechanisms to compose multiple simple evaluation metrics into a single derived metric.

    Pythonartificial-intelligenceawsdata-science
    Ver en GitHub↗5,199
  • awslabs/gluon-tsAvatar de awslabs

    awslabs/gluon-ts

    5,200Ver en GitHub↗

    GluonTS es un framework para el pronóstico probabilístico de series temporales, diseñado para predecir valores futuros como distribuciones de probabilidad con intervalos de confianza. Soporta tanto el entrenamiento de modelos tradicionales como el pronóstico zero-shot, donde modelos preentrenados generan predicciones para nuevas series sin entrenamiento adicional. El proyecto se distingue por integrar una amplia variedad de enfoques de pronóstico en un flujo de trabajo unificado. Esto incluye arquitecturas de aprendizaje profundo como redes neuronales recurrentes y convoluciones causales, así como la integración de modelos estadísticos externos, la librería Prophet y paquetes de R. El kit de herramientas proporciona una superficie integral para la ingeniería de datos de series temporales, cubriendo el escalado de conjuntos de datos, la división y la transformación de datos temporales sin procesar en tensores. También incluye un conjunto de herramientas de evaluación para medir la precisión del pronóstico y los intervalos de incertidumbre, así como utilidades para la persistencia de conjuntos de datos utilizando formatos como Arrow y Parquet. El framework soporta el despliegue de modelos de pronóstico dentro de la infraestructura en la nube.

    Allows building evaluation measures by combining simple metrics and applying custom post-processing functions.

    Python
    Ver en GitHub↗5,200
  • open-mmlab/mmocrAvatar de open-mmlab

    open-mmlab/mmocr

    4,739Ver en GitHub↗

    mmocr es un framework de reconocimiento óptico de caracteres basado en PyTorch diseñado para entrenar y desplegar modelos de detección de texto, reconocimiento y extracción de información clave. Sirve como una caja de herramientas integral para la detección y reconocimiento de texto en escenas, proporcionando bibliotecas especializadas para localizar regiones de texto y convertir texto visual en cadenas codificadas por máquina. El proyecto se distingue por un framework de investigación para la extracción de información clave y capacidades avanzadas de detección de texto. Estas incluyen la detección basada en puntos utilizando transformers y el uso de curvas de Bezier parametrizadas para identificar y transcribir texto con formas arbitrarias. El framework cubre una amplia superficie de capacidades de visión artificial, incluyendo la gestión de pipelines de datos para aumentar y estandarizar diversos conjuntos de datos OCR, entrenamiento de modelos con escalado distribuido y evaluación del rendimiento utilizando métricas OCR estándar. También proporciona utilidades para la manipulación de polígonos geométricos y visualización de resultados para auditar predicciones contra anotaciones de verdad fundamental. El sistema está implementado en Python y admite la instalación mediante empaquetado de entorno Docker.

    Allows for the creation of new evaluation metrics by subclassing a base metric class and implementing custom logic.

    Pythonabcnetabinetcrnn
    Ver en GitHub↗4,739
  • snowkylin/tensorflow-handbookAvatar de snowkylin

    snowkylin/tensorflow-handbook

    3,927Ver en GitHub↗

    Este proyecto es un recurso educativo integral y un manual de tutoriales para construir, entrenar y desplegar modelos de machine learning usando TensorFlow 2. Sirve como una guía de aprendizaje estructurada que cubre conceptos fundamentales de deep learning, incluyendo arquitecturas de redes neuronales, diferenciación automática y operaciones con tensores. El manual proporciona orientación técnica sobre cómo optimizar la eficiencia de ejecución mediante la gestión de memoria de GPU, entrenamiento distribuido y cuantización de modelos. También incluye guías detalladas para construir pipelines de datos de alto rendimiento y exportar modelos para servidores de producción, dispositivos móviles y navegadores web. El material abarca una amplia gama de capacidades, incluyendo el desarrollo de modelos con redes convolucionales y recurrentes, la implementación de funciones de pérdida y capas personalizadas, y el uso de modelos preentrenados para transfer learning. También aborda estrategias de despliegue para dispositivos edge y el uso de entornos de ejecución en la nube para aceleración por hardware. El recurso está implementado como una colección de Jupyter Notebooks.

    Explains how to create new evaluation metrics by subclassing a base metric class and implementing state updates.

    Jupyter Notebook
    Ver en GitHub↗3,927
  • zzw922cn/automatic_speech_recognitionAvatar de zzw922cn

    zzw922cn/Automatic_Speech_Recognition

    2,834Ver en GitHub↗

    Este proyecto es un kit de herramientas de machine learning diseñado para el desarrollo, entrenamiento y despliegue de motores de reconocimiento automático de voz. Proporciona un framework integral para convertir audio hablado en texto escrito, soportando específicamente modelos entrenados en datasets de mandarín e inglés. La librería utiliza una arquitectura neuronal end-to-end que procesa la entrada de audio cruda directamente en secuencias de caracteres, evitando la necesidad de una alineación lingüística intermedia. Incorpora técnicas de procesamiento de señales para transformar ondas sonoras en espectrogramas numéricos y vectores de características, que luego se utilizan para entrenar modelos acústicos a través de ciclos de aprendizaje iterativos acelerados por hardware. El kit de herramientas incluye un conjunto completo de utilidades para gestionar el ciclo de vida del modelo, incluyendo preprocesamiento de datos, persistencia de estado basada en puntos de control y evaluación de rendimiento. Los usuarios pueden evaluar la calidad de la transcripción calculando métricas como la distancia de edición de fonemas frente a etiquetas de verdad fundamental para cuantificar la precisión de la conversión de voz a texto.

    Measures transcription quality by calculating edit distance metrics between predicted character sequences and ground truth labels.

    Pythonaudioautomatic-speech-recognitionchinese-speech-recognition
    Ver en GitHub↗2,834
  1. Home
  2. Artificial Intelligence & ML
  3. Sequence Learning Models
  4. Evaluation Metrics

Explorar subetiquetas

  • Custom Metric ImplementationsCreates new evaluation metrics by subclassing a base metric class and implementing process, compute, and evaluate methods. **Distinct from Evaluation Metrics:** Distinct from Evaluation Metrics: focuses on the extensibility mechanism for defining new metrics, not the metrics themselves.
  • Per-Dataset Metric Configurators1 sub-etiquetaMechanisms for defining custom scoring functions and post-processing steps per evaluation dataset. **Distinct from Evaluation Metrics:** Distinct from Evaluation Metrics: focuses on per-dataset configuration of metrics rather than general metric calculation.