awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

18 repositorios

Awesome GitHub RepositoriesModel Evaluation Metrics

Visualization and analysis tools for quantitative model performance metrics like precision-recall curves.

Distinct from Context Recall Evaluators: Candidates relate to information retrieval recall or financial yield curves, not machine learning classification performance metrics.

Explore 18 awesome GitHub repositories matching artificial intelligence & ml · Model Evaluation Metrics. Refine with filters or upvote what's useful.

Awesome Model Evaluation Metrics GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • datatalksclub/machine-learning-zoomcampAvatar de DataTalksClub

    DataTalksClub/machine-learning-zoomcamp

    13,318Ver en GitHub↗

    This project is a structured educational program and machine learning engineering course. It provides a comprehensive curriculum and learning path focused on data science, the development of predictive models, and the operational aspects of MLOps. The instructional material covers the full machine learning lifecycle, moving from basic data engineering to production deployment. This includes guides on wrapping models in APIs, utilizing container-based packaging, and implementing serverless architectures to host models in cloud environments. The program encompasses technical training in predic

    Teaches how to measure model quality using precision-recall curves to handle data class imbalances.

    Jupyter Notebook
    Ver en GitHub↗13,318
  • jack-cherish/machine-learningAvatar de Jack-Cherish

    Jack-Cherish/Machine-Learning

    10,333Ver en GitHub↗

    This project is a collection of supervised and unsupervised machine learning algorithms implemented from scratch using Python. It serves as an educational resource for studying model training, parameter optimization, and the implementation of core predictive models. The library provides a variety of supervised learning tools, including linear and logistic regression, decision trees, and support vector machines. It also features unsupervised learning capabilities for discovering patterns in unlabeled datasets through clustering algorithms. Broad capability areas include ensemble learning thro

    Implements model evaluation metrics including confusion matrices, precision, recall, and ROC curves.

    Pythonadaboostadaboost-algorithmdecision-tree
    Ver en GitHub↗10,333
  • priorlabs/tabpfnAvatar de PriorLabs

    PriorLabs/TabPFN

    7,408Ver en GitHub↗

    TabPFN chooses a binary or multi-class metric such as ROC-AUC, PR-AUC, or log loss that matches the real-world consequences of prediction errors.

    Pythondata-sciencefoundation-modelsmachine-learning
    Ver en GitHub↗7,408
  • tensorflow/tensorboardAvatar de tensorflow

    tensorflow/tensorboard

    7,193Ver en GitHub↗

    TensorBoard is a visualization toolkit for tracking and analyzing machine learning model training progress and performance using TensorFlow event logs. It provides a monitoring dashboard for plotting scalar metrics, tensor distributions, and training curves, and includes specialized tools for visualizing neural network computational graphs and projecting high-dimensional embeddings. The project enables side-by-side comparison of multiple training runs to analyze the impact of hyperparameters on model outcomes. It also features a high-dimensional embedding projector and a graph visualizer for

    Displays precision-recall curves by class to evaluate the performance of multi-class classification models.

    TypeScript
    Ver en GitHub↗7,193
  • open-mmlab/mmdetection3dAvatar de open-mmlab

    open-mmlab/mmdetection3d

    6,273Ver en GitHub↗

    MMDetection3D is an open-source toolbox for 3D perception, providing a unified framework for detecting and segmenting objects in three-dimensional environments. It supports a range of core tasks including monocular 3D object detection from single camera images, LiDAR-based 3D object detection from raw point clouds, and multi-modal fusion that combines camera images with LiDAR data. The toolbox also covers point cloud semantic segmentation, assigning class labels to every point in a scan for scene understanding. The project distinguishes itself through a config-driven pipeline that orchestrate

    Run a trained model on the KITTI test set and compute mean Average Precision and Average Orientation Similarity metrics.

    Python3d-object-detectionobject-detectionpoint-cloud
    Ver en GitHub↗6,273
  • mrdbourke/zero-to-mastery-mlAvatar de mrdbourke

    mrdbourke/zero-to-mastery-ml

    5,839Ver en GitHub↗

    Este proyecto es un currículo educativo de machine learning y plataforma de aprendizaje entregada a través de Jupyter Notebooks interactivos. Sirve como una guía completa para dominar el toolkit de ciencia de datos de Python, proporcionando tutoriales estructurados para computación numérica, manipulación de datos tabulares y visualización estadística. El currículo incluye guías de implementación específicas para Scikit-Learn y un curso práctico sobre TensorFlow para construir, entrenar y desplegar redes neuronales y modelos de visión artificial. Cubre el proceso de extremo a extremo de construcción de modelos predictivos, desde la formulación inicial del problema y categorización de tareas hasta el despliegue de modelos mediante interfaces web interactivas. El proyecto cubre una amplia superficie de capacidades incluyendo computación numérica con arrays multidimensionales, análisis exploratorio de datos y rutinas de preprocesamiento de datos. Proporciona flujos de trabajo detallados para aprendizaje supervisado y no supervisado, pipelines de machine learning automatizado, optimización de hiperparámetros y evaluación de modelos utilizando métricas de clasificación y validación cruzada. El contenido educativo está organizado como una serie de notebooks que intercalan código Python con explicaciones narrativas para documentar flujos de trabajo de ciencia de datos.

    Uses ROC curves, AUC scores, and confusion matrices to quantitatively analyze model performance.

    Jupyter Notebookdata-sciencedeep-learningmachine-learning
    Ver en GitHub↗5,839
  • helicone/heliconeAvatar de Helicone

    Helicone/helicone

    5,830Ver en GitHub↗

    Helicone is an AI gateway and observability platform designed to intercept, manage, and monitor interactions with large language models. By acting as a reverse-proxy, it provides a centralized layer for routing requests across multiple AI providers, allowing developers to maintain consistent application logic while gaining deep visibility into model performance, usage, and costs. The platform distinguishes itself through a robust suite of traffic management and prompt engineering tools. It enables policy-driven control, including automatic failover between providers, rate limiting, and edge-b

    Fetches quantitative performance scores for completed model evaluations to assess the quality and accuracy of AI outputs.

    TypeScript
    Ver en GitHub↗5,830
  • open-edge-platform/anomalibAvatar de open-edge-platform

    open-edge-platform/anomalib

    5,871Ver en GitHub↗

    Anomalib is a PyTorch-based library for visual anomaly detection, offering a modular framework, a comprehensive model zoo, and a benchmarking suite designed for industrial defect detection. It provides a wide range of algorithms—including generative, discriminative, teacher-student, and vision-language approaches—that support unsupervised, few-shot, and zero-shot settings. The library enables deployment through model export to ONNX and OpenVINO for edge devices, and includes a no-code web application for training and inference. It also features a command-line interface for orchestrating multi

    Coordinates computation of multiple evaluation metrics in a single pass for comprehensive performance reporting.

    Pythonanomaly-detectionanomaly-localizationanomaly-segmentation
    Ver en GitHub↗5,871
  • roboflow/rf-detrAvatar de roboflow

    roboflow/rf-detr

    5,643Ver en GitHub↗

    RF-DETR is a Python library for training and deploying object detection, instance segmentation, and keypoint detection models built on a vision transformer architecture. It provides a unified command-line interface and Python API for the full workflow, from fine-tuning pretrained checkpoints on custom datasets to running inference on images, video files, and live camera streams. The project supports training on datasets in COCO or YOLO format, with automatic format detection and configurable augmentation pipelines. Models can be exported to ONNX, TFLite, or TensorRT for deployment across edge

    Computes mAP, precision, recall, and F1 on a validation dataset after each epoch.

    Pythoncomputer-visiondetrinstance-segmentation
    Ver en GitHub↗5,643
  • youssefhosni/data-science-interview-questions-answersAvatar de youssefHosni

    youssefHosni/Data-Science-Interview-Questions-Answers

    5,497Ver en GitHub↗

    This repository is a curated study resource of interview questions and answers for data science roles. It covers the core domains of machine learning, statistics, Python programming, SQL databases, deep learning, and algorithmic problem solving. The content is organized as static Markdown files with a structured question-and-answer format, making it easy to read and navigate without any server-side processing. The material distinguishes itself by pairing each question with a detailed explanation and often a code example, covering both conceptual knowledge and practical application. Topics ran

    Describes evaluation metrics like precision, recall, F1, ROC, and cross-validation to assess model quality.

    data-sciencedeep-learninginterview-questions
    Ver en GitHub↗5,497
  • rasbt/machine-learning-bookAvatar de rasbt

    rasbt/machine-learning-book

    5,239Ver en GitHub↗

    Este proyecto es un recurso educativo integral sobre machine learning y una serie de tutoriales presentados como una colección de Jupyter Notebooks interactivos. Proporciona implementaciones prácticas en Python para el ciclo de vida completo del machine learning, cubriendo aprendizaje supervisado y no supervisado, deep learning y aprendizaje por refuerzo. El recurso destaca por ofrecer guías de implementación detalladas para arquitecturas complejas, incluyendo transformers, redes generativas antagónicas (GAN) y redes neuronales convolucionales. También incluye material especializado para desarrollar agentes de aprendizaje por refuerzo utilizando Q-learning y Deep Q-Networks en entornos simulados. El contenido abarca una amplia gama de capacidades de ciencia de datos, incluyendo pipelines de ingeniería de datos, codificación de características y reducción de dimensionalidad. Proporciona material extenso sobre evaluación de modelos mediante validación cruzada y métricas de diagnóstico, así como temas avanzados como procesamiento de lenguaje natural, análisis de sentimiento e IA generativa. Todo el plan de estudios está diseñado para su ejecución interactiva dentro de Jupyter Notebooks, combinando código ejecutable, texto enriquecido y visualizaciones.

    Implements detailed workflows for assessing model predictive accuracy using cross-validation and various classification metrics.

    Jupyter Notebook
    Ver en GitHub↗5,239
  • rafaelpadilla/object-detection-metricsAvatar de rafaelpadilla

    rafaelpadilla/Object-Detection-Metrics

    5,098Ver en GitHub↗

    This project is an object detection evaluation library and benchmarking tool designed to calculate precision, recall, and average precision for computer vision models. It provides a suite of utilities for parsing bounding box coordinates from text files and calculating spatial overlap to determine detection accuracy. The toolkit features a command line interface for comparing ground truth files against model predictions. It includes a precision-recall curve generator to visualize the relationship between precision and recall across different confidence thresholds and an intersection over unio

    Provides a toolkit for calculating precision, recall, and average precision based on ground truth and bounding box detections.

    Pythonaverage-precisionbounding-boxesmean-average-precision
    Ver en GitHub↗5,098
  • h2oai/h2o-llmstudioAvatar de h2oai

    h2oai/h2o-llmstudio

    4,977Ver en GitHub↗

    h2o-llmstudio es un framework de entrenamiento de modelos de lenguaje que proporciona una interfaz gráfica sin código para ajustar (fine-tuning) modelos de lenguaje grandes en conjuntos de datos personalizados. Funciona como una herramienta especializada para gestionar el ciclo de vida del entrenamiento, desde la configuración de hiperparámetros hasta el monitoreo de métricas de rendimiento. El proyecto se distingue por un orquestador de entrenamiento multi-GPU que distribuye cargas de trabajo a través de procesamiento paralelo de datos y una herramienta de adaptación de bajo rango para un ajuste eficiente en memoria. También incluye un panel de evaluación de modelos con una interfaz de chat interactiva para verificar el rendimiento conversacional y la calidad de la respuesta. La plataforma cubre una amplia superficie de capacidad, incluyendo la preparación de conjuntos de datos con mapeo de esquemas, cuantización de modelos para reducir la huella de memoria y gestión de experimentos para comparar ejecuciones de entrenamiento. También proporciona utilidades para la exportación de modelos locales y la publicación en centros de modelos comunitarios. El sistema incluye una interfaz de línea de comandos para activar experimentos y gestionar archivos de salida dentro de flujos de trabajo automatizados.

    Provides visualization and analysis tools for quantitative model performance metrics to compare different experiments.

    Pythonaichatbotchatgpt
    Ver en GitHub↗4,977
  • blei-lab/edwardAvatar de blei-lab

    blei-lab/edward

    4,841Ver en GitHub↗

    Edward es un lenguaje de programación probabilística y motor de inferencia diseñado para construir modelos generativos profundos y redes neuronales bayesianas. Utiliza el framework TensorFlow para representar modelos probabilísticos como grafos computacionales diferenciables. La librería permite la construcción de distribuciones de datos complejas mediante redes neuronales bayesianas, modelos de mezcla y procesos gaussianos. Se diferencia por ofrecer un kit de herramientas integrado tanto para el modelado probabilístico supervisado como para el no supervisado, incluyendo la implementación de redes generativas antagónicas (GAN) y redes de densidad de mezcla. El framework cubre una amplia gama de métodos de inferencia, incluyendo inferencia variacional amortizada, muestreo de Gibbs y estimación de máximo a posteriori (MAP). También incluye un conjunto completo de herramientas de evaluación de modelos para comprobación predictiva posterior, análisis de residuos y validación de parámetros para diagnosticar el ajuste del modelo y la precisión predictiva. El sistema admite entrenamiento escalable mediante procesamiento por lotes y mini-lotes, con capacidades integradas para monitorear el progreso del entrenamiento y visualizar grafos de ejecución.

    Calculates quantitative metrics such as classification error and mean absolute error to assess trained models.

    Jupyter Notebookbayesian-methodsdata-sciencedeep-learning
    Ver en GitHub↗4,841
  • spandan-madan/deeplearningprojectAvatar de Spandan-Madan

    Spandan-Madan/DeepLearningProject

    4,785Ver en GitHub↗

    Este proyecto es un pipeline de clasificación multietiqueta diseñado para la predicción de géneros. Implementa un flujo de trabajo de aprendizaje automático que asigna múltiples etiquetas de categoría a un solo elemento procesando datos de entrada tanto textuales como visuales. El sistema utiliza extracción de características multimodal para transformar imágenes y descripciones de texto en vectores semánticos. Este proceso incluye el uso de redes preentrenadas para la extracción de características visuales y el promedio de palabras semánticas para el análisis de texto, permitiendo que el modelo integre diferentes tipos de datos en una entrada unificada. El pipeline cubre todo el ciclo de vida del aprendizaje automático, incluyendo la integración de metadatos de conjuntos de datos desde bases de datos externas y la organización de los datos en un pipeline lineal de múltiples etapas. El rendimiento se mide mediante la evaluación de métricas de verdad fundamental utilizando cálculos de precisión y exhaustividad (recall), mientras que las relaciones entre categorías se analizan mediante matrices de coocurrencia por pares.

    Evaluates classification accuracy using precision and recall metrics compared to ground truth labels.

    HTMLdeep-learningmachine-learningneural-networks
    Ver en GitHub↗4,785
  • pytorch/igniteAvatar de pytorch

    pytorch/ignite

    4,770Ver en GitHub↗

    Ignite es un framework de entrenamiento de alto nivel para redes neuronales en PyTorch que sirve como motor de entrenamiento y gestor del ciclo de vida del aprendizaje profundo. Proporciona un sistema estructurado para organizar y automatizar bucles de entrenamiento y evaluación, gestionando iteradores de datos y activando manejadores de eventos en hitos específicos durante el proceso de entrenamiento del modelo. El proyecto se distingue por una suite integral de herramientas para el entrenamiento distribuido y la evaluación de modelos. Incluye utilidades para sincronizar gradientes y coordinar la comunicación colectiva a través de múltiples GPUs o nodos, así como una suite de evaluación para calcular métricas de rendimiento y realizar validación cruzada k-fold. Sus capacidades más amplias cubren la automatización del flujo de trabajo de entrenamiento, incluyendo la programación de la tasa de aprendizaje, parada temprana y optimización de hiperparámetros. El framework también proporciona herramientas de observabilidad para el seguimiento de experimentos, perfilado de tiempo de ejecución y entrenamiento de precisión mixta para optimizar el uso de memoria. Se incluyen mecanismos de persistencia de estado para gestionar checkpoints del modelo y recuperar sesiones de entrenamiento. Hay entornos contenedorizados disponibles para simplificar el despliegue y la configuración del entorno.

    Calculates accuracy and custom performance metrics to quantitatively analyze model effectiveness.

    Python
    Ver en GitHub↗4,770
  • ashishpatel26/andrew-ng-notesAvatar de ashishpatel26

    ashishpatel26/Andrew-NG-Notes

    3,594Ver en GitHub↗

    This project is a collection of structured study notes and notebooks serving as an educational resource for deep learning and neural network fundamentals. It provides a technical reference for implementing machine learning theory, covering everything from basic network design to the construction of advanced architectures. The material specifically focuses on the implementation of convolutional neural networks for computer vision and sequence models for natural language processing. It includes detailed guidance on building object detection systems, face recognition, and speech transcription mo

    Defines quantitative metrics to measure project success and compare different machine learning algorithms.

    Jupyter Notebookandrew-ngandrew-ng-courseandrew-ng-machine-learning
    Ver en GitHub↗3,594
  • huggingface/hub-docsAvatar de huggingface

    huggingface/hub-docs

    506Ver en GitHub↗

    This repository serves as the documentation source for the Hugging Face Hub, a collaborative platform designed for hosting, versioning, and discovering machine learning models, datasets, and interactive applications. It provides the foundational infrastructure for managing machine learning assets through Git-based repositories, which support large file storage, branching, and comprehensive commit history. The platform distinguishes itself by integrating metadata-driven discovery and structured management systems that allow users to attach licensing, task categories, and performance metrics to

    Records standardized performance metrics and evaluation conditions within model cards to provide verifiable benchmarks.

    Handlebarshacktoberfestmachine-learning
    Ver en GitHub↗506
  1. Home
  2. Artificial Intelligence & ML
  3. Model Evaluation Metrics

Explorar subetiquetas

  • 3D Detection Evaluations1 sub-etiquetaRunning trained 3D detection models on test data and computing dataset-specific metrics like mean Average Precision. **Distinct from Model Evaluation Metrics:** Distinct from Model Evaluation Metrics: focuses on executing evaluation pipelines for 3D detection models with dataset-specific protocols, not general metric visualization.
  • Anomaly-Specific MetricsPerformance metrics specifically designed for anomaly detection, such as PRO, sPRO, and PIMO. **Distinct from Model Evaluation Metrics:** Distinct from Model Evaluation Metrics: focuses on metrics unique to anomaly detection, not general classification metrics.
  • Metric WrappersUtilities that wrap third-party metric classes into a custom interface to gain additional awareness of data structures. **Distinct from Model Evaluation Metrics:** Distinct from Model Evaluation Metrics: focuses on the wrapping and adaptation of existing metric implementations rather than the metrics themselves.
  • Multi-Metric OrchestratorsTools that coordinate the computation of several evaluation metrics in a single pass to produce a comprehensive performance report. **Distinct from Model Evaluation Metrics:** Distinct from Model Evaluation Metrics: focuses on orchestrating multiple metrics together in one pass rather than individual metric calculation.
  • Waymo Detection MetricsCompute standard Waymo detection metrics by building and running the official evaluation binary. **Distinct from Model Evaluation Metrics:** Distinct from Model Evaluation Metrics: specific to the Waymo Open Dataset's official evaluation protocol and binary.