awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

15 dépôts

Awesome GitHub RepositoriesComputer Vision Benchmarks

Standardized evaluation suites for measuring the accuracy and generalization of visual recognition systems.

Distinguishing note: Specifically targets vision-based model evaluation rather than general-purpose ML benchmarking.

Explore 15 awesome GitHub repositories matching artificial intelligence & ml · Computer Vision Benchmarks. Refine with filters or upvote what's useful.

Awesome Computer Vision Benchmarks GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • openai/clipAvatar de openai

    openai/CLIP

    33,779Voir sur GitHub↗

    CLIP is a neural network architecture designed to map visual and textual data into a shared latent vector space. By utilizing transformer-based feature extraction and multi-modal tokenization, the system aligns images and natural language strings, enabling cross-modal similarity analysis and semantic classification. The project functions as a zero-shot classification engine, identifying image content by calculating the cosine similarity between visual features and arbitrary text labels without requiring task-specific retraining. Beyond inference, it serves as a research toolkit for evaluating

    Evaluating how well visual recognition systems generalize across diverse datasets and identifying performance gaps in real-world application scenarios.

    Jupyter Notebookdeep-learningmachine-learning
    Voir sur GitHub↗33,779
  • jbhuang0604/awesome-computer-visionAvatar de jbhuang0604

    jbhuang0604/awesome-computer-vision

    23,074Voir sur GitHub↗

    This project is a comprehensive, community-driven repository that serves as a centralized catalog for computer vision research and development. It functions as a structured index of academic papers, open-source software libraries, public datasets, and educational tutorials, providing a navigation point for the complex landscape of modern vision technology. The repository distinguishes itself through a taxonomy-based indexing system that maps the relationships between foundational research, influential academic figures, and their corresponding software implementations. By utilizing a lightweig

    Acts as a comprehensive research catalog for influential figures, algorithms, and benchmarking suites.

    Voir sur GitHub↗23,074
  • zalandoresearch/fashion-mnistAvatar de zalandoresearch

    zalandoresearch/fashion-mnist

    12,754Voir sur GitHub↗

    This project is a computer vision benchmark and image classification dataset used to measure and compare the accuracy of machine learning models. It provides a standardized collection of labeled fashion product images and training data formatted to be compatible with the MNIST dataset structure. The dataset consists of fixed-dimension grayscale images and label-based category mappings, stored in a binary format. It includes pre-split training and testing sets and a static distribution to ensure consistent cross-model benchmarking. The repository supports image classification benchmarking and

    Serves as a reference dataset to measure and compare the accuracy of image classifiers.

    Pythonbenchmarkcomputer-visionconvolutional-neural-networks
    Voir sur GitHub↗12,754
  • xpixelgroup/basicsrAvatar de XPixelGroup

    XPixelGroup/BasicSR

    8,297Voir sur GitHub↗

    BasicSR is a PyTorch-based image restoration toolbox and framework designed for training and deploying deep learning models to upscale, denoise, and deblur images and videos. It serves as a comprehensive system for image super-resolution and video quality restoration, providing the necessary infrastructure to recover fine visual details and increase pixel density. The project distinguishes itself through specialized toolkits for facial image enhancement and high-fidelity face synthesis, as well as a dedicated video quality restoration suite that utilizes deformable convolutions and generative

    Computes standard restoration benchmarks including PSNR, SSIM, LPIPS, NIQE, and FID.

    Pythonbasicsrbasicvsrdfdnet
    Voir sur GitHub↗8,297
  • mikel-brostrom/boxmotAvatar de mikel-brostrom

    mikel-brostrom/boxmot

    8,212Voir sur GitHub↗

    Boxmot is a multi-object tracking framework designed to follow multiple objects across video frames using motion and appearance algorithms to maintain consistent identities. It functions as a system for tracking objects with specific orientations using rotated bounding boxes and corresponding intersection-over-union computations. The project includes a re-identification model optimizer that converts neural networks into formats for hardware-accelerated execution. It also features an evolutionary hyperparameter tuner that iteratively mutates tracker settings to maximize accuracy for specific d

    Uses standardized evaluation suites to measure the accuracy and consistency of visual tracking systems.

    Pythonboosttrackbotsortbytetrack
    Voir sur GitHub↗8,212
  • rafaelpadilla/object-detection-metricsAvatar de rafaelpadilla

    rafaelpadilla/Object-Detection-Metrics

    5,098Voir sur GitHub↗

    This project is an object detection evaluation library and benchmarking tool designed to calculate precision, recall, and average precision for computer vision models. It provides a suite of utilities for parsing bounding box coordinates from text files and calculating spatial overlap to determine detection accuracy. The toolkit features a command line interface for comparing ground truth files against model predictions. It includes a precision-recall curve generator to visualize the relationship between precision and recall across different confidence thresholds and an intersection over unio

    Provides a standardized evaluation suite for measuring the accuracy and generalization of object detection models.

    Pythonaverage-precisionbounding-boxesmean-average-precision
    Voir sur GitHub↗5,098
  • kaiyangzhou/deep-person-reidAvatar de KaiyangZhou

    KaiyangZhou/deep-person-reid

    4,849Voir sur GitHub↗

    Ce projet est un framework de ré-identification de personnes PyTorch conçu pour entraîner et évaluer des modèles qui identifient des individus à travers différentes vues de caméra. Il fournit un pipeline complet d'entraînement de modèle, un extracteur de caractéristiques de deep learning pour convertir des images en vecteurs numériques, et une suite d'outils de benchmarking de vision par ordinateur pour mesurer la précision de récupération d'identité. Le framework inclut une boîte à outils de transfert learning spécialisée qui prend en charge le gel de couches, l'optimisation du taux d'apprentissage par étapes et des taux d'apprentissage différentiels pour le fine-tuning de modèles pré-entraînés. Il se distingue par un moteur extensible qui permet le développement d'une logique d'entraînement personnalisée et l'implémentation d'objectifs d'optimisation spécifiques comme le hard-sample triplet loss mining et le label smoothing. Le système couvre une gestion complète des jeux de données, incluant le support des benchmarks standard, l'échantillonnage équilibré par lots et l'augmentation d'images. Il fournit des utilitaires d'évaluation pour calculer les rangs de récupération et les distances de caractéristiques, ainsi que des outils de visualisation pour générer des cartes de chaleur d'activation et des galeries de récupération classées. Le projet est implémenté en Python et exploite PyTorch pour ses opérations de deep learning.

    Provides a suite for evaluating identity retrieval accuracy using standard re-identification benchmarks.

    Pythoncomputer-visioncross-domaindeep-learning
    Voir sur GitHub↗4,849
  • openimages/datasetAvatar de openimages

    openimages/dataset

    4,366Voir sur GitHub↗

    Ce projet est un jeu de données de vision par ordinateur et un dépôt d'annotation d'images conçu pour entraîner et évaluer des modèles d'apprentissage automatique. Il fournit une grande collection d'images étiquetées, servant de référence pour la détection d'objets et de source de données de segmentation au niveau des pixels. Le dépôt se distingue en tant que jeu de données visuel multimodal en associant des images à des traces vocales, textuelles et de souris synchronisées pour soutenir la compréhension narrative. Il permet en outre l'analyse de l'équité des modèles par l'inclusion d'attributs démographiques et d'annotations exhaustives. Le jeu de données couvre une large gamme de capacités de vision par ordinateur, y compris la détection d'objets via des boîtes englobantes, la segmentation d'instances d'images utilisant des masques de pixels et le mappage de relations visuelles via des triplets objet-attribut. Il prend également en charge la classification au niveau des points, la reconnaissance de texte hiérarchique et la récupération de sous-ensembles de jeux de données curatés basés sur le filtrage par classe ou attribut.

    Serves as a standardized benchmark for computing precision and recall in object detection and classification models.

    Python
    Voir sur GitHub↗4,366
  • facebookresearch/deitAvatar de facebookresearch

    facebookresearch/deit

    4,348Voir sur GitHub↗

    DeiT est un framework de vision transformer PyTorch conçu pour la classification d'images. Il implémente une architecture basée sur des transformers qui traite les images comme des séquences de patchs aplatis en utilisant des couches d'auto-attention et une modélisation de séquence sensible à la position au lieu de filtres convolutifs. Le projet se concentre sur l'entraînement efficace en données grâce à un framework de distillation de connaissances. Ce système permet à un modèle étudiant d'imiter les soft labels d'un modèle enseignant haute performance pour améliorer la précision et la généralisation, particulièrement lors de l'entraînement sur des jeux de données plus petits. La bibliothèque couvre le cycle de vie complet du développement, incluant l'entraînement à la classification d'images, l'optimisation de la perte d'entropie croisée et le déploiement de poids pré-entraînés pour l'inférence. Elle inclut également un outil de benchmarking pour évaluer les performances et la précision du modèle par rapport aux jeux de données standard.

    Includes tools for evaluating model accuracy against standard computer vision benchmarking datasets.

    Python
    Voir sur GitHub↗4,348
  • richzhang/perceptualsimilarityAvatar de richzhang

    richzhang/PerceptualSimilarity

    4,244Voir sur GitHub↗

    PerceptualSimilarity est un framework de deep learning conçu pour quantifier et évaluer la distance perceptuelle entre les images. Il fournit un système pour mesurer à quel point deux images ou patchs d'image semblent similaires à la vision humaine en utilisant des représentations de caractéristiques profondes au lieu de différences au niveau des pixels. Le projet implémente une métrique de distance différentiable qui fonctionne comme une fonction de perte, permettant aux pixels de l'image d'être optimisés via rétropropagation pour atteindre une apparence visuelle cible. Il inclut une couche linéaire entraînable qui peut être appliquée à des caractéristiques profondes gelées pour apprendre des métriques de distance pondérées alignées sur la perception humaine. Le framework couvre de larges capacités en évaluation de la qualité d'image, entraînement de métriques de similarité et benchmarking de vision par ordinateur. La précision du modèle est évaluée en comparant les scores de distance prédits avec des jeux de données de jugement humain utilisant des frameworks tels que les tests de choix forcé à deux alternatives.

    Tests the accuracy of visual similarity models against standardized human judgment datasets.

    Python
    Voir sur GitHub↗4,244
  • princeton-vl/raftAvatar de princeton-vl

    princeton-vl/RAFT

    4,057Voir sur GitHub↗

    RAFT est un framework de vision par ordinateur PyTorch et un système de deep learning conçu pour l'estimation du flux optique. Il fonctionne comme un estimateur de mouvement accéléré par GPU qui calcule des vecteurs de mouvement par pixel entre les images vidéo pour déterminer le déplacement des objets. L'implémentation utilise des transformations de champ récurrentes « all-pairs » et des kernels CUDA personnalisés pour optimiser la mémoire et la charge de calcul associées aux calculs de corrélation de haute dimension. Cette accélération au niveau matériel réduit l'utilisation de la mémoire GPU lors de la passe avant (forward pass). La boîte à outils couvre l'apprentissage supervisé du flux et l'entraînement de modèles en utilisant des formats de précision mixte. Elle inclut également des capacités pour l'analyse de mouvement vidéo et l'évaluation de la précision des modèles par rapport à des jeux de données de flux optique standard.

    Evaluates the accuracy of motion estimation models against standardized computer vision datasets.

    Python
    Voir sur GitHub↗4,057
  • hustvl/vimAvatar de hustvl

    hustvl/Vim

    3,882Voir sur GitHub↗

    Vim is a state space model vision framework designed for image classification and visual representation learning. It functions as a computer vision research tool that converts two-dimensional image grids into one-dimensional sequences to extract spatial features. The system implements a linear-scaling image classifier that replaces quadratic attention mechanisms with state space operations. This approach utilizes bidirectional sequence modeling and selective gating mechanisms to process visual data. The framework covers computer vision benchmarking and image classification research, providin

    Measures vision model accuracy and performance against standard industry datasets.

    Python
    Voir sur GitHub↗3,882
  • open-mmlab/mmtrackingAvatar de open-mmlab

    open-mmlab/mmtracking

    3,881Voir sur GitHub↗

    mmtracking is a PyTorch video perception framework designed for training and deploying computer vision models that analyze sequential image data. It provides specialized tools for multi-object tracking, video instance segmentation, and a configuration-driven system for managing deep learning models. The project utilizes a deep learning model registry and a configuration-driven pipeline to swap model backbones and detectors without modifying the core codebase. This modular approach allows for the development of custom perception architectures by combining various components and configurations.

    Provides a standardized evaluation suite for measuring the tracking precision of visual recognition systems.

    Pythonmulti-object-trackingsingle-object-trackingtracking
    Voir sur GitHub↗3,881
  • roboflow/trackersAvatar de roboflow

    roboflow/trackers

    2,565Voir sur GitHub↗

    This project is a multi-object tracking library and computer vision toolkit designed to maintain consistent identity IDs for objects across video frames. It provides a motion-based object tracking system that converts raw detections into stable temporal tracks, enabling the analysis of object movement and behavior over time. The toolkit distinguishes itself through advanced identity maintenance, utilizing Kalman filters for linear motion tracking and sparse optical flow for camera motion estimation. It features multi-stage object association to recover occluded objects and non-linear motion t

    Evaluates the accuracy and precision of tracking algorithms against ground-truth datasets using standardized metrics.

    Pythonbytetrackmulti-object-trackingoc-sort
    Voir sur GitHub↗2,565
  • vincentqyw/image-matching-webuiAvatar de Vincentqyw

    Vincentqyw/image-matching-webui

    1,283Voir sur GitHub↗

    This project is a web-based platform designed for benchmarking, visualizing, and evaluating computer vision algorithms focused on image feature extraction and matching. It provides a unified interface to compare the performance and accuracy of different models by processing image pairs or live video streams. The system distinguishes itself through a modular architecture that allows users to define custom processing pipelines and register external algorithms via configuration files. It incorporates geometric verification techniques to refine visual data and improve the precision of detected co

    Provides a platform for comparing the accuracy and performance of various feature extraction and matching algorithms.

    Pythonaspanformerdeep-learningfeature-matching
    Voir sur GitHub↗1,283
  1. Home
  2. Artificial Intelligence & ML
  3. Computer Vision Benchmarks

Explorer les sous-tags

  • Restoration BenchmarksStandardized evaluation suites for comparing the performance of image and video restoration models. **Distinct from Computer Vision Benchmarks:** Distinct from Computer Vision Benchmarks: focuses on restoration-specific metrics (LPIPS, NIQE, SSIM) rather than general recognition accuracy.