15 dépôts
Standardized evaluation suites for measuring the accuracy and generalization of visual recognition systems.
Distinguishing note: Specifically targets vision-based model evaluation rather than general-purpose ML benchmarking.
Explore 15 awesome GitHub repositories matching artificial intelligence & ml · Computer Vision Benchmarks. Refine with filters or upvote what's useful.
CLIP is a neural network architecture designed to map visual and textual data into a shared latent vector space. By utilizing transformer-based feature extraction and multi-modal tokenization, the system aligns images and natural language strings, enabling cross-modal similarity analysis and semantic classification. The project functions as a zero-shot classification engine, identifying image content by calculating the cosine similarity between visual features and arbitrary text labels without requiring task-specific retraining. Beyond inference, it serves as a research toolkit for evaluating
Evaluating how well visual recognition systems generalize across diverse datasets and identifying performance gaps in real-world application scenarios.
This project is a comprehensive, community-driven repository that serves as a centralized catalog for computer vision research and development. It functions as a structured index of academic papers, open-source software libraries, public datasets, and educational tutorials, providing a navigation point for the complex landscape of modern vision technology. The repository distinguishes itself through a taxonomy-based indexing system that maps the relationships between foundational research, influential academic figures, and their corresponding software implementations. By utilizing a lightweig
Acts as a comprehensive research catalog for influential figures, algorithms, and benchmarking suites.
This project is a computer vision benchmark and image classification dataset used to measure and compare the accuracy of machine learning models. It provides a standardized collection of labeled fashion product images and training data formatted to be compatible with the MNIST dataset structure. The dataset consists of fixed-dimension grayscale images and label-based category mappings, stored in a binary format. It includes pre-split training and testing sets and a static distribution to ensure consistent cross-model benchmarking. The repository supports image classification benchmarking and
Serves as a reference dataset to measure and compare the accuracy of image classifiers.
BasicSR is a PyTorch-based image restoration toolbox and framework designed for training and deploying deep learning models to upscale, denoise, and deblur images and videos. It serves as a comprehensive system for image super-resolution and video quality restoration, providing the necessary infrastructure to recover fine visual details and increase pixel density. The project distinguishes itself through specialized toolkits for facial image enhancement and high-fidelity face synthesis, as well as a dedicated video quality restoration suite that utilizes deformable convolutions and generative
Computes standard restoration benchmarks including PSNR, SSIM, LPIPS, NIQE, and FID.
Boxmot is a multi-object tracking framework designed to follow multiple objects across video frames using motion and appearance algorithms to maintain consistent identities. It functions as a system for tracking objects with specific orientations using rotated bounding boxes and corresponding intersection-over-union computations. The project includes a re-identification model optimizer that converts neural networks into formats for hardware-accelerated execution. It also features an evolutionary hyperparameter tuner that iteratively mutates tracker settings to maximize accuracy for specific d
Uses standardized evaluation suites to measure the accuracy and consistency of visual tracking systems.
This project is an object detection evaluation library and benchmarking tool designed to calculate precision, recall, and average precision for computer vision models. It provides a suite of utilities for parsing bounding box coordinates from text files and calculating spatial overlap to determine detection accuracy. The toolkit features a command line interface for comparing ground truth files against model predictions. It includes a precision-recall curve generator to visualize the relationship between precision and recall across different confidence thresholds and an intersection over unio
Provides a standardized evaluation suite for measuring the accuracy and generalization of object detection models.
Ce projet est un framework de ré-identification de personnes PyTorch conçu pour entraîner et évaluer des modèles qui identifient des individus à travers différentes vues de caméra. Il fournit un pipeline complet d'entraînement de modèle, un extracteur de caractéristiques de deep learning pour convertir des images en vecteurs numériques, et une suite d'outils de benchmarking de vision par ordinateur pour mesurer la précision de récupération d'identité. Le framework inclut une boîte à outils de transfert learning spécialisée qui prend en charge le gel de couches, l'optimisation du taux d'apprentissage par étapes et des taux d'apprentissage différentiels pour le fine-tuning de modèles pré-entraînés. Il se distingue par un moteur extensible qui permet le développement d'une logique d'entraînement personnalisée et l'implémentation d'objectifs d'optimisation spécifiques comme le hard-sample triplet loss mining et le label smoothing. Le système couvre une gestion complète des jeux de données, incluant le support des benchmarks standard, l'échantillonnage équilibré par lots et l'augmentation d'images. Il fournit des utilitaires d'évaluation pour calculer les rangs de récupération et les distances de caractéristiques, ainsi que des outils de visualisation pour générer des cartes de chaleur d'activation et des galeries de récupération classées. Le projet est implémenté en Python et exploite PyTorch pour ses opérations de deep learning.
Provides a suite for evaluating identity retrieval accuracy using standard re-identification benchmarks.
Ce projet est un jeu de données de vision par ordinateur et un dépôt d'annotation d'images conçu pour entraîner et évaluer des modèles d'apprentissage automatique. Il fournit une grande collection d'images étiquetées, servant de référence pour la détection d'objets et de source de données de segmentation au niveau des pixels. Le dépôt se distingue en tant que jeu de données visuel multimodal en associant des images à des traces vocales, textuelles et de souris synchronisées pour soutenir la compréhension narrative. Il permet en outre l'analyse de l'équité des modèles par l'inclusion d'attributs démographiques et d'annotations exhaustives. Le jeu de données couvre une large gamme de capacités de vision par ordinateur, y compris la détection d'objets via des boîtes englobantes, la segmentation d'instances d'images utilisant des masques de pixels et le mappage de relations visuelles via des triplets objet-attribut. Il prend également en charge la classification au niveau des points, la reconnaissance de texte hiérarchique et la récupération de sous-ensembles de jeux de données curatés basés sur le filtrage par classe ou attribut.
Serves as a standardized benchmark for computing precision and recall in object detection and classification models.
DeiT est un framework de vision transformer PyTorch conçu pour la classification d'images. Il implémente une architecture basée sur des transformers qui traite les images comme des séquences de patchs aplatis en utilisant des couches d'auto-attention et une modélisation de séquence sensible à la position au lieu de filtres convolutifs. Le projet se concentre sur l'entraînement efficace en données grâce à un framework de distillation de connaissances. Ce système permet à un modèle étudiant d'imiter les soft labels d'un modèle enseignant haute performance pour améliorer la précision et la généralisation, particulièrement lors de l'entraînement sur des jeux de données plus petits. La bibliothèque couvre le cycle de vie complet du développement, incluant l'entraînement à la classification d'images, l'optimisation de la perte d'entropie croisée et le déploiement de poids pré-entraînés pour l'inférence. Elle inclut également un outil de benchmarking pour évaluer les performances et la précision du modèle par rapport aux jeux de données standard.
Includes tools for evaluating model accuracy against standard computer vision benchmarking datasets.
PerceptualSimilarity est un framework de deep learning conçu pour quantifier et évaluer la distance perceptuelle entre les images. Il fournit un système pour mesurer à quel point deux images ou patchs d'image semblent similaires à la vision humaine en utilisant des représentations de caractéristiques profondes au lieu de différences au niveau des pixels. Le projet implémente une métrique de distance différentiable qui fonctionne comme une fonction de perte, permettant aux pixels de l'image d'être optimisés via rétropropagation pour atteindre une apparence visuelle cible. Il inclut une couche linéaire entraînable qui peut être appliquée à des caractéristiques profondes gelées pour apprendre des métriques de distance pondérées alignées sur la perception humaine. Le framework couvre de larges capacités en évaluation de la qualité d'image, entraînement de métriques de similarité et benchmarking de vision par ordinateur. La précision du modèle est évaluée en comparant les scores de distance prédits avec des jeux de données de jugement humain utilisant des frameworks tels que les tests de choix forcé à deux alternatives.
Tests the accuracy of visual similarity models against standardized human judgment datasets.
RAFT est un framework de vision par ordinateur PyTorch et un système de deep learning conçu pour l'estimation du flux optique. Il fonctionne comme un estimateur de mouvement accéléré par GPU qui calcule des vecteurs de mouvement par pixel entre les images vidéo pour déterminer le déplacement des objets. L'implémentation utilise des transformations de champ récurrentes « all-pairs » et des kernels CUDA personnalisés pour optimiser la mémoire et la charge de calcul associées aux calculs de corrélation de haute dimension. Cette accélération au niveau matériel réduit l'utilisation de la mémoire GPU lors de la passe avant (forward pass). La boîte à outils couvre l'apprentissage supervisé du flux et l'entraînement de modèles en utilisant des formats de précision mixte. Elle inclut également des capacités pour l'analyse de mouvement vidéo et l'évaluation de la précision des modèles par rapport à des jeux de données de flux optique standard.
Evaluates the accuracy of motion estimation models against standardized computer vision datasets.
Vim is a state space model vision framework designed for image classification and visual representation learning. It functions as a computer vision research tool that converts two-dimensional image grids into one-dimensional sequences to extract spatial features. The system implements a linear-scaling image classifier that replaces quadratic attention mechanisms with state space operations. This approach utilizes bidirectional sequence modeling and selective gating mechanisms to process visual data. The framework covers computer vision benchmarking and image classification research, providin
Measures vision model accuracy and performance against standard industry datasets.
mmtracking is a PyTorch video perception framework designed for training and deploying computer vision models that analyze sequential image data. It provides specialized tools for multi-object tracking, video instance segmentation, and a configuration-driven system for managing deep learning models. The project utilizes a deep learning model registry and a configuration-driven pipeline to swap model backbones and detectors without modifying the core codebase. This modular approach allows for the development of custom perception architectures by combining various components and configurations.
Provides a standardized evaluation suite for measuring the tracking precision of visual recognition systems.
This project is a multi-object tracking library and computer vision toolkit designed to maintain consistent identity IDs for objects across video frames. It provides a motion-based object tracking system that converts raw detections into stable temporal tracks, enabling the analysis of object movement and behavior over time. The toolkit distinguishes itself through advanced identity maintenance, utilizing Kalman filters for linear motion tracking and sparse optical flow for camera motion estimation. It features multi-stage object association to recover occluded objects and non-linear motion t
Evaluates the accuracy and precision of tracking algorithms against ground-truth datasets using standardized metrics.
This project is a web-based platform designed for benchmarking, visualizing, and evaluating computer vision algorithms focused on image feature extraction and matching. It provides a unified interface to compare the performance and accuracy of different models by processing image pairs or live video streams. The system distinguishes itself through a modular architecture that allows users to define custom processing pipelines and register external algorithms via configuration files. It incorporates geometric verification techniques to refine visual data and improve the precision of detected co
Provides a platform for comparing the accuracy and performance of various feature extraction and matching algorithms.