39 Repos
Models and frameworks for extracting spatiotemporal features from video data.
Explore 39 awesome GitHub repositories matching part of an awesome list · Video Representation Learning. Refine with filters or upvote what's useful.
SlowFast is a PyTorch video understanding framework and spatiotemporal neural network library. It serves as a toolset for video action recognition, enabling the training and evaluation of models designed to classify complex activities and objects within video sequences. The framework is distinguished by its use of dual-pathway spatiotemporal sampling to capture both slow and fast motions. It supports self-supervised video learning for pre-training models on unlabeled data and employs multigrid spatiotemporal training to optimize learning across multiple spatial and temporal resolutions. The
High-performance dual-pathway architecture for video recognition.
mmaction2 ist eine PyTorch-Toolbox für das Videoverständnis, die für das Training und die Evaluierung von Deep-Learning-Modellen entwickelt wurde. Sie dient als Framework für Aktionserkennung, zeitliche Lokalisierung und räumlich-zeitliche Aktionserkennung und bietet spezialisierte Tools sowohl für pixelbasierte Videoanalyse als auch für skelettbasierte Aktionserkennung. Das Projekt zeichnet sich durch eine modulare Architektur mit registerbasierter Komponentenerkennung und hierarchischem, konfigurationsgesteuertem Modell-Assembly aus. Es unterstützt multimodale Feature-Fusion, integriert RGB-Frames, optischen Fluss und Audio und enthält Funktionen für Text-zu-Video-Clip-Retrieval und Zero-Shot-Videovorhersage. Das Framework deckt breit gefächert das Video-Dataset-Engineering ab, einschließlich Annotationsstandardisierung und Frame-Sampling, sowie umfassendes Modelltraining und -evaluierung. Es bietet Dienstprogramme für verteiltes Training, Knowledge Distillation und Inferenzoptimierung durch Modell-Reparametrisierung. Die Codebasis unterstützt den ONNX-Modell-Export und die Containerisierung der Umgebung für das Deployment über verschiedene Rechenknoten hinweg.
Next-generation modular framework for video action recognition.
Dieses Projekt ist eine PyTorch-Implementierung von 3D-Residual-Netzwerken, die für die Video-Aktionserkennung konzipiert sind. Es bietet eine spatiotemporale Architektur, die sowohl räumliche Frames als auch zeitliche Bewegungen analysiert, um menschliche Aktivitäten innerhalb von Videoclips zu klassifizieren. Das System enthält ein Framework für verteiltes Modelltraining, um das Lernen über mehrere Rechenknoten hinweg zu beschleunigen. Es unterstützt das Deployment und Fine-Tuning vortrainierter Modellgewichte, was die Anpassung bestehender Netzwerke an spezifische neue Datensätze ermöglicht. Die Codebasis deckt die gesamte Pipeline für spatiotemporales Lernen ab, einschließlich Tools zur Vorverarbeitung von Videodatensätzen für die Konvertierung von Rohdateien in Bildsequenzen, Funktionen zur Aktionsinferenz und Metriken zur Berechnung der Erkennungsgenauigkeit.
Provides 3D ResNet architectures for spatiotemporal feature learning.
Dies ist ein PyTorch-Framework für selbstüberwachtes Lernen, das darauf ausgelegt ist, Modelle zu trainieren, die visuelle Repräsentationen aus Videos lernen. Es implementiert eine Joint-Embedding-Predictive-Architektur, die räumlich-zeitliche Merkmale extrahiert, indem sie fehlende Regionen eines Signals innerhalb eines latenten Repräsentationsraums vorhersagt, anstatt rohe Pixel zu rekonstruieren. Das Projekt enthält ein Tool zur Visualisierung des latenten Raums, das ein konditionales Diffusionsmodell verwendet, um Vorhersagen im Merkmalsraum zurück in Pixel zu dekodieren. Dies ermöglicht die Verifizierung gelernter Repräsentationen durch die Transformation abstrakter Vorhersagen in interpretierbare Bilder. Das Framework bietet eine Suite für verteiltes Training zur Ausführung von Large-Scale-Pretraining und Evaluierung über Multi-GPU-Cluster hinweg. Es deckt die End-to-End-Pipeline für das Lernen von Videorepräsentationen ab, einschließlich räumlich-zeitlicher Datensampling, Transformer-basierter Merkmalsextraktion und der Evaluierung eingefrorener Encoder durch Linear Probing und Klassifizierungs-Benchmarks.
Extracts spatiotemporal features from video using a self-supervised objective that predicts missing latent regions.
An efficient video loader for deep learning with smart shuffling that's super easy to digest
High-performance video loading and decoding library.
Non-local Neural Networks for Video Classification
Captures long-range dependencies using non-local neural networks.
An open-source toolbox for action understanding based on PyTorch
Comprehensive toolbox for video understanding research.
Convolutional neural network model for video classification trained on the Kinetics dataset.
Inflated 3D ConvNet architecture trained on large-scale video datasets.
Code & Models for Temporal Segment Networks (TSN) in ECCV 2016
Optimizes deep action recognition using temporal segment sampling.
C3D is a modified version of BVLC caffe to support 3D ConvNets.
Foundational 3D convolutional network for spatiotemporal feature extraction.
VMZ: Model Zoo for Video Modeling
Decomposes 3D convolutions into spatial and temporal components.
Temporal Relation Networks
Implements temporal relational reasoning for video analysis.
Learning Correspondence from the Cycle-consistency of Time (CVPR 2019)
Learns correspondences through temporal cycle-consistency.
Code release for "Convolutional Two-Stream Network Fusion for Video Action Recognition", CVPR 2016.
Integrates spatial and temporal streams for improved action recognition.
A repository of common methods, datasets, and tasks for video research
Research-oriented library for video representation learning.
Long-Term Feature Banks for Detailed Video Understanding
Enables long-term temporal reasoning for detailed video understanding.
PyTorch implementation of the R2Plus1D convolution based ResNet architecture described in the paper "A Closer Look at Spatiotemporal Convolutions for Action Recognition"
PyTorch implementation of spatiotemporal convolution networks.
Pseudo-3D Convolutional Residual Networks for Video Representation Learning
Efficient spatiotemporal representation using pseudo-3D residual blocks.
This code implements the video- and sensor-based action segmentation models from Temporal Convolutional Networks for Action Segmentation and Detection by Colin Lea, Michael Flynn, Rene Vidal, Austin Reiter, Greg Hager arXiv 2016 (in-review).
Unified approach for action segmentation and detection tasks.
Joint-task Self-supervised Learning for Temporal Correspondence (NeurIPS 2019)
Jointly learns temporal correspondences using self-supervision.