awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

39 Repos

Awesome GitHub RepositoriesVideo Representation Learning

Models and frameworks for extracting spatiotemporal features from video data.

Explore 39 awesome GitHub repositories matching part of an awesome list · Video Representation Learning. Refine with filters or upvote what's useful.

Awesome Video Representation Learning GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • facebookresearch/slowfastAvatar von facebookresearch

    facebookresearch/SlowFast

    7,377Auf GitHub ansehen↗

    SlowFast is a PyTorch video understanding framework and spatiotemporal neural network library. It serves as a toolset for video action recognition, enabling the training and evaluation of models designed to classify complex activities and objects within video sequences. The framework is distinguished by its use of dual-pathway spatiotemporal sampling to capture both slow and fast motions. It supports self-supervised video learning for pre-training models on unlabeled data and employs multigrid spatiotemporal training to optimize learning across multiple spatial and temporal resolutions. The

    High-performance dual-pathway architecture for video recognition.

    Python
    Auf GitHub ansehen↗7,377
  • open-mmlab/mmaction2Avatar von open-mmlab

    open-mmlab/mmaction2

    5,066Auf GitHub ansehen↗

    mmaction2 ist eine PyTorch-Toolbox für das Videoverständnis, die für das Training und die Evaluierung von Deep-Learning-Modellen entwickelt wurde. Sie dient als Framework für Aktionserkennung, zeitliche Lokalisierung und räumlich-zeitliche Aktionserkennung und bietet spezialisierte Tools sowohl für pixelbasierte Videoanalyse als auch für skelettbasierte Aktionserkennung. Das Projekt zeichnet sich durch eine modulare Architektur mit registerbasierter Komponentenerkennung und hierarchischem, konfigurationsgesteuertem Modell-Assembly aus. Es unterstützt multimodale Feature-Fusion, integriert RGB-Frames, optischen Fluss und Audio und enthält Funktionen für Text-zu-Video-Clip-Retrieval und Zero-Shot-Videovorhersage. Das Framework deckt breit gefächert das Video-Dataset-Engineering ab, einschließlich Annotationsstandardisierung und Frame-Sampling, sowie umfassendes Modelltraining und -evaluierung. Es bietet Dienstprogramme für verteiltes Training, Knowledge Distillation und Inferenzoptimierung durch Modell-Reparametrisierung. Die Codebasis unterstützt den ONNX-Modell-Export und die Containerisierung der Umgebung für das Deployment über verschiedene Rechenknoten hinweg.

    Next-generation modular framework for video action recognition.

    Python
    Auf GitHub ansehen↗5,066
  • kenshohara/3d-resnets-pytorchAvatar von kenshohara

    kenshohara/3D-ResNets-PyTorch

    4,039Auf GitHub ansehen↗

    Dieses Projekt ist eine PyTorch-Implementierung von 3D-Residual-Netzwerken, die für die Video-Aktionserkennung konzipiert sind. Es bietet eine spatiotemporale Architektur, die sowohl räumliche Frames als auch zeitliche Bewegungen analysiert, um menschliche Aktivitäten innerhalb von Videoclips zu klassifizieren. Das System enthält ein Framework für verteiltes Modelltraining, um das Lernen über mehrere Rechenknoten hinweg zu beschleunigen. Es unterstützt das Deployment und Fine-Tuning vortrainierter Modellgewichte, was die Anpassung bestehender Netzwerke an spezifische neue Datensätze ermöglicht. Die Codebasis deckt die gesamte Pipeline für spatiotemporales Lernen ab, einschließlich Tools zur Vorverarbeitung von Videodatensätzen für die Konvertierung von Rohdateien in Bildsequenzen, Funktionen zur Aktionsinferenz und Metriken zur Berechnung der Erkennungsgenauigkeit.

    Provides 3D ResNet architectures for spatiotemporal feature learning.

    Python
    Auf GitHub ansehen↗4,039
  • facebookresearch/jepaAvatar von facebookresearch

    facebookresearch/jepa

    3,986Auf GitHub ansehen↗

    Dies ist ein PyTorch-Framework für selbstüberwachtes Lernen, das darauf ausgelegt ist, Modelle zu trainieren, die visuelle Repräsentationen aus Videos lernen. Es implementiert eine Joint-Embedding-Predictive-Architektur, die räumlich-zeitliche Merkmale extrahiert, indem sie fehlende Regionen eines Signals innerhalb eines latenten Repräsentationsraums vorhersagt, anstatt rohe Pixel zu rekonstruieren. Das Projekt enthält ein Tool zur Visualisierung des latenten Raums, das ein konditionales Diffusionsmodell verwendet, um Vorhersagen im Merkmalsraum zurück in Pixel zu dekodieren. Dies ermöglicht die Verifizierung gelernter Repräsentationen durch die Transformation abstrakter Vorhersagen in interpretierbare Bilder. Das Framework bietet eine Suite für verteiltes Training zur Ausführung von Large-Scale-Pretraining und Evaluierung über Multi-GPU-Cluster hinweg. Es deckt die End-to-End-Pipeline für das Lernen von Videorepräsentationen ab, einschließlich räumlich-zeitlicher Datensampling, Transformer-basierter Merkmalsextraktion und der Evaluierung eingefrorener Encoder durch Linear Probing und Klassifizierungs-Benchmarks.

    Extracts spatiotemporal features from video using a self-supervised objective that predicts missing latent regions.

    Python
    Auf GitHub ansehen↗3,986
  • dmlc/decordAvatar von dmlc

    dmlc/decord

    2,493Auf GitHub ansehen↗

    An efficient video loader for deep learning with smart shuffling that's super easy to digest

    High-performance video loading and decoding library.

    C++
    Auf GitHub ansehen↗2,493
  • facebookresearch/video-nonlocal-netAvatar von facebookresearch

    facebookresearch/video-nonlocal-net

    1,995Auf GitHub ansehen↗

    Non-local Neural Networks for Video Classification

    Captures long-range dependencies using non-local neural networks.

    Python
    Auf GitHub ansehen↗1,995
  • open-mmlab/mmactionAvatar von open-mmlab

    open-mmlab/mmaction

    1,878Auf GitHub ansehen↗

    An open-source toolbox for action understanding based on PyTorch

    Comprehensive toolbox for video understanding research.

    Python
    Auf GitHub ansehen↗1,878
  • deepmind/kinetics-i3dAvatar von deepmind

    deepmind/kinetics-i3d

    1,837Auf GitHub ansehen↗

    Convolutional neural network model for video classification trained on the Kinetics dataset.

    Inflated 3D ConvNet architecture trained on large-scale video datasets.

    Python
    Auf GitHub ansehen↗1,837
  • yjxiong/temporal-segment-networksAvatar von yjxiong

    yjxiong/temporal-segment-networks

    1,579Auf GitHub ansehen↗

    Code & Models for Temporal Segment Networks (TSN) in ECCV 2016

    Optimizes deep action recognition using temporal segment sampling.

    Python
    Auf GitHub ansehen↗1,579
  • facebook/c3dAvatar von facebook

    facebook/C3D

    1,185Auf GitHub ansehen↗

    C3D is a modified version of BVLC caffe to support 3D ConvNets.

    Foundational 3D convolutional network for spatiotemporal feature extraction.

    Jupyter Notebook
    Auf GitHub ansehen↗1,185
  • facebookresearch/r2plus1dAvatar von facebookresearch

    facebookresearch/R2Plus1D

    1,054Auf GitHub ansehen↗

    VMZ: Model Zoo for Video Modeling

    Decomposes 3D convolutions into spatial and temporal components.

    Python
    Auf GitHub ansehen↗1,054
  • metalbubble/trn-pytorchAvatar von metalbubble

    metalbubble/TRN-pytorch

    790Auf GitHub ansehen↗

    Temporal Relation Networks

    Implements temporal relational reasoning for video analysis.

    Python
    Auf GitHub ansehen↗790
  • xiaolonw/timecycleAvatar von xiaolonw

    xiaolonw/TimeCycle

    723Auf GitHub ansehen↗

    Learning Correspondence from the Cycle-consistency of Time (CVPR 2019)

    Learns correspondences through temporal cycle-consistency.

    Python
    Auf GitHub ansehen↗723
  • feichtenhofer/twostreamfusionAvatar von feichtenhofer

    feichtenhofer/twostreamfusion

    716Auf GitHub ansehen↗

    Code release for "Convolutional Two-Stream Network Fusion for Video Action Recognition", CVPR 2016.

    Integrates spatial and temporal streams for improved action recognition.

    Cuda
    Auf GitHub ansehen↗716
  • gsig/pyvideoresearchAvatar von gsig

    gsig/PyVideoResearch

    537Auf GitHub ansehen↗

    A repository of common methods, datasets, and tasks for video research

    Research-oriented library for video representation learning.

    Python
    Auf GitHub ansehen↗537
  • facebookresearch/video-long-term-feature-banksAvatar von facebookresearch

    facebookresearch/video-long-term-feature-banks

    383Auf GitHub ansehen↗

    Long-Term Feature Banks for Detailed Video Understanding

    Enables long-term temporal reasoning for detailed video understanding.

    Python
    Auf GitHub ansehen↗383
  • irhumshafkat/r2plus1d-pytorchAvatar von irhumshafkat

    irhumshafkat/R2Plus1D-PyTorch

    365Auf GitHub ansehen↗

    PyTorch implementation of the R2Plus1D convolution based ResNet architecture described in the paper "A Closer Look at Spatiotemporal Convolutions for Action Recognition"

    PyTorch implementation of spatiotemporal convolution networks.

    Python
    Auf GitHub ansehen↗365
  • zhaofanqiu/pseudo-3d-residual-networksAvatar von ZhaofanQiu

    ZhaofanQiu/pseudo-3d-residual-networks

    348Auf GitHub ansehen↗

    Pseudo-3D Convolutional Residual Networks for Video Representation Learning

    Efficient spatiotemporal representation using pseudo-3D residual blocks.

    C++
    Auf GitHub ansehen↗348
  • colincsl/temporalconvolutionalnetworksAvatar von colincsl

    colincsl/TemporalConvolutionalNetworks

    299Auf GitHub ansehen↗

    This code implements the video- and sensor-based action segmentation models from Temporal Convolutional Networks for Action Segmentation and Detection by Colin Lea, Michael Flynn, Rene Vidal, Austin Reiter, Greg Hager arXiv 2016 (in-review).

    Unified approach for action segmentation and detection tasks.

    Python
    Auf GitHub ansehen↗299
  • liusifei/uvcAvatar von Liusifei

    Liusifei/UVC

    176Auf GitHub ansehen↗

    Joint-task Self-supervised Learning for Temporal Correspondence (NeurIPS 2019)

    Jointly learns temporal correspondences using self-supervision.

    Python
    Auf GitHub ansehen↗176
Vorherige12Nächste
  1. Home
  2. Part of an Awesome List
  3. AI & Machine Learning
  4. Video Representation Learning