16 repositorios
Modular and reusable deep learning building blocks implemented specifically for the PyTorch framework.
Distinct from PyTorch Training Frameworks: Focuses on the provision of reusable components rather than high-level training frameworks or backends.
Explore 16 awesome GitHub repositories matching artificial intelligence & ml · PyTorch Model Components. Refine with filters or upvote what's useful.
This is a PyTorch attention mechanism library and a collection of deep learning model components. It provides reference implementations of research-based attention mechanisms and neural network layers used to verify and understand deep learning papers. The project facilitates deep learning research implementation and attention mechanism prototyping to capture global and local dependencies within complex datasets. It includes tools for neural network architecture design, specifically for building custom model components. The library covers the development of multi-layer perceptrons, convoluti
Provides a library of modular PyTorch components for developing and evaluating neural network architectures.
Kornia is a differentiable computer vision library and cross-framework tensor vision toolset. It implements vision operations as differentiable tensors to enable integration into deep learning pipelines and supports the transpilation of operations across PyTorch, TensorFlow, JAX, and NumPy. The project provides specialized toolsets for geometric vision and stereo depth, including algorithms for 3D scene reconstruction, camera calibration, and pose estimation. It further distinguishes itself as a differentiable image augmentation framework, applying random geometric and color transformations w
Offers a specialized toolbox for spatial AI, including camera calibration and 3D scene reconstruction using PyTorch tensors.
This project is a Transformer machine translation model and attention-based neural network implemented using the PyTorch deep learning framework. It functions as a text-to-text translation tool designed to convert source sequences into target language text. The implementation focuses on neural machine translation, covering the development of sequence-to-sequence architectures. It includes the full pipeline for translation, from text sequence preprocessing and vocabulary creation to model training and text generation inference. The system incorporates standard transformer components such as a
Implements the neural network using PyTorch building blocks and tensor operations.
This project is a pretrained model library for PyTorch, providing a collection of convolutional neural network architectures and weights. It serves as a computer vision model zoo for image classification and feature extraction, offering a framework for transfer learning where pretrained networks are adapted for custom image recognition tasks. The library focuses on transforming images into high-level numerical representations and calculating class probability scores. It includes utilities for downloading and initializing standard architectures such as ResNet, Inception, and Xception. Capabil
Provides a library of pretrained convolutional neural network architectures specifically for PyTorch users.
This project is a PyTorch vision transformer framework designed for self-supervised learning. It implements a model that trains visual representations using a momentum teacher and self-distillation without the need for labeled data. The library functions as an image feature extractor and visual attention visualizer, allowing for the generation of high-dimensional vectors and the rendering of self-attention maps as heatmaps or videos to analyze model focus. It provides comprehensive tools for downstream vision evaluation, including linear probe classification, k-nearest neighbor categorizatio
Loads pretrained backbones or full checkpoints in standard formats to perform downstream vision tasks.
SlowFast is a PyTorch video understanding framework and spatiotemporal neural network library. It serves as a toolset for video action recognition, enabling the training and evaluation of models designed to classify complex activities and objects within video sequences. The framework is distinguished by its use of dual-pathway spatiotemporal sampling to capture both slow and fast motions. It supports self-supervised video learning for pre-training models on unlabeled data and employs multigrid spatiotemporal training to optimize learning across multiple spatial and temporal resolutions. The
Defines deep learning layers and computational graphs as modular components using the PyTorch framework.
DUSt3R is a geometric vision transformer model that predicts dense 3D pointmaps directly from one or more uncalibrated images, without requiring prior camera intrinsics, extrinsics, or known camera positions. Its core identity is an end-to-end approach to 3D reconstruction that bypasses traditional depth estimation and camera calibration pipelines, instead outputting metric-scale 3D coordinates from RGB inputs. The model processes image pairs through a shared dual-image encoder architecture, using cross-attention feature fusion in the decoder to merge features from two images into a unified p
A transformer-based architecture that directly outputs 3D pointmaps from image pairs for geometric understanding.
Metaseq es un toolkit de modelado de secuencias transformer diseñado para entrenar, ajustar y desplegar modelos de secuencia a secuencia utilizando pesos pre-entrenados abiertos. Proporciona un framework integral para el entrenamiento de modelos de lenguaje de gran tamaño, incluyendo herramientas dedicadas para el procesamiento de datasets de secuencias y un servidor de inferencia independiente para generar texto mediante solicitudes API. El proyecto cuenta con utilidades especializadas para la cuantización de modelos para reducir la precisión de los parámetros a ocho bits, lo que reduce el uso de memoria y aumenta la velocidad de inferencia. También incluye un pipeline de conversión de checkpoints para transformar pesos de modelos en estructuras optimizadas para motores de inferencia de alto rendimiento. El framework soporta entrenamiento a gran escala a través de clústeres de GPU mediante el uso de paralelismo de tensores y paralelismo de datos fragmentados. Capacidades adicionales cubren la preparación de datasets de NLP, carga de pesos pre-entrenados para transfer learning y seguimiento de métricas de entrenamiento para la visualización del progreso.
Ships a pipeline to convert model weights into structures optimized for high-performance inference engines.
Provides a standard PyTorch interface for loading pretrained checkpoints and generating text.
The official PyTorch implementation of Google's Gemma models
Downloads model weights and tokenizer files from Kaggle or Hugging Face Hub for any supported variant.
Este proyecto es un recurso educativo de deep learning que consiste en implementaciones de modelos de PyTorch y ejemplos de código. Proporciona scripts funcionales en Python y notebooks para construir, entrenar y optimizar redes neuronales utilizando computación basada en tensores. El repositorio incluye implementaciones para diseñar capas de red y funciones de pérdida personalizadas, así como ejemplos de flujos de trabajo de aprendizaje por transferencia (transfer learning) que cargan pesos de modelos preentrenados para acelerar el desarrollo. El código base cubre una amplia gama de capacidades de deep learning, incluyendo entrenamiento de redes neuronales, diseño de componentes de modelos personalizados y la implementación de arquitecturas multicapa para reconocer patrones complejos en conjuntos de datos.
Implements modular and reusable PyTorch model components, including custom layers and loss functions.
mmaction2 es un kit de herramientas de comprensión de video de PyTorch diseñado para entrenar y evaluar modelos de aprendizaje profundo. Sirve como un framework para el reconocimiento de acciones, localización temporal y detección de acciones espaciotemporales, proporcionando herramientas especializadas tanto para el análisis de video basado en píxeles como para el reconocimiento de acciones basado en esqueletos. El proyecto se distingue por una arquitectura modular que cuenta con descubrimiento de componentes basado en registro y ensamblaje de modelos jerárquico impulsado por configuración. Admite la fusión de características multimodales, integrando marcos RGB, flujo óptico y audio, e incluye capacidades para la recuperación de clips de video mediante texto y predicción de video zero-shot. A grandes rasgos, el framework cubre la ingeniería de conjuntos de datos de video, incluyendo la estandarización de anotaciones y el muestreo de fotogramas, así como el entrenamiento y evaluación integral de modelos. Proporciona utilidades para el entrenamiento distribuido, destilación de conocimientos y optimización de inferencia mediante reparametrización de modelos. La base de código admite la exportación de modelos ONNX y la contenerización del entorno para el despliegue a través de diferentes nodos de cómputo.
Provides tools to convert model checkpoints via reparameterization to improve inference efficiency and reduce latency.
Este proyecto es un recurso educativo integral y un curso para construir redes neuronales usando PyTorch. Cubre los bloques de construcción fundamentales del deep learning, incluyendo la manipulación de tensores, la diferenciación automática y la construcción de componentes modulares de redes neuronales. El repositorio sirve como guía técnica para varios dominios especializados. Proporciona detalles de implementación para tareas de visión artificial como clasificación de imágenes, detección de objetos y segmentación semántica, así como flujos de trabajo de procesamiento de lenguaje natural que involucran transformers, redes recurrentes y modelos generativos. Además, incluye una referencia para IA generativa, centrándose específicamente en la síntesis de imágenes mediante modelos de difusión y redes adversarias. El material se extiende a pipelines de optimización y despliegue de modelos. Cubre técnicas para reducir el tamaño del modelo y aumentar la velocidad de inferencia mediante cuantización y la exportación de modelos a formatos como ONNX y TensorRT. Otras áreas de capacidad incluyen ingeniería de datos para carga paralela, evaluación de modelos mediante métricas personalizadas y el despliegue de modelos de lenguaje grandes (LLM) de código abierto. El proyecto se entrega principalmente como una serie de Jupyter Notebooks.
Iterates through model parameters and submodules to retrieve them as objects or named entries.
pytorch-summary es una colección de utilidades para redes neuronales de PyTorch diseñadas para generar resúmenes de modelos, calcular requisitos de memoria y visualizar formas de tensores capa por capa. Funciona como una herramienta de informes que proporciona desgloses detallados de las capas de la red y las formas de salida para ayudar con la depuración e inspección del modelo. El proyecto proporciona capacidades especializadas para estimar el uso total de memoria de los pasos hacia adelante y hacia atrás (forward and backward passes) basados en las dimensiones de entrada y los recuentos de parámetros. Genera visualizaciones legibles por humanos de las estructuras de los modelos para verificar diseños arquitectónicos e identificar desajustes de dimensiones entre capas. La herramienta implementa análisis estructural a través de recorrido recursivo de módulos, seguimiento de tensores basado en hooks e inferencia de formas impulsada por la entrada. Estas capacidades permiten la agregación de recuentos de parámetros y el mapeo del flujo de datos entre operaciones sucesivas.
Analyzes the architecture and layer-by-layer output shapes of PyTorch neural networks to verify model design.
This project is a collection of deep learning research implementations and a reproduction kit designed to translate theoretical AI papers into working code. It provides a library of neural network architectures and reference implementations for reproducing seminal research concepts through interactive notebooks. The repository distinguishes itself through the implementation of AI theory and scaling laws, covering complexity dynamics, information theory, and the simulation of universal AI agents. It also includes a benchmarking suite for synthetic reasoning, allowing for the evaluation of mode
Provides modular deep learning building blocks and training utilities implemented specifically for the PyTorch framework.
Graph Nets is a graph neural network library and educational toolkit implemented in PyTorch, providing implementations of popular graph representation learning algorithms and research papers. The project covers core graph machine learning tasks including semi-supervised node classification, inductive and unsupervised node embedding generation, and neighborhood feature aggregation. The library supports diverse algorithmic approaches for processing network structures, ranging from shared-parameter graph convolutions and attention-weighted neighborhood aggregation to spectral Chebyshev filtering
Organises deep learning operations into reusable neural network layers using tensor manipulation primitives provided by a tensor computing framework.