3 dépôts
Techniques for distributing inference tasks across multiple GPUs using independent contexts and streams to increase throughput.
Distinct from Multi-GPU Distribution: Focuses on concurrent task execution across multiple GPUs rather than sharding a single large model's parameters (distribution).
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Multi-GPU Execution Scaling. Refine with filters or upvote what's useful.
tensorrtx is a computer vision inference engine and model implementation library designed for graphics processor acceleration. It provides a framework for optimizing deep learning models through a GPU inference optimizer, a deep learning model converter for transforming weights from frameworks like TensorFlow and PyTorch, and a custom plugin library to implement operations not natively supported by the TensorRT API. The project distinguishes itself through a comprehensive collection of pre-defined network implementations, ranging from various YOLO versions and DETR transformers for object det
Distributes model execution across multiple devices by creating independent contexts and streams for each processor.
Tensorpack est un framework de réseau de neurones TensorFlow de haut niveau et une bibliothèque de recherche conçue pour construire et entraîner des modèles de deep learning. Il fournit une collection d'architectures de réseaux de neurones reproductibles pour la vision par ordinateur, les tâches génératives, l'apprentissage par renforcement et le traitement du langage naturel. Le projet se distingue par un pipeline de données de deep learning spécialisé qui utilise du Python pur pour le chargement et le streaming de données en parallèle. Il inclut un orchestrateur d'entraînement multi-GPU pour distribuer les charges de travail via des stratégies de parallélisme de données et un toolkit d'interprétabilité dédié pour visualiser la saillance des modèles et les cartes d'activation. Le framework couvre un large éventail de capacités, incluant des pipelines de vision par ordinateur pour la détection d'objets et la segmentation sémantique, la modélisation de séquences pour la parole et le texte, et le développement d'agents d'apprentissage par renforcement. Il fournit également des outils d'optimisation de modèle pour la quantification des poids et l'entraînement en faible précision, ainsi que des utilitaires pour reproduire des articles de recherche académique et convertir des poids de modèles Caffe legacy.
Trains agents on complex environments using the Asynchronous Advantage Actor-Critic algorithm with multi-GPU support.
NVIDIA DALI is a GPU-accelerated data loading and preprocessing library designed for deep learning workflows. It constructs high-performance data pipelines that offload decoding, augmentation, and normalization to the GPU, eliminating CPU bottlenecks in training and inference. The library reads data from multiple storage formats and streams it directly into GPU memory, with support for multi-GPU execution to scale throughput across large-scale workloads. DALI distinguishes itself by enabling data pipelines to be built once and executed across multiple deep learning frameworks without code cha
Distributes data pipeline execution across multiple GPUs to accelerate processing throughput.