10 dépôts
Distributes computationally heavy media processing tasks across multiple graphics cards to increase rendering speed.
Distinct from Multi-GPU Distribution: Focuses on distributing the processing workload for speed, rather than splitting model parameters to overcome memory limits.
Explore 10 awesome GitHub repositories matching artificial intelligence & ml · Multi-GPU Workload Distribution. Refine with filters or upvote what's useful.
This project is an object detection framework implementing the YOLOv3 architecture using Keras and TensorFlow. It functions as a deep learning vision model and computer vision toolset designed to locate and classify multiple entities within images and video streams using bounding boxes. The system includes a multi-GPU inference engine to distribute computational loads across several graphics processing units. It also provides a pipeline for creating custom object detectors by retraining pre-trained weights on annotated datasets to recognize user-defined object classes. The framework covers m
Distributes the computational load across multiple GPUs to accelerate object detection processing speed.
Tensorpack est un framework de réseau de neurones TensorFlow de haut niveau et une bibliothèque de recherche conçue pour construire et entraîner des modèles de deep learning. Il fournit une collection d'architectures de réseaux de neurones reproductibles pour la vision par ordinateur, les tâches génératives, l'apprentissage par renforcement et le traitement du langage naturel. Le projet se distingue par un pipeline de données de deep learning spécialisé qui utilise du Python pur pour le chargement et le streaming de données en parallèle. Il inclut un orchestrateur d'entraînement multi-GPU pour distribuer les charges de travail via des stratégies de parallélisme de données et un toolkit d'interprétabilité dédié pour visualiser la saillance des modèles et les cartes d'activation. Le framework couvre un large éventail de capacités, incluant des pipelines de vision par ordinateur pour la détection d'objets et la segmentation sémantique, la modélisation de séquences pour la parole et le texte, et le développement d'agents d'apprentissage par renforcement. Il fournit également des outils d'optimisation de modèle pour la quantification des poids et l'entraînement en faible précision, ainsi que des utilitaires pour reproduire des articles de recherche académique et convertir des poids de modèles Caffe legacy.
Implements a specialized system for distributing data pipeline execution across multiple GPUs to maximize training throughput.
NVIDIA DALI is a GPU-accelerated data loading and preprocessing library designed for deep learning workflows. It constructs high-performance data pipelines that offload decoding, augmentation, and normalization to the GPU, eliminating CPU bottlenecks in training and inference. The library reads data from multiple storage formats and streams it directly into GPU memory, with support for multi-GPU execution to scale throughput across large-scale workloads. DALI distinguishes itself by enabling data pipelines to be built once and executed across multiple deep learning frameworks without code cha
Distributes data pipeline execution across multiple GPUs to scale loading and preprocessing throughput.
StableSwarmUI est une interface web et un orchestrateur backend pour la génération d'images Stable Diffusion. Il fonctionne comme un générateur d'images GPU distribué et un pipeline d'images IA modulaire, fournissant un contrôleur centralisé pour gérer les requêtes de génération d'images. Le système se distingue par sa capacité à diviser les tâches de génération sur plusieurs processeurs graphiques pour augmenter le débit par lots. Il utilise une interface agnostique au backend pour se connecter à des serveurs locaux, des serveurs distants et des API cloud, et inclut un concepteur de flux de travail visuel basé sur des graphes pour définir des opérations complexes de traitement d'image. La plateforme inclut un système d'extension de plugins dynamique pour ajouter des fonctionnalités personnalisées et des utilitaires automatisés pour le provisionnement des dépendances au niveau du système. Il combine des outils de génération modulaires et des interfaces d'édition rapides avec la capacité de router les charges de travail sur du matériel distribué.
Splits image generation batches across multiple graphics processors to increase overall throughput and production speed.
Aibrix est un orchestrateur d'inférence conçu pour la mise à l'échelle, le routage et la gestion du déploiement de modèles de langage étendus à travers des clusters vLLM distribués. Il sert de passerelle centralisée pour l'équilibrage de charge et le routage du trafic vers des répliques et des versions de modèles spécifiques. Le système gère l'efficacité des ressources via un autoscaler de cluster GPU qui ajuste le nombre d'instances de calcul en fonction du volume de requêtes en temps réel. Il optimise davantage les opérations en mélangeant différents types d'accélérateurs au sein d'un même cluster et en utilisant un orchestrateur d'adaptateurs de modèles pour déployer des adaptateurs de paramètres légers sur des modèles de base partagés. Les capacités étendues incluent l'utilisation d'un gestionnaire de cache clé-valeur distribué pour partager les données de jetons à travers les moteurs d'inférence et l'implémentation de la surveillance de la santé du matériel pour détecter les défaillances des unités de traitement. Le projet fournit également un pipeline de métriques unifié pour standardiser la collecte de données de performance à travers divers environnements d'exécution.
Distributes computationally heavy LLM workloads across multiple GPU nodes to increase total throughput.
SwarmUI est une interface web et un orchestrateur pour Stable Diffusion, conçu pour générer des images et des vidéos. Il fonctionne comme un gestionnaire de flux de travail modulaire et une passerelle API permettant la configuration et l'exécution de pipelines d'IA générative. Le système se caractérise par sa capacité à distribuer les charges de travail de génération sur plusieurs cartes graphiques pour augmenter la vitesse de traitement et le débit total. Il utilise une architecture client-serveur découplée et une interface agnostique au backend, permettant à l'interface utilisateur de rester séparée de l'environnement d'exécution du modèle. La plateforme supporte l'extensibilité via une architecture basée sur des plugins pour ajouter de nouveaux composants d'UI et des gestionnaires de logique. Elle fournit un contrôle programmatique via des endpoints HTTP et WebSocket pour permettre aux applications externes de déclencher des générations et de synchroniser l'état en temps réel. Des outils d'administration sont inclus pour accorder et gérer l'accès des utilisateurs distants à l'environnement génératif via un réseau.
Splits heavy image generation tasks across multiple graphics cards to increase processing speed.
Discoart is a diffusion model orchestration framework and distributed GPU generation engine designed to automate and scale image generation workflows across hardware clusters. It functions as a generative AI model API, providing HTTP and gRPC endpoints to trigger and retrieve images from diffusion models as a network service. The system distinguishes itself through a comprehensive task management layer that includes timeline-based prompt and parameter scheduling. It manages the generative art lifecycle by supporting state-based session serialization for recovery, YAML-based configuration mana
Distributes heavy image generation workloads across multiple GPUs using round-robin scheduling to increase throughput.
QualityScaler is an AI video upscaler and local media processing tool designed to increase the resolution and visual quality of videos and images. It uses deep learning models to enhance detail and remove noise, operating as an offline application that executes all computations on local hardware. The project functions as a GPU-accelerated media processor that distributes workloads across multiple graphics cards to increase rendering speed. To prevent memory overflow during high-resolution tasks, it employs a tiled image processing method that splits large assets into smaller sections. The sy
Distributes computational workloads across multiple graphics cards to increase overall video and image rendering speed.
ComfyUI-SeedVR2_VideoUpscaler is an AI video upscaling tool that uses diffusion models to increase the resolution of videos and images while maintaining visual consistency across frames. The project implements distributed video rendering by splitting datasets into chunks for parallel processing across multiple GPUs. It utilizes model compilation and specialized attention backends to reduce inference latency and increase throughput. Additional capabilities include video color correction using wavelet and LAB matching methods to preserve color fidelity. Hardware memory is managed through block
Distributes heavy media processing tasks across multiple GPUs to increase overall rendering throughput.
RLinf is a distributed reinforcement learning orchestrator and embodied AI training framework. It provides the infrastructure to train vision-language-action models and robotic policies using a combination of reinforcement learning and supervised fine-tuning. The system is designed for scaling workloads across GPU clusters, managing the placement of actors, rollout workers, and environment components. It features a specialized robotics data collection pipeline for gathering teleoperated demonstrations and simulation trajectories into standardized replay buffers, alongside a hardware interface
Coordinates reinforcement learning specific workloads, including rollouts and updates, across a distributed GPU cluster.