awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

10 dépôts

Awesome GitHub RepositoriesMulti-GPU Workload Distribution

Distributes computationally heavy media processing tasks across multiple graphics cards to increase rendering speed.

Distinct from Multi-GPU Distribution: Focuses on distributing the processing workload for speed, rather than splitting model parameters to overcome memory limits.

Explore 10 awesome GitHub repositories matching artificial intelligence & ml · Multi-GPU Workload Distribution. Refine with filters or upvote what's useful.

Awesome Multi-GPU Workload Distribution GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • qqwweee/keras-yolo3Avatar de qqwweee

    qqwweee/keras-yolo3

    7,116Voir sur GitHub↗

    This project is an object detection framework implementing the YOLOv3 architecture using Keras and TensorFlow. It functions as a deep learning vision model and computer vision toolset designed to locate and classify multiple entities within images and video streams using bounding boxes. The system includes a multi-GPU inference engine to distribute computational loads across several graphics processing units. It also provides a pipeline for creating custom object detectors by retraining pre-trained weights on annotated datasets to recognize user-defined object classes. The framework covers m

    Distributes the computational load across multiple GPUs to accelerate object detection processing speed.

    Python
    Voir sur GitHub↗7,116
  • tensorpack/tensorpackAvatar de tensorpack

    tensorpack/tensorpack

    6,287Voir sur GitHub↗

    Tensorpack est un framework de réseau de neurones TensorFlow de haut niveau et une bibliothèque de recherche conçue pour construire et entraîner des modèles de deep learning. Il fournit une collection d'architectures de réseaux de neurones reproductibles pour la vision par ordinateur, les tâches génératives, l'apprentissage par renforcement et le traitement du langage naturel. Le projet se distingue par un pipeline de données de deep learning spécialisé qui utilise du Python pur pour le chargement et le streaming de données en parallèle. Il inclut un orchestrateur d'entraînement multi-GPU pour distribuer les charges de travail via des stratégies de parallélisme de données et un toolkit d'interprétabilité dédié pour visualiser la saillance des modèles et les cartes d'activation. Le framework couvre un large éventail de capacités, incluant des pipelines de vision par ordinateur pour la détection d'objets et la segmentation sémantique, la modélisation de séquences pour la parole et le texte, et le développement d'agents d'apprentissage par renforcement. Il fournit également des outils d'optimisation de modèle pour la quantification des poids et l'entraînement en faible précision, ainsi que des utilitaires pour reproduire des articles de recherche académique et convertir des poids de modèles Caffe legacy.

    Implements a specialized system for distributing data pipeline execution across multiple GPUs to maximize training throughput.

    Python
    Voir sur GitHub↗6,287
  • nvidia/daliAvatar de NVIDIA

    NVIDIA/DALI

    5,713Voir sur GitHub↗

    NVIDIA DALI is a GPU-accelerated data loading and preprocessing library designed for deep learning workflows. It constructs high-performance data pipelines that offload decoding, augmentation, and normalization to the GPU, eliminating CPU bottlenecks in training and inference. The library reads data from multiple storage formats and streams it directly into GPU memory, with support for multi-GPU execution to scale throughput across large-scale workloads. DALI distinguishes itself by enabling data pipelines to be built once and executed across multiple deep learning frameworks without code cha

    Distributes data pipeline execution across multiple GPUs to scale loading and preprocessing throughput.

    C++audio-processingdata-augmentationdata-processing
    Voir sur GitHub↗5,713
  • stability-ai/stableswarmuiAvatar de Stability-AI

    Stability-AI/StableSwarmUI

    4,929Voir sur GitHub↗

    StableSwarmUI est une interface web et un orchestrateur backend pour la génération d'images Stable Diffusion. Il fonctionne comme un générateur d'images GPU distribué et un pipeline d'images IA modulaire, fournissant un contrôleur centralisé pour gérer les requêtes de génération d'images. Le système se distingue par sa capacité à diviser les tâches de génération sur plusieurs processeurs graphiques pour augmenter le débit par lots. Il utilise une interface agnostique au backend pour se connecter à des serveurs locaux, des serveurs distants et des API cloud, et inclut un concepteur de flux de travail visuel basé sur des graphes pour définir des opérations complexes de traitement d'image. La plateforme inclut un système d'extension de plugins dynamique pour ajouter des fonctionnalités personnalisées et des utilitaires automatisés pour le provisionnement des dépendances au niveau du système. Il combine des outils de génération modulaires et des interfaces d'édition rapides avec la capacité de router les charges de travail sur du matériel distribué.

    Splits image generation batches across multiple graphics processors to increase overall throughput and production speed.

    C#aiimage-generationstable-diffusion
    Voir sur GitHub↗4,929
  • vllm-project/aibrixAvatar de vllm-project

    vllm-project/aibrix

    4,882Voir sur GitHub↗

    Aibrix est un orchestrateur d'inférence conçu pour la mise à l'échelle, le routage et la gestion du déploiement de modèles de langage étendus à travers des clusters vLLM distribués. Il sert de passerelle centralisée pour l'équilibrage de charge et le routage du trafic vers des répliques et des versions de modèles spécifiques. Le système gère l'efficacité des ressources via un autoscaler de cluster GPU qui ajuste le nombre d'instances de calcul en fonction du volume de requêtes en temps réel. Il optimise davantage les opérations en mélangeant différents types d'accélérateurs au sein d'un même cluster et en utilisant un orchestrateur d'adaptateurs de modèles pour déployer des adaptateurs de paramètres légers sur des modèles de base partagés. Les capacités étendues incluent l'utilisation d'un gestionnaire de cache clé-valeur distribué pour partager les données de jetons à travers les moteurs d'inférence et l'implémentation de la surveillance de la santé du matériel pour détecter les défaillances des unités de traitement. Le projet fournit également un pipeline de métriques unifié pour standardiser la collecte de données de performance à travers divers environnements d'exécution.

    Distributes computationally heavy LLM workloads across multiple GPU nodes to increase total throughput.

    Go
    Voir sur GitHub↗4,882
  • mcmonkeyprojects/swarmuiAvatar de mcmonkeyprojects

    mcmonkeyprojects/SwarmUI

    4,238Voir sur GitHub↗

    SwarmUI est une interface web et un orchestrateur pour Stable Diffusion, conçu pour générer des images et des vidéos. Il fonctionne comme un gestionnaire de flux de travail modulaire et une passerelle API permettant la configuration et l'exécution de pipelines d'IA générative. Le système se caractérise par sa capacité à distribuer les charges de travail de génération sur plusieurs cartes graphiques pour augmenter la vitesse de traitement et le débit total. Il utilise une architecture client-serveur découplée et une interface agnostique au backend, permettant à l'interface utilisateur de rester séparée de l'environnement d'exécution du modèle. La plateforme supporte l'extensibilité via une architecture basée sur des plugins pour ajouter de nouveaux composants d'UI et des gestionnaires de logique. Elle fournit un contrôle programmatique via des endpoints HTTP et WebSocket pour permettre aux applications externes de déclencher des générations et de synchroniser l'état en temps réel. Des outils d'administration sont inclus pour accorder et gérer l'accès des utilisateurs distants à l'environnement génératif via un réseau.

    Splits heavy image generation tasks across multiple graphics cards to increase processing speed.

    C#aicomfyuicsharp
    Voir sur GitHub↗4,238
  • jina-ai/discoartAvatar de jina-ai

    jina-ai/discoart

    3,829Voir sur GitHub↗

    Discoart is a diffusion model orchestration framework and distributed GPU generation engine designed to automate and scale image generation workflows across hardware clusters. It functions as a generative AI model API, providing HTTP and gRPC endpoints to trigger and retrieve images from diffusion models as a network service. The system distinguishes itself through a comprehensive task management layer that includes timeline-based prompt and parameter scheduling. It manages the generative art lifecycle by supporting state-based session serialization for recovery, YAML-based configuration mana

    Distributes heavy image generation workloads across multiple GPUs using round-robin scheduling to increase throughput.

    Pythonclip-guided-diffusioncreative-aicreative-art
    Voir sur GitHub↗3,829
  • djdefrag/qualityscalerAvatar de Djdefrag

    Djdefrag/QualityScaler

    2,970Voir sur GitHub↗

    QualityScaler is an AI video upscaler and local media processing tool designed to increase the resolution and visual quality of videos and images. It uses deep learning models to enhance detail and remove noise, operating as an offline application that executes all computations on local hardware. The project functions as a GPU-accelerated media processor that distributes workloads across multiple graphics cards to increase rendering speed. To prevent memory overflow during high-resolution tasks, it employs a tiled image processing method that splits large assets into smaller sections. The sy

    Distributes computational workloads across multiple graphics cards to increase overall video and image rendering speed.

    Pythonamdanimecompression-artifact-reduction
    Voir sur GitHub↗2,970
  • numz/comfyui-seedvr2_videoupscalerAvatar de numz

    numz/ComfyUI-SeedVR2_VideoUpscaler

    2,549Voir sur GitHub↗

    ComfyUI-SeedVR2_VideoUpscaler is an AI video upscaling tool that uses diffusion models to increase the resolution of videos and images while maintaining visual consistency across frames. The project implements distributed video rendering by splitting datasets into chunks for parallel processing across multiple GPUs. It utilizes model compilation and specialized attention backends to reduce inference latency and increase throughput. Additional capabilities include video color correction using wavelet and LAB matching methods to preserve color fidelity. Hardware memory is managed through block

    Distributes heavy media processing tasks across multiple GPUs to increase overall rendering throughput.

    Pythonaicomfyuicomfyui-nodes
    Voir sur GitHub↗2,549
  • rlinf/rlinfAvatar de RLinf

    RLinf/RLinf

    2,502Voir sur GitHub↗

    RLinf is a distributed reinforcement learning orchestrator and embodied AI training framework. It provides the infrastructure to train vision-language-action models and robotic policies using a combination of reinforcement learning and supervised fine-tuning. The system is designed for scaling workloads across GPU clusters, managing the placement of actors, rollout workers, and environment components. It features a specialized robotics data collection pipeline for gathering teleoperated demonstrations and simulation trajectories into standardized replay buffers, alongside a hardware interface

    Coordinates reinforcement learning specific workloads, including rollouts and updates, across a distributed GPU cluster.

    Pythonagentic-aiembodied-aireinforcement-learning
    Voir sur GitHub↗2,502
  1. Home
  2. Artificial Intelligence & ML
  3. Model Optimization
  4. Inference & Deployment
  5. Model Deployment Toolkits
  6. Distributed Deployment Utilities
  7. Multi-GPU Workload Distribution

Explorer les sous-tags

  • Data Pipeline Multi-GPU DistributionDistributing data pipeline execution across multiple GPUs to scale loading and preprocessing throughput for large-scale training workloads. **Distinct from Multi-GPU Workload Distribution:** Distinct from Multi-GPU Workload Distribution: focuses on data pipeline distribution for training, not media processing rendering speed.
  • RL Workload OrchestrationCoordination of reinforcement learning specific workloads including rollouts and updates across a cluster. **Distinct from Multi-GPU Workload Distribution:** Focuses on the specific cycle of RL (rollout, reward, update) across nodes, rather than general media processing workloads.