awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

16 dépôts

Awesome GitHub RepositoriesWorkload Scheduling

Logic for determining the placement of applications on specific cluster nodes based on constraints or taints.

Distinct from Control Planes: Focuses on the scheduling of workloads onto the control plane, rather than the architectural design of the control plane itself.

Explore 16 awesome GitHub repositories matching devops & infrastructure · Workload Scheduling. Refine with filters or upvote what's useful.

Awesome Workload Scheduling GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • infrasys-ai/aisystemAvatar de Infrasys-AI

    Infrasys-AI/AISystem

    17,017Voir sur GitHub↗

    AISystem is a comprehensive AI full-stack infrastructure project covering the entire pipeline from AI chip architecture to high-level training frameworks. It encompasses the development of AI compiler frameworks, inference engines, and distributed training orchestrators designed to coordinate workloads across a heterogeneous compute stack of CPUs, GPUs, and NPUs. The project focuses on the deep integration of software and hardware, employing software-hardware co-design to align tensor layouts with physical memory structures. It provides specialized capabilities for accelerating Transformer mo

    Coordinates workload distribution between matrix cores and general-purpose CPUs using a dedicated AI scheduler.

    Jupyter Notebookaiaiinfraaisys
    Voir sur GitHub↗17,017
  • siderolabs/talosAvatar de siderolabs

    siderolabs/talos

    10,659Voir sur GitHub↗

    Talos is a minimal, immutable Linux distribution designed specifically for deploying and managing Kubernetes clusters. It functions as an API-driven infrastructure manager that replaces traditional shell access with a declarative gRPC interface to control operating system state and configuration. The system is distinguished by its use of a read-only root filesystem and a security-hardened kernel, which removes standard GNU utilities to reduce the attack surface. It ensures environment consistency by distributing the operating system as versioned, signed images and utilizes TPM-backed verified

    Allows user applications to run on management hardware by removing default control plane taints.

    Gocloud-nativecontainerdgo
    Voir sur GitHub↗10,659
  • infrasys-ai/aiinfraAvatar de Infrasys-AI

    Infrasys-AI/AIInfra

    7,414Voir sur GitHub↗

    Dynamically allocates compute, storage, and networking resources for AI training and inference.

    Jupyter Notebookaiinfraaisystem
    Voir sur GitHub↗7,414
  • cncf/curriculumAvatar de cncf

    cncf/curriculum

    6,578Voir sur GitHub↗

    The CNCF Curriculum is an open-source repository that organizes exam domains and learning paths for CNCF certification courses covering Kubernetes and cloud-native technologies. It structures certification content into weighted domains that reflect exam question distribution, providing a structured study guide for candidates preparing for CNCF certifications. The curriculum is organized around multiple cloud-native domains including networking, security, GitOps, platform engineering, and certification preparation. It teaches cloud-native concepts through the lens of building and operating int

    Teaches assigning and managing containerized applications across cluster nodes using scheduling policies.

    cncf
    Voir sur GitHub↗6,578
  • nvidia/isaac-gr00tAvatar de NVIDIA

    NVIDIA/Isaac-GR00T

    6,222Voir sur GitHub↗

    Deploys and scales interdependent AI inference components using topology-aware gang scheduling on Kubernetes.

    Jupyter Notebook
    Voir sur GitHub↗6,222
  • ai-dynamo/dynamoAvatar de ai-dynamo

    ai-dynamo/dynamo

    6,112Voir sur GitHub↗

    Dynamo is a distributed inference orchestration platform designed for large language models. It functions as a system to coordinate prefill and decode phases across GPU nodes, utilizing a multi-backend runtime adapter to connect engines like vLLM and TensorRT-LLM through a unified block-oriented memory interface. An OpenAI-compatible API server provides the frontend for integration with existing tools and clients. The project is distinguished by its disaggregated serving architecture, which separates prompt processing and token generation onto independent GPU pools to optimize throughput and

    Employs a topology-aware operator to optimally place interdependent inference components across racks and hosts.

    Rust
    Voir sur GitHub↗6,112
  • karmada-io/karmadaAvatar de karmada-io

    karmada-io/karmada

    5,501Voir sur GitHub↗

    Karmada est un orchestrateur multi-cluster Kubernetes et un gestionnaire de clusters multi-cloud conçu pour déployer et gérer des applications cloud-native à travers plusieurs clusters et fournisseurs cloud. Il sert de plan de contrôle centralisé qui fonctionne comme un propagateur de ressources et un ordonnanceur de charges de travail, coordonnant les ressources à travers les clouds publics, les centres de données sur site et les emplacements en périphérie (edge). Le projet se distingue par un moteur basé sur des politiques qui distribue les applications en utilisant l'affinité, les contraintes de topologie et les quotas de ressources. Il fournit des capacités spécifiques pour la reprise après sinistre multi-région, incluant le basculement automatisé des applications et des déploiements géo-redondants pour maintenir la disponibilité du service. De plus, il permet la surcharge de ressources consciente du cluster pour spécialiser les paramètres de configuration en fonction de la région ou du fournisseur du cluster cible. Le système couvre un large éventail de domaines opérationnels, incluant la synchronisation d'état bidirectionnelle, le proxying d'API agrégé et l'ordonnancement multidimensionnel. Il inclut des outils pour la gestion du cycle de vie des clusters, la recherche globale de ressources et l'équilibrage de trafic inter-cluster. L'installation et la gestion peuvent être effectuées en utilisant un processus d'installation basé sur un opérateur et une interface en ligne de commande dédiée pour l'administration et les opérations du plan de contrôle.

    Uses affinity rules to provide hints about which specific clusters are most suitable for workload deployment.

    Gocloud-computingcloud-nativecontainers
    Voir sur GitHub↗5,501
  • volcano-sh/volcanoAvatar de volcano-sh

    volcano-sh/volcano

    5,337Voir sur GitHub↗

    Volcano is a Kubernetes-native batch scheduler specialized for AI, machine learning, and high-performance computing workloads. It provides gang scheduling to atomically allocate resources for all tasks of a distributed job, preventing deadlocks from partial allocation, and supports hierarchical queue management for multi-tenant resource isolation with configurable quotas, borrowing, and preemption. Topology-aware placement optimizes communication-intensive workloads by modeling network hierarchy to minimize cross-switch latency. Volcano differentiates itself with automated orchestration of di

    Applies multiple advanced scheduling strategies including gang scheduling, binpack, fair-share, preemption, and topology-aware placement.

    Goaibatch-systemsbigdata
    Voir sur GitHub↗5,337
  • openkruise/kruiseAvatar de openkruise

    openkruise/kruise

    5,272Voir sur GitHub↗

    Kruise est un système de gestion de charges de travail conçu pour les applications à grande échelle sur Kubernetes. Il fournit un framework pour l'orchestration avancée, la mise à l'échelle et les stratégies de mise à jour afin de maintenir la stabilité dans les déploiements massifs. Le projet se distingue par sa capacité à effectuer des mises à jour sur place des images de conteneurs et des limites de ressources sans supprimer ni recréer les pods. Il inclut un pré-extracteur d'images dédié pour accélérer le démarrage des pods et un injecteur de sidecar pour gérer dynamiquement le cycle de vie des conteneurs sidecar. De plus, un distributeur de ressources synchronise les configmaps et les secrets à travers plusieurs namespaces pour une cohérence à l'échelle du cluster. Le système couvre un large éventail de domaines de fonctionnalités, notamment la planification de pods tenant compte de la topologie, les déploiements canary avec contrôle de progression par partition, et l'autoscaling de charges de travail multi-domaines. Il implémente également des protections de haute disponibilité telles que les limites de perturbation des applications, le drainage gracieux du trafic et la prévention de la suppression en cascade. La visibilité opérationnelle est assurée par l'exportation de métriques de ressources, le suivi des délais de déploiement et l'émission de logs structurés.

    Provisions workload subsets across different node groups using labels to target specific domains.

    Gocloud-nativecloudnativecncf
    Voir sur GitHub↗5,272
  • kubernetes-sigs/cluster-apiAvatar de kubernetes-sigs

    kubernetes-sigs/cluster-api

    4,233Voir sur GitHub↗

    Cluster API est un framework déclaratif et un système de gestion multi-cluster pour automatiser la création, la mise à l'échelle et la destruction de clusters Kubernetes à travers diverses infrastructures. Il agit comme un orchestrateur de provisionnement de cluster et un provisionneur d'infrastructure, utilisant un cluster de gestion centralisé pour opérer le cycle de vie complet de multiples clusters de travail distants. Le projet emploie une architecture de plugins basée sur des fournisseurs qui découple la logique d'orchestration centrale des implémentations cloud ou bare-metal spécifiques. Cela permet au système de standardiser le déploiement des plans de contrôle, l'initialisation des nœuds et la gestion de l'infrastructure via un ensemble de contrats de ressources communs et de définitions d'API. Le système couvre une large surface de capacités opérationnelles, incluant l'orchestration de flottes de machines, la mise à l'échelle du plan de contrôle et les mises à niveau déclaratives de clusters. Il gère également les exigences d'infrastructure de bas niveau telles que la distribution des domaines de défaillance, la gestion des adresses IP et la rotation des certificats. Des outils de développement sont fournis pour la simulation de clusters, les tests d'infrastructure portable et le développement de fournisseurs d'initialisation et d'infrastructure personnalisés.

    Implements logic to block pod scheduling on new nodes using taints until initialization is fully complete.

    Gok8s-sig-cluster-lifecycle
    Voir sur GitHub↗4,233
  • fedml-ai/fedmlAvatar de FedML-AI

    FedML-AI/FedML

    4,048Voir sur GitHub↗

    FedML est une bibliothèque d'apprentissage automatique distribué, un framework d'apprentissage fédéré et un orchestrateur de charges de travail GPU. Il fournit les composants système essentiels pour exécuter l'entraînement et le fine-tuning de modèles à grande échelle sur des clusters GPU multi-cloud, sur site et décentralisés, tout en offrant un moteur dédié pour le déploiement de modèles évolutifs et un gestionnaire de pipeline MLOps pour la gestion du cycle de vie de bout en bout. La plateforme se distingue en permettant un apprentissage fédéré préservant la vie privée sur des appareils périphériques décentralisés et des silos organisationnels, en conservant les données brutes sur le matériel local. Elle propose également une place de marché de calcul par mise en commun de ressources qui permet aux utilisateurs de contribuer leur capacité GPU inutilisée à un pool partagé pour l'exécution de tâches distribuées. Le système couvre un large éventail de capacités, notamment l'orchestration GPU multi-cloud, la gestion automatisée des pipelines d'apprentissage automatique et le déploiement d'IA en périphérie pour les appareils IoT et les smartphones. Il intègre en outre des outils pour le fine-tuning de modèles fondamentaux, le déploiement d'inférence à faible latence et le suivi des expériences d'entraînement avec profilage des performances matérielles. Les utilisateurs peuvent lancer et planifier des charges de travail à l'aide d'une interface en ligne de commande et de fichiers de configuration déclaratifs.

    Schedules machine learning workloads across on-premises clusters and multiple GPU cloud environments.

    Python
    Voir sur GitHub↗4,048
  • iree-org/ireeAvatar de iree-org

    iree-org/iree

    3,819Voir sur GitHub↗

    IREE is an MLIR-based compiler toolchain and runtime designed to translate machine learning models from various frameworks into optimized binaries for execution across diverse hardware targets. It provides a unified pipeline to ingest models from PyTorch, TensorFlow, JAX, and ONNX, lowering them into a common intermediate representation for deployment on CPUs, GPUs, and bare-metal embedded systems. The project distinguishes itself through a bytecode virtual machine and a hardware abstraction layer that decouple high-level model logic from specific hardware instruction sets. It supports sophis

    Fills hardware idle periods by scheduling unrelated tasks that do not share causal dependencies.

    C++compilercudajax
    Voir sur GitHub↗3,819
  • project-hami/hamiAvatar de Project-HAMi

    Project-HAMi/HAMi

    3,028Voir sur GitHub↗

    HAMi is a hardware orchestration and virtualization system designed to manage accelerators within Kubernetes. It functions as a device plugin that partitions physical hardware into isolated virtual slices, enabling multiple containers to share a single device through enforced memory limits and compute quotas. The project provides a virtualization manager and a heterogeneous compute scheduler that distributes tasks across diverse accelerator types. It uses packing and topology policies to optimize workload placement and allows for specific hardware targeting using unique device identifiers. T

    Assigns tasks to hardware nodes using topology-aware policies to maximize throughput and proximity.

    Goascendcambriconcncf
    Voir sur GitHub↗3,028
  • aurae-runtime/auraeAvatar de aurae-runtime

    aurae-runtime/aurae

    1,907Voir sur GitHub↗

    Aurae is a memory-safe distributed systems runtime daemon written in Rust that acts as a container and process orchestrator. It manages and schedules workloads, containers, and virtual machines across distributed infrastructure nodes using remote procedure calls and isolated kernel-level boundaries. The platform provides a mutual transport-layer security gateway that enforces cryptographic identity and socket-level authentication across distributed infrastructure. It includes enterprise workload isolation features to secure control planes and manage multi-tenant processes on host operating sy

    Schedules fundamental system processes and executable workloads remotely across distributed nodes.

    Rustdaemondistributed-systemslinux
    Voir sur GitHub↗1,907
  • kvaps/kubectl-node-shellAvatar de kvaps

    kvaps/kubectl-node-shell

    1,818Voir sur GitHub↗

    Ce projet est un plugin en ligne de commande pour Kubernetes qui fournit un accès root direct au shell du système d'exploitation hôte sous-jacent d'un nœud de cluster. Il est conçu pour faciliter les tâches administratives, la maintenance système et les opérations de diagnostic sur les nœuds, y compris ceux exécutant des systèmes d'exploitation immuables ou optimisés pour les conteneurs qui manquent d'environnements shell natifs. L'outil fonctionne en planifiant dynamiquement des pods éphémères et privilégiés qui partagent les espaces de noms de processus, réseau et système de fichiers de l'hôte. En tirant parti des contraintes d'affinité de nœud, il garantit que ces sessions de diagnostic sont exécutées sur l'hôte cible spécifique, permettant aux utilisateurs d'interagir avec le répertoire racine et les processus système du nœud comme s'ils étaient connectés localement. Au-delà des sessions shell interactives, l'utilitaire prend en charge l'exécution de commandes à distance pour automatiser les changements de configuration ou récupérer des données de diagnostic à travers le cluster. Il fournit également des capacités pour attacher des volumes de stockage persistants à ces environnements temporaires, permettant la récupération de données et le transfert d'informations entre les périphériques locaux du nœud et les systèmes de stockage externes.

    Schedules ephemeral diagnostic pods onto specific cluster nodes to facilitate system-level maintenance tasks.

    Shellkubectlkubectl-enterkubectl-node-shell
    Voir sur GitHub↗1,818
  • coreos/etcd-operatorAvatar de coreos

    coreos/etcd-operator

    1,758Voir sur GitHub↗

    The etcd-operator is a custom resource controller designed to automate the deployment, scaling, backup, and recovery of distributed key-value storage clusters on container orchestration platforms. By extending container orchestration APIs with custom resource definitions, the system manages multi-node database instances through declarative configuration files and a continuous controller reconciliation loop that drives cluster provisioning, scaling, and maintenance. The operator provides automated cluster member recovery, detecting unresponsive nodes and executing membership replacements to pr

    Restricts cluster workloads to specific hardware nodes using node selectors and taints.

    Goetcdkubernetesoperator
    Voir sur GitHub↗1,758
  1. Home
  2. DevOps & Infrastructure
  3. Control Planes
  4. Workload Scheduling

Explorer les sous-tags

  • AI Workload Schedulers1 sous-tagDynamic allocation of compute, storage, and networking resources for AI training and inference tasks using Kubernetes and HPC schedulers. **Distinct from Workload Scheduling:** Distinct from Workload Scheduling: focuses on AI-specific resource allocation for training and inference rather than general application placement.
  • Affinity-Based PlacementScheduling logic that uses affinity rules to identify the most suitable clusters for specific workload deployments. **Distinct from GPU Affinity Schedulers:** Focuses on cluster-level affinity hints rather than GPU-specific node topology.
  • Multi-Domain DeploymentProvisioning workload subsets across diverse node groups using domain-specific labels. **Distinct from Workload Scheduling:** Focuses on multi-domain/subset distribution rather than general node placement constraints.
  • Node ConfigurationsConfiguration management capabilities for targeting and setting up remote infrastructure nodes. **Distinct from Workload Scheduling:** Distinct from general workload scheduling: focuses specifically on managing target node settings alongside workload placement.
  • Topology-Aware PlacementScheduling logic that uses metadata like region and zone to optimize workload proximity and performance. **Distinct from Topology-Aware Schedulers:** General topology awareness for any workload, not limited to AI inference components.
  • Workload InterleavingScheduling independent tasks to fill hardware idle periods and maximize resource utilization. **Distinct from Workload Scheduling:** Distinct from general Workload Scheduling by focusing on the interleaving of independent tasks to hide latency.