2 dépôts
Specifically rebuilding failed nodes to maintain cluster health and availability.
Distinct from Cluster Node Management: Narrower than general node management, focusing specifically on the recovery of failed nodes.
Explore 2 awesome GitHub repositories matching devops & infrastructure · Failed Node Rebuilding. Refine with filters or upvote what's useful.
KubeOperator est une plateforme complète de gestion de cluster Kubernetes, un orchestrateur d'infrastructure et un gestionnaire multi-cluster. Il fonctionne comme une distribution Kubernetes d'entreprise conçue pour automatiser le déploiement, la mise à l'échelle et la gestion du cycle de vie des clusters de production sur diverses plateformes cloud et machines physiques. La plateforme se distingue par des capacités spécialisées pour les environnements isolés (air-gapped), y compris un moteur d'installation hors ligne qui génère des archives logicielles et gère des registres privés pour des déploiements sécurisés sans internet. Elle fournit également un tableau de bord centralisé pour les opérations de flotte, permettant l'importation de clusters externes et l'orchestration de l'infrastructure à travers différentes régions géographiques et zones de disponibilité. Le système couvre une large surface opérationnelle, y compris le provisionnement automatisé de machines virtuelles, le suivi de l'inventaire matériel et la gestion déclarative du cycle de vie pour le patching et la mise à l'échelle. Il intègre des services de sauvegarde et de récupération, un contrôle d'accès basé sur les rôles avec synchronisation LDAP, et une surveillance complète de la santé et des métriques de performance du cluster. Les tâches administratives et les opérations de cluster sont exécutées via une interface web.
Rebuilds nodes that have experienced failures to ensure continuous cluster availability.
The etcd-operator is a custom resource controller designed to automate the deployment, scaling, backup, and recovery of distributed key-value storage clusters on container orchestration platforms. By extending container orchestration APIs with custom resource definitions, the system manages multi-node database instances through declarative configuration files and a continuous controller reconciliation loop that drives cluster provisioning, scaling, and maintenance. The operator provides automated cluster member recovery, detecting unresponsive nodes and executing membership replacements to pr
Identifies unresponsive nodes and provisions replacement instances automatically to preserve quorum integrity.