awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

24 dépôts

Awesome GitHub RepositoriesDistributed Cluster Coordination

Mechanisms for synchronizing state and scheduling across multiple compute nodes using a shared source of truth.

Distinct from Distributed Database Coordination: Focuses on general cluster-wide job state synchronization rather than specific database internal distribution or node lifecycles.

Explore 24 awesome GitHub repositories matching software engineering & architecture · Distributed Cluster Coordination. Refine with filters or upvote what's useful.

Awesome Distributed Cluster Coordination GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • nathanmarz/stormAvatar de nathanmarz

    nathanmarz/storm

    8,772Voir sur GitHub↗

    Storm is a distributed stream processing framework and fault-tolerant compute engine designed for executing real-time continuous computations across a cluster of machines. It functions as a stateful stream processor and cluster topology manager, enabling the deployment and monitoring of distributed data flow configurations. The system ensures exactly-once semantics by utilizing transactional state management to guarantee that every message in a data stream is processed exactly one time. It further operates as a distributed RPC system, allowing for the integration of non-native languages throu

    Implements centralized synchronization and scheduling of data flows across compute nodes.

    Java
    Voir sur GitHub↗8,772
  • alibaba/otterAvatar de alibaba

    alibaba/otter

    8,127Voir sur GitHub↗

    Otter is a distributed database synchronization system and change data capture tool designed to replicate data between databases across multiple geographic regions. It functions as a synchronization orchestrator and ETL data pipeline that mirrors records and associated files in real time. The system employs incremental log parsing to capture database changes and utilizes a consistency-based convergence algorithm and loop-avoidance logic to manage bi-directional replication. It processes data through a pipeline of selection, extraction, transformation, and loading to handle joins and format co

    Coordinates nodes across multiple geographic regions using a shared source of truth to optimize read efficiency.

    Java
    Voir sur GitHub↗8,127
  • exrick/xmallAvatar de Exrick

    Exrick/xmall

    7,232Voir sur GitHub↗

    xmall is a distributed e-commerce platform based on a service-oriented architecture. It separates business logic into independent services that communicate over a network to ensure scalability and fault tolerance, utilizing a decoupled storefront interface for customer transactions. The platform employs a distributed architecture using Dubbo for service orchestration and Zookeeper for cluster coordination and service discovery. It integrates a specialized set of components including an asynchronous message broker for background tasks, an indexed search system for product catalogs, and a centr

    Uses Zookeeper for synchronizing cluster state and coordinating service discovery across nodes.

    Javadubboelasticsearchmq
    Voir sur GitHub↗7,232
  • apache/stormAvatar de apache

    apache/storm

    6,683Voir sur GitHub↗

    Storm is a distributed stream processing framework designed to execute unbounded computations across a cluster to process real-time data streams. It functions as a data pipeline orchestrator that allows users to define and deploy declarative data flow graphs connecting streaming sources to processing components. The system operates as a multi-tenant distributed compute engine that isolates workloads and limits resource usage across shared clusters using dedicated pools and access control. It is also a secure distributed processing engine that employs encrypted node communication and SSL-secur

    Utilizes Zookeeper for distributed cluster coordination, managing leader election and worker synchronization.

    Java
    Voir sur GitHub↗6,683
  • apache/incubator-stormAvatar de apache

    apache/incubator-storm

    6,683Voir sur GitHub↗

    Apache Storm is a distributed stream processing framework and real-time data processing engine. It functions as a fault-tolerant distributed computing system designed to analyze data in motion across a cluster of machines for continuous stream computation. The system enables the creation of fault-tolerant data pipelines and scalable event processing by distributing workloads across a network of computing nodes. This architecture ensures low latency and high throughput for live data while allowing the system to recover automatically from individual node failures. The framework provides capabi

    Uses ZooKeeper to synchronize cluster state and track the health of supervisor and worker nodes.

    Java
    Voir sur GitHub↗6,683
  • flashlight/flashlightAvatar de flashlight

    flashlight/flashlight

    5,443Voir sur GitHub↗

    Flashlight est une bibliothèque de machine learning et de tenseurs autonome en C++ utilisée pour construire et entraîner des réseaux de neurones. Elle fonctionne comme un framework complet de réseaux de neurones et un moteur de différenciation automatique, fournissant les outils pour construire des graphes de calcul et calculer les gradients via la rétropropagation. Le projet sert de framework d'entraînement distribué, utilisant des opérations all-reduce pour synchroniser les gradients et les paramètres sur plusieurs nœuds de calcul et appareils. Il se distingue par une intégration profonde de la manipulation de tenseurs haute performance, l'interopérabilité native de la mémoire des appareils et un système pour synchroniser les poids entre les workers distribués afin d'accélérer l'entraînement de modèles à grande échelle. Le framework couvre un large éventail de capacités de deep learning, incluant la composition modulaire de couches pour concevoir des architectures complexes comme des blocs résiduels et des cellules récurrentes. Il fournit des utilitaires étendus de gestion de données pour l'ingestion et le préchargement, ainsi que des systèmes de sérialisation pour persister les états de modèle. De plus, il inclut une suite d'outils de surveillance et d'observabilité pour suivre les métriques d'entraînement et mesurer les erreurs de séquence. La bibliothèque est implémentée en C++.

    Coordinates multiple processes and devices across a cluster using shared filesystems for parallel computation.

    C++
    Voir sur GitHub↗5,443
  • vonng/pigstyAvatar de Vonng

    Vonng/pigsty

    5,172Voir sur GitHub↗

    Pigsty est une plateforme d'orchestration d'infrastructure de base de données complète conçue pour automatiser le cycle de vie complet des clusters PostgreSQL à haute disponibilité. Il fonctionne comme un framework d'infrastructure en tant que code qui gère la coordination des clusters, le provisionnement des nœuds et la découverte de services via des playbooks idempotents. En intégrant des mécanismes de consensus distribués, la plateforme assure un basculement automatisé et une application cohérente de l'état à travers divers environnements, y compris le matériel nu et l'infrastructure virtualisée. La plateforme se distingue par une suite robuste de capacités opérationnelles qui s'étendent au-delà de la gestion de base de données standard. Elle dispose d'un pipeline d'observabilité intégré qui agrège les métriques, les logs et les traces dans des tableaux de bord centralisés pour une surveillance des performances en temps réel et une analyse diagnostique. De plus, elle fournit un framework de migration qui émule les protocoles filaires propriétaires et la syntaxe SQL, permettant l'intégration de charges de travail de base de données d'entreprise héritées dans des environnements relationnels modernes. Le système couvre une large surface fonctionnelle, y compris la gestion avancée du stockage avec clonage par copie sur écriture pour un déploiement rapide, et l'orchestration multi-base de données qui coordonne les moteurs relationnels avec la mise en cache et le stockage d'objets. Il intègre également le renforcement de la sécurité, la sauvegarde et la récupération automatisées, et le routage du trafic via des proxys en couches pour découpler les connexions client de la topologie de cluster sous-jacente. Le projet est distribué sous forme de modèle de miroir de package autonome, permettant un déploiement et une gestion des dépendances cohérents dans des environnements sécurisés ou isolés.

    Configures load balancers to route traffic to specific database roles or instances based on defined service ports and health checks.

    Shell
    Voir sur GitHub↗5,172
  • m3db/m3Avatar de m3db

    m3db/m3

    4,895Voir sur GitHub↗

    m3 est une base de données de séries temporelles distribuée conçue pour les métriques haute résolution et la gestion de données à haute cardinalité. Elle fonctionne comme un système de stockage évolutif et un moteur de requête multi-cluster, fournissant un agrégateur de métriques distribué capable de sous-échantillonner et de résumer les données avant qu'elles ne soient validées dans le stockage. Le projet se distingue par un modèle de cluster coordonné utilisant etcd pour l'appartenance aux nœuds et le placement des shards. Il prend en charge plusieurs protocoles d'ingestion, notamment le protocole d'écriture à distance Prometheus, le protocole InfluxDB line et le protocole Graphite Carbon en texte brut, et fournit des interfaces de requête compatibles pour PromQL et Graphite. Le système couvre de larges domaines de capacités, notamment le stockage de séries temporelles en colonnes, la réplication synchrone des données et le fan-out de requêtes distribuées. Il intègre l'automatisation du cycle de vie des données, le réglage de la cohérence basé sur le quorum et l'indexation des séries basée sur les tags pour maintenir l'intégrité des données et la vitesse de récupération à travers des espaces de noms isolés. L'orchestration du cluster et le placement des composants sont gérés via des outils automatisés et des opérateurs pour assurer une haute disponibilité et une distribution équilibrée des données.

    Routes read and write requests across a distributed set of storage nodes while managing cluster topology.

    Go
    Voir sur GitHub↗4,895
  • lunatic-solutions/lunaticAvatar de lunatic-solutions

    lunatic-solutions/lunatic

    4,867Voir sur GitHub↗

    Lunatic est un runtime WebAssembly et un gestionnaire de processus concurrent qui implémente un modèle inspiré d'Erlang de concurrence légère et de tolérance aux pannes. Il fonctionne comme un système d'acteurs distribué où des processus isolés communiquent via le passage de messages à travers un réseau de nœuds liés. Le système utilise un environnement sandbox WebAssembly pour isoler la mémoire et restreindre les permissions d'appel système pour chaque processus individuel. Ce modèle de sécurité basé sur les capacités garantit que les processus sont isolés pour exécuter en toute sécurité du code non fiable. La plateforme fournit un arbre de supervision tolérant aux pannes pour la surveillance hiérarchique et les redémarrages automatiques des processus défaillants. Elle gère les charges de travail à haute concurrence en utilisant un ordonnanceur préemptif de type work-stealing pour exécuter des milliers de threads légers (green threads). Le runtime prend en charge la coordination de systèmes distribués en regroupant des nœuds à travers différentes machines physiques et gère le trafic réseau pour des protocoles tels que TCP et WebSockets.

    Enables multiple runtime instances to connect over a network to coordinate workloads and synchronize state across different machines.

    Rustactorsassemblyscripterlang
    Voir sur GitHub↗4,867
  • sorintlab/stolonAvatar de sorintlab

    sorintlab/stolon

    4,816Voir sur GitHub↗

    Stolon est un gestionnaire et orchestrateur de base de données cloud-native pour PostgreSQL. Il fonctionne comme un gestionnaire de haute disponibilité conçu pour automatiser le basculement (failover), la réplication et la gestion de cluster dans des environnements distribués. Le système coordonne la mise en miroir synchrone et asynchrone des données et utilise un mécanisme de découverte de service pour détecter dynamiquement les adresses des nœuds de base de données. Il achemine le trafic client vers l'instance primaire actuelle via un proxy pour maintenir l'accès à l'application lors des changements de rôle. Le projet couvre la reprise après sinistre (disaster recovery) via la récupération à un instant T et la maintenance de clusters de secours multi-sites. Il inclut également des capacités pour sécuriser les connexions à la base de données via le chiffrement et l'automatisation de la détection des changements d'adresse de processus au sein du réseau.

    Routes database read and write requests across distributed nodes to ensure clients reach the active primary.

    Go
    Voir sur GitHub↗4,816
  • canonical/lxdAvatar de canonical

    canonical/lxd

    4,788Voir sur GitHub↗

    LXD est un gestionnaire de conteneurs système et un gestionnaire de machines virtuelles qui fournit une interface unifiée pour exécuter des systèmes Linux complets. Il agit comme un orchestrateur de cluster de conteneurs, un convertisseur de format d'image et un gestionnaire d'infrastructure qui expose le contrôle via une API REST et des SDK spécifiques au langage. Le projet se distingue en fournissant une abstraction unifiée de conteneur et de machine virtuelle, traitant les deux comme des instances génériques au sein d'une seule couche de gestion. Il prend en charge la coordination de cluster distribué pour synchroniser l'état et distribuer les charges de travail à travers plusieurs nœuds physiques. Le système couvre le contrôle d'infrastructure programmatique via une interface de gestion basée sur REST et un modèle d'orchestration basé sur un démon. Il inclut des capacités pour la conversion d'image multi-format, la mise à l'échelle de cluster multi-nœuds et l'exécution d'instances de machines virtualisées nécessitant une émulation matérielle complète.

    Synchronizes state and distributes workloads across multiple physical nodes to treat data center racks as a single pool.

    Go
    Voir sur GitHub↗4,788
  • zlt2000/microservices-platformAvatar de zlt2000

    zlt2000/microservices-platform

    4,735Voir sur GitHub↗

    Ce projet est une architecture d'entreprise complète pour construire des systèmes distribués multi-locataires, implémentée en tant que plateforme de microservices Spring Cloud. Il fournit un framework complet pour gérer les microservices, en se concentrant sur l'architecture de données multi-locataires et la fourniture d'identité centralisée. La plateforme se distingue par son approche intégrée de l'identité et de la sécurité, utilisant un fournisseur d'identité OAuth2 pour gérer l'authentification unique (SSO), le contrôle d'accès basé sur les rôles et l'émission de jetons JWT à travers les services distribués. Elle sépare en outre les frontières organisationnelles via l'isolation des données multi-locataires, garantissant que les ressources et les données sont logiquement ou physiquement partitionnées entre différents locataires. Le système couvre une large surface de capacités distribuées, notamment la gouvernance des services via le routage par passerelle API et le circuit breaking, et la coordination des données via des transactions distribuées et des mécanismes de verrouillage. Il inclut également une pile d'observabilité distribuée pour le traçage des requêtes et la journalisation centralisée, ainsi qu'une synchronisation de moteur de recherche en temps réel et une messagerie asynchrone pilotée par événements. Le flux de travail de développement est pris en charge par des outils d'automatisation pour la génération de code d'application et l'empaquetage de binaires spécifiques à la plateforme.

    Provides mechanisms for synchronizing state and scheduling distributed jobs across multiple compute nodes.

    Javaelkgpejava
    Voir sur GitHub↗4,735
  • splware/esprocAvatar de SPLWare

    SPLWare/esProc

    4,685Voir sur GitHub↗

    esProc est un framework ETL distribué et un moteur de calcul de données embarqué. Il fournit un langage de données structurées pour la Java Virtual Machine conçu pour les requêtes relationnelles, le calcul de données complexe et l'analyse de données structurées. Le système dispose d'une interface de requête de données en langage naturel qui exploite les grands modèles de langage pour traduire les requêtes en requêtes exécutables sur des jeux de données structurés. Il emploie un langage de requête spécifique au domaine avec une syntaxe concise pour établir des relations de table et récupérer des informations. La plateforme couvre l'intégration de données à travers des sources relationnelles et NoSQL disparates et gère les flux de travail ETL pour déplacer les données entre les fichiers et les bases de données. Les capacités supplémentaires incluent la génération de rapports de données structurées, une interface de grille en temps réel pour la visualisation de l'exécution étape par étape, et la capacité d'intégrer des bibliothèques partagées externes personnalisées.

    Provides mechanisms for synchronizing state and scheduling across multiple compute nodes to handle large-scale processing.

    Javacluster-computingdatabasedataset
    Voir sur GitHub↗4,685
  • dotnetcore/freesqlAvatar de dotnetcore

    dotnetcore/FreeSql

    4,388Voir sur GitHub↗

    FreeSql is a .NET object-relational mapper and data access layer that translates object-oriented code into SQL for multiple relational database providers. It functions as a fluent SQL query builder and database schema synchronizer, allowing developers to align database table and index structures with entity class definitions. The framework is specifically optimized for .NET Native AOT to ensure reduced memory footprints and faster startup times. It includes a database traffic manager to distribute load through read-write splitting, dynamic table sharding, and tenant-based data isolation. Bro

    Routes read and write requests across distributed database nodes to manage traffic and load.

    C#accessclickhousecodefirst
    Voir sur GitHub↗4,388
  • bjmashibing/internetarchitectAvatar de bjmashibing

    bjmashibing/InternetArchitect

    4,277Voir sur GitHub↗

    InternetArchitect est une collection éducative de documents et de code source conçue comme un cours d'architecture à haute concurrence. Il sert de guide d'implémentation de systèmes distribués, fournissant des patterns techniques et des exemples pratiques pour concevoir des architectures internet scalables qui maintiennent la stabilité sous de lourdes charges de trafic. Le projet se concentre sur l'optimisation des bases de données haute performance et les patterns de conception de microservices. Il couvre des stratégies pour réduire la latence et augmenter le débit via le sharding de base de données et les couches de proxy, ainsi que la coordination de l'état global à travers des clusters distribués. La portée architecturale inclut des stratégies de mise en cache multi-niveaux pour accélérer la récupération des données et l'implémentation de frameworks de découverte de services pour gérer la communication entre les microservices découplés. Il aborde également la coordination d'état distribué et l'utilisation de maillages d'équilibrage de charge pour distribuer le trafic réseau à travers les serveurs backend.

    Provides mechanisms for synchronizing state and configuration across multiple compute nodes using a shared source of truth.

    Java
    Voir sur GitHub↗4,277
  • mgp/book-notesAvatar de mgp

    mgp/book-notes

    4,097Voir sur GitHub↗

    Ce projet est une base de connaissances personnelle basée sur Markdown et un journal d'apprentissage numérique utilisé pour stocker des notes et des résumés de livres et de littérature technique. Il sert de dépôt de résumés de lecture et de bibliothèque de référence technique pour archiver les points clés et les idées tirés de documents non-fictionnels et professionnels. La collection fonctionne comme un jardin numérique pour organiser les idées issues de livres, d'articles et de vidéos. Elle se concentre spécifiquement sur la distillation de modèles architecturaux complexes, de concepts techniques et de principes de leadership professionnel dans un format interrogeable pour une référence à long terme. Le dépôt organise également les connaissances personnelles à travers la collecte de frameworks de réflexion réutilisables, de modèles mentaux et d'outils de prise de décision professionnelle. Il inclut un système pour suivre la progression de lecture en gérant des listes d'ouvrages terminés et en cours.

    Documents architectural patterns for routing read and write operations across master and slave database instances.

    book-notesbooksnotes
    Voir sur GitHub↗4,097
  • flagai-open/flagaiAvatar de FlagAI-Open

    FlagAI-Open/FlagAI

    3,870Voir sur GitHub↗

    FlagAI is a distributed deep learning framework and platform designed for the end-to-end lifecycle of large-scale foundation models. It provides a toolkit for training, fine-tuning, and deploying large language models and multi-modal systems across multi-node computing clusters. The project features hardware-agnostic compute abstractions to ensure consistent execution across different accelerators. It includes a dedicated library for parameter-efficient fine-tuning, allowing large neural networks to be adapted to specific tasks with minimal parameter updates and reduced computational overhead

    Implements a distributed orchestration layer to manage gradient synchronization and model state across nodes.

    Python
    Voir sur GitHub↗3,870
  • netflix/maestroAvatar de Netflix

    Netflix/maestro

    3,794Voir sur GitHub↗

    Maestro is a distributed job scheduler and containerized data pipeline tool designed to coordinate complex sequences of tasks. It functions as a Kubernetes workflow orchestrator and MLOps automation platform, utilizing directed acyclic graphs to manage task dependencies and execution order across computing clusters. The system distinguishes itself through the use of isolated container environments for each workflow step, ensuring consistent runtime dependencies. It incorporates an asynchronous event bus to coordinate state transitions and provides lifecycle hook integration that dispatches sy

    Coordinates the deployment and monitoring of containerized tasks across multiple computing clusters.

    Javaagentic-workflowanalyticsautomation
    Voir sur GitHub↗3,794
  • oban-bg/obanAvatar de oban-bg

    oban-bg/oban

    3,812Voir sur GitHub↗

    Oban is a distributed background job processing system and task scheduler that uses PostgreSQL for transactional job storage and reliable execution across multiple nodes. It serves as a PostgreSQL-backed background worker and job queue, coordinating task execution and concurrency through a relational database to ensure delivery guarantees. The system differentiates itself through a distributed workflow orchestrator capable of managing multi-step processing pipelines, dependent job sequencing, and shared context. It provides advanced orchestration tools including job batching, chunked processi

    Synchronizes job state and scheduling across cluster nodes using a shared PostgreSQL database as the source of truth.

    Elixir
    Voir sur GitHub↗3,812
  • lonng/nanoAvatar de lonng

    lonng/nano

    3,173Voir sur GitHub↗

    Nano is a distributed application framework designed for building systems using an actor-based messaging model. It functions as a distributed actor framework that decouples components through asynchronous messaging to maintain state isolation across a server cluster. The system acts as a cluster message dispatcher and session-aware request router, tracking client state to route incoming messages to the specific agent holding the session data. It utilizes a distributed agent registry to coordinate the dispatching of messages between multiple application instances acting as agents. The framewo

    Routes messages to specific application instances using a distributed registry of active agent locations.

    Godistributed-systemsgamegolang
    Voir sur GitHub↗3,173
Préc.12Suivant
  1. Home
  2. Software Engineering & Architecture
  3. Distributed Cluster Coordination

Explorer les sous-tags

  • Database Traffic RoutingRouting mechanisms specifically for directing read and write requests across distributed database nodes. **Distinct from Distributed Cluster Coordination:** Focuses on database request routing (read/write) rather than general compute cluster state synchronization
  • Metadata-Driven Cluster ManagementsTracks the physical location of data shards using a central catalog to coordinate operations across the distributed system. **Distinct from Distributed Cluster Coordination:** Distinct from Distributed Cluster Coordination: focuses specifically on database shard location tracking via a central catalog rather than general job state synchronization.
  • Virtual Cluster CoordinationCoordinates virtual control planes across multiple physical host clusters and data centers. **Distinct from Distributed Cluster Coordination:** Distinct from Distributed Cluster Coordination: specifically manages the coordination of virtualized Kubernetes control planes rather than generic job state synchronization.