awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

24 repositorios

Awesome GitHub RepositoriesDistributed Cluster Coordination

Mechanisms for synchronizing state and scheduling across multiple compute nodes using a shared source of truth.

Distinct from Distributed Database Coordination: Focuses on general cluster-wide job state synchronization rather than specific database internal distribution or node lifecycles.

Explore 24 awesome GitHub repositories matching software engineering & architecture · Distributed Cluster Coordination. Refine with filters or upvote what's useful.

Awesome Distributed Cluster Coordination GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • nathanmarz/stormAvatar de nathanmarz

    nathanmarz/storm

    8,772Ver en GitHub↗

    Storm is a distributed stream processing framework and fault-tolerant compute engine designed for executing real-time continuous computations across a cluster of machines. It functions as a stateful stream processor and cluster topology manager, enabling the deployment and monitoring of distributed data flow configurations. The system ensures exactly-once semantics by utilizing transactional state management to guarantee that every message in a data stream is processed exactly one time. It further operates as a distributed RPC system, allowing for the integration of non-native languages throu

    Implements centralized synchronization and scheduling of data flows across compute nodes.

    Java
    Ver en GitHub↗8,772
  • alibaba/otterAvatar de alibaba

    alibaba/otter

    8,127Ver en GitHub↗

    Otter is a distributed database synchronization system and change data capture tool designed to replicate data between databases across multiple geographic regions. It functions as a synchronization orchestrator and ETL data pipeline that mirrors records and associated files in real time. The system employs incremental log parsing to capture database changes and utilizes a consistency-based convergence algorithm and loop-avoidance logic to manage bi-directional replication. It processes data through a pipeline of selection, extraction, transformation, and loading to handle joins and format co

    Coordinates nodes across multiple geographic regions using a shared source of truth to optimize read efficiency.

    Java
    Ver en GitHub↗8,127
  • exrick/xmallAvatar de Exrick

    Exrick/xmall

    7,232Ver en GitHub↗

    xmall is a distributed e-commerce platform based on a service-oriented architecture. It separates business logic into independent services that communicate over a network to ensure scalability and fault tolerance, utilizing a decoupled storefront interface for customer transactions. The platform employs a distributed architecture using Dubbo for service orchestration and Zookeeper for cluster coordination and service discovery. It integrates a specialized set of components including an asynchronous message broker for background tasks, an indexed search system for product catalogs, and a centr

    Uses Zookeeper for synchronizing cluster state and coordinating service discovery across nodes.

    Javadubboelasticsearchmq
    Ver en GitHub↗7,232
  • apache/stormAvatar de apache

    apache/storm

    6,683Ver en GitHub↗

    Storm is a distributed stream processing framework designed to execute unbounded computations across a cluster to process real-time data streams. It functions as a data pipeline orchestrator that allows users to define and deploy declarative data flow graphs connecting streaming sources to processing components. The system operates as a multi-tenant distributed compute engine that isolates workloads and limits resource usage across shared clusters using dedicated pools and access control. It is also a secure distributed processing engine that employs encrypted node communication and SSL-secur

    Utilizes Zookeeper for distributed cluster coordination, managing leader election and worker synchronization.

    Java
    Ver en GitHub↗6,683
  • apache/incubator-stormAvatar de apache

    apache/incubator-storm

    6,683Ver en GitHub↗

    Apache Storm is a distributed stream processing framework and real-time data processing engine. It functions as a fault-tolerant distributed computing system designed to analyze data in motion across a cluster of machines for continuous stream computation. The system enables the creation of fault-tolerant data pipelines and scalable event processing by distributing workloads across a network of computing nodes. This architecture ensures low latency and high throughput for live data while allowing the system to recover automatically from individual node failures. The framework provides capabi

    Uses ZooKeeper to synchronize cluster state and track the health of supervisor and worker nodes.

    Java
    Ver en GitHub↗6,683
  • flashlight/flashlightAvatar de flashlight

    flashlight/flashlight

    5,443Ver en GitHub↗

    Flashlight es una biblioteca de aprendizaje automático y de tensores independiente en C++ utilizada para construir y entrenar redes neuronales. Funciona como un framework integral de redes neuronales y motor de diferenciación automática, proporcionando las herramientas para construir grafos de computación y calcular gradientes mediante retropropagación. El proyecto sirve como framework de entrenamiento distribuido, utilizando operaciones all-reduce para sincronizar gradientes y parámetros a través de múltiples nodos de cómputo y dispositivos. Se distingue por una integración profunda de manipulación de tensores de alto rendimiento, interoperabilidad nativa de memoria de dispositivo y un sistema para sincronizar pesos a través de trabajadores distribuidos para acelerar el entrenamiento de modelos a gran escala. El framework cubre una amplia gama de capacidades de aprendizaje profundo, incluyendo composición modular de capas para diseñar arquitecturas complejas como bloques residuales y celdas recurrentes. Proporciona utilidades extensas de gestión de datos para ingesta y prefetching, junto con sistemas de serialización para persistir estados de modelos. Además, incluye una suite de herramientas de monitorización y observabilidad para rastrear métricas de entrenamiento y medir errores de secuencia. La biblioteca está implementada en C++.

    Coordinates multiple processes and devices across a cluster using shared filesystems for parallel computation.

    C++
    Ver en GitHub↗5,443
  • vonng/pigstyAvatar de Vonng

    Vonng/pigsty

    5,172Ver en GitHub↗

    Pigsty es una plataforma integral de orquestación de infraestructura de bases de datos diseñada para automatizar el ciclo de vida completo de clústeres de PostgreSQL de alta disponibilidad. Funciona como un framework de infraestructura como código que gestiona la coordinación de clústeres, el aprovisionamiento de nodos y el descubrimiento de servicios a través de playbooks idempotentes. Al integrar mecanismos de consenso distribuido, la plataforma garantiza la conmutación por error automatizada y la aplicación de estado consistente en diversos entornos, incluyendo infraestructura bare metal y virtualizada. La plataforma se distingue por un sólido conjunto de capacidades operativas que se extienden más allá de la gestión estándar de bases de datos. Cuenta con una tubería de observabilidad integrada que agrega métricas, registros y trazas en paneles centralizados para la monitorización del rendimiento en tiempo real y el análisis de diagnóstico. Además, proporciona un framework de migración que emula protocolos de cable propietarios y sintaxis SQL, permitiendo la integración de cargas de trabajo de bases de datos empresariales heredadas en entornos relacionales modernos. El sistema cubre una amplia superficie funcional, incluyendo gestión avanzada de almacenamiento con clonación de copia en escritura para un despliegue rápido, y orquestación de múltiples bases de datos que coordina motores relacionales con almacenamiento en caché y almacenamiento de objetos. También incorpora endurecimiento de seguridad, copia de seguridad y recuperación automatizadas, y enrutamiento de tráfico a través de proxies en capas para desacoplar las conexiones de los clientes de la topología del clúster subyacente. El proyecto se distribuye como un modelo de espejo de paquetes autónomo, lo que permite un despliegue y una gestión de dependencias consistentes en entornos seguros o aislados.

    Configures load balancers to route traffic to specific database roles or instances based on defined service ports and health checks.

    Shell
    Ver en GitHub↗5,172
  • m3db/m3Avatar de m3db

    m3db/m3

    4,895Ver en GitHub↗

    m3 es una base de datos de series temporales distribuida, diseñada para métricas de alta resolución y gestión de datos de alta cardinalidad. Funciona como un sistema de almacenamiento escalable y un motor de consultas multiclúster, proporcionando un agregador de métricas distribuido capaz de realizar downsampling y resumir datos antes de que se confirmen en el almacenamiento. El proyecto se distingue por un modelo de clúster coordinado que utiliza etcd para la pertenencia a nodos y la colocación de shards. Soporta múltiples protocolos de ingesta, incluyendo el protocolo de escritura remota de Prometheus, el protocolo de línea de InfluxDB y el protocolo de texto plano de Graphite Carbon, y proporciona interfaces de consulta compatibles para PromQL y Graphite. El sistema cubre amplias áreas de capacidad, incluyendo almacenamiento de series temporales en columnas, replicación de datos síncrona y distribución de consultas (fan-out) distribuida. Incorpora automatización del ciclo de vida de los datos, ajuste de consistencia basado en quórum e indexación de series basada en etiquetas para mantener la integridad de los datos y la velocidad de recuperación en espacios de nombres aislados. La orquestación del clúster y la colocación de componentes se gestionan mediante herramientas y operadores automatizados para garantizar la alta disponibilidad y una distribución equilibrada de los datos.

    Routes read and write requests across a distributed set of storage nodes while managing cluster topology.

    Go
    Ver en GitHub↗4,895
  • lunatic-solutions/lunaticAvatar de lunatic-solutions

    lunatic-solutions/lunatic

    4,867Ver en GitHub↗

    Lunatic es un runtime de WebAssembly y gestor de procesos concurrentes que implementa un modelo inspirado en Erlang de concurrencia ligera y tolerancia a fallos. Funciona como un sistema de actores distribuido donde procesos aislados se comunican mediante el paso de mensajes a través de una red de nodos vinculados. El sistema utiliza un entorno sandbox de WebAssembly para aislar la memoria y restringir los permisos de llamadas al sistema para cada proceso individual. Este modelo de seguridad basado en capacidades asegura que los procesos estén aislados para ejecutar código no confiable de forma segura. La plataforma proporciona un árbol de supervisión tolerante a fallos para el monitoreo jerárquico y reinicios automáticos de procesos que fallan. Gestiona cargas de trabajo de alta concurrencia utilizando un programador (scheduler) preventivo de robo de trabajo para ejecutar miles de hilos ligeros (green threads). El runtime admite la coordinación de sistemas distribuidos mediante la agrupación de nodos en diferentes máquinas físicas y maneja el tráfico de red para protocolos como TCP y WebSockets.

    Enables multiple runtime instances to connect over a network to coordinate workloads and synchronize state across different machines.

    Rustactorsassemblyscripterlang
    Ver en GitHub↗4,867
  • sorintlab/stolonAvatar de sorintlab

    sorintlab/stolon

    4,816Ver en GitHub↗

    Stolon es un gestor de bases de datos nativo de la nube y orquestador para PostgreSQL. Funciona como un gestor de alta disponibilidad diseñado para automatizar la conmutación por error (failover), la replicación y la gestión de clústeres en entornos distribuidos. El sistema coordina la duplicación de datos síncrona y asíncrona y utiliza un mecanismo de descubrimiento de servicios para detectar dinámicamente las direcciones de los nodos de la base de datos. Enruta el tráfico del cliente a la instancia primaria actual a través de un proxy para mantener el acceso de la aplicación durante los cambios de rol. El proyecto cubre la recuperación ante desastres mediante recuperación en un punto en el tiempo (PITR) y el mantenimiento de clústeres en espera en múltiples sitios. También incluye capacidades para asegurar las conexiones a la base de datos mediante cifrado y automatizar la detección de cambios de dirección de procesos dentro de la red.

    Routes database read and write requests across distributed nodes to ensure clients reach the active primary.

    Go
    Ver en GitHub↗4,816
  • canonical/lxdAvatar de canonical

    canonical/lxd

    4,788Ver en GitHub↗

    LXD es un gestor de contenedores de sistema y gestor de máquinas virtuales que proporciona una interfaz unificada para ejecutar sistemas Linux completos. Actúa como un orquestador de clústeres de contenedores, un convertidor de formatos de imagen y un gestor de infraestructura que expone el control a través de una API REST y SDKs específicos del lenguaje. El proyecto se distingue por proporcionar una abstracción unificada de contenedores y máquinas virtuales, tratando a ambos como instancias genéricas dentro de una única capa de gestión. Admite la coordinación de clústeres distribuidos para sincronizar el estado y distribuir cargas de trabajo a través de múltiples nodos físicos. El sistema cubre el control programático de la infraestructura a través de una interfaz de gestión basada en REST y un modelo de orquestación basado en demonios. Incluye capacidades para la conversión de imágenes entre formatos, escalado de clústeres multinodo y la ejecución de instancias de máquinas virtualizadas que requieren emulación de hardware completa.

    Synchronizes state and distributes workloads across multiple physical nodes to treat data center racks as a single pool.

    Go
    Ver en GitHub↗4,788
  • zlt2000/microservices-platformAvatar de zlt2000

    zlt2000/microservices-platform

    4,735Ver en GitHub↗

    Este proyecto es una arquitectura empresarial integral para construir sistemas distribuidos multi-inquilino, implementada como una plataforma de microservicios de Spring Cloud. Proporciona un framework completo para gestionar microservicios, centrándose en la arquitectura de datos multi-inquilino y la provisión centralizada de identidad. La plataforma se distingue por su enfoque integrado de identidad y seguridad, utilizando un proveedor de identidad OAuth2 para gestionar el inicio de sesión único, control de acceso basado en roles y emisión de tokens JWT a través de servicios distribuidos. Además, separa los límites organizacionales mediante el aislamiento de datos multi-inquilino, asegurando que los recursos y datos estén lógica o físicamente particionados entre diferentes inquilinos. El sistema cubre una amplia superficie de capacidades distribuidas, incluyendo la gobernanza de servicios mediante enrutamiento de API gateway y disyuntores, y la coordinación de datos mediante transacciones distribuidas y mecanismos de bloqueo. También incluye una pila de observabilidad distribuida para el trazado de solicitudes y registro centralizado, junto con la sincronización de motores de búsqueda en tiempo real y mensajería asíncrona basada en eventos. El flujo de trabajo de desarrollo es compatible con herramientas de automatización para la generación de código de aplicación y empaquetado de binarios específico de la plataforma.

    Provides mechanisms for synchronizing state and scheduling distributed jobs across multiple compute nodes.

    Javaelkgpejava
    Ver en GitHub↗4,735
  • splware/esprocAvatar de SPLWare

    SPLWare/esProc

    4,685Ver en GitHub↗

    esProc es un framework ETL distribuido y motor de computación de datos embebido. Proporciona un lenguaje de datos estructurados para la Java Virtual Machine, diseñado para consultas relacionales, computación de datos compleja y análisis de datos estructurados. El sistema cuenta con una interfaz de consulta de datos en lenguaje natural que aprovecha modelos de lenguaje grandes para traducir solicitudes en consultas ejecutables contra conjuntos de datos estructurados. Emplea un lenguaje de consulta específico del dominio con una sintaxis concisa para establecer relaciones entre tablas y recuperar información. La plataforma cubre la integración de datos a través de fuentes relacionales y NoSQL dispares y gestiona flujos de trabajo ETL para mover datos entre archivos y bases de datos. Las capacidades adicionales incluyen la generación de informes de datos estructurados, una interfaz de cuadrícula en tiempo real para la visualización de la ejecución paso a paso y la capacidad de integrar bibliotecas compartidas externas personalizadas.

    Provides mechanisms for synchronizing state and scheduling across multiple compute nodes to handle large-scale processing.

    Javacluster-computingdatabasedataset
    Ver en GitHub↗4,685
  • dotnetcore/freesqlAvatar de dotnetcore

    dotnetcore/FreeSql

    4,388Ver en GitHub↗

    FreeSql es un mapeador objeto-relacional (ORM) y capa de acceso a datos para .NET que traduce código orientado a objetos a SQL para múltiples proveedores de bases de datos relacionales. Funciona como un constructor de consultas SQL fluido y sincronizador de esquemas de base de datos, permitiendo a los desarrolladores alinear las estructuras de tablas e índices de la base de datos con las definiciones de clases de entidad. El framework está optimizado específicamente para .NET Native AOT para garantizar huellas de memoria reducidas y tiempos de inicio más rápidos. Incluye un gestor de tráfico de base de datos para distribuir la carga a través de división de lectura-escritura, fragmentación de tablas dinámica y aislamiento de datos basado en inquilinos. Las capacidades amplias incluyen ingesta de datos de alto rendimiento utilizando mecanismos de copia masiva específicos del proveedor, consultas avanzadas con funciones de ventana y CTEs recursivos, y monitoreo basado en AOP para auditar cambios de datos. El sistema también proporciona herramientas de gestión de esquemas para migraciones automatizadas y utilidades de desarrollo para generar clases de entidad a partir de metadatos de base de datos.

    Routes read and write requests across distributed database nodes to manage traffic and load.

    C#accessclickhousecodefirst
    Ver en GitHub↗4,388
  • bjmashibing/internetarchitectAvatar de bjmashibing

    bjmashibing/InternetArchitect

    4,277Ver en GitHub↗

    InternetArchitect es una colección educativa de documentos y código fuente diseñada como un curso de arquitectura de alta concurrencia. Sirve como una guía de implementación de sistemas distribuidos, proporcionando patrones técnicos y ejemplos prácticos para diseñar arquitecturas de internet escalables que mantengan la estabilidad bajo cargas de tráfico pesadas. El proyecto se centra en la optimización de bases de datos de alto rendimiento y patrones de diseño de microservicios. Cubre estrategias para reducir la latencia y aumentar el rendimiento a través de sharding de bases de datos y capas de proxy, así como la coordinación del estado global a través de clústeres distribuidos. El alcance arquitectónico incluye estrategias de almacenamiento en caché multinivel para acelerar la recuperación de datos y la implementación de frameworks de descubrimiento de servicios para gestionar la comunicación entre microservicios desacoplados. También aborda la coordinación de estado distribuido y el uso de mallas de balanceo de carga para distribuir el tráfico de red a través de servidores backend.

    Provides mechanisms for synchronizing state and configuration across multiple compute nodes using a shared source of truth.

    Java
    Ver en GitHub↗4,277
  • mgp/book-notesAvatar de mgp

    mgp/book-notes

    4,097Ver en GitHub↗

    Este proyecto es una base de conocimiento personal basada en markdown y un diario de aprendizaje digital utilizado para almacenar notas y resúmenes de libros y literatura técnica. Sirve como repositorio de resúmenes de lectura y biblioteca de referencia técnica para archivar ideas clave y conocimientos de materiales de no ficción y profesionales. La colección funciona como un jardín digital para curar ideas de libros, artículos y vídeos. Se centra específicamente en destilar patrones arquitectónicos complejos, conceptos técnicos y principios de liderazgo profesional en un formato buscable para referencia a largo plazo. El repositorio también organiza el conocimiento personal a través de la colección de frameworks de pensamiento reutilizables, modelos mentales y herramientas de toma de decisiones profesionales. Incluye un sistema para realizar un seguimiento del progreso de lectura mediante la gestión de listas de obras completadas y en curso.

    Documents architectural patterns for routing read and write operations across master and slave database instances.

    book-notesbooksnotes
    Ver en GitHub↗4,097
  • flagai-open/flagaiAvatar de FlagAI-Open

    FlagAI-Open/FlagAI

    3,870Ver en GitHub↗

    FlagAI is a distributed deep learning framework and platform designed for the end-to-end lifecycle of large-scale foundation models. It provides a toolkit for training, fine-tuning, and deploying large language models and multi-modal systems across multi-node computing clusters. The project features hardware-agnostic compute abstractions to ensure consistent execution across different accelerators. It includes a dedicated library for parameter-efficient fine-tuning, allowing large neural networks to be adapted to specific tasks with minimal parameter updates and reduced computational overhead

    Implements a distributed orchestration layer to manage gradient synchronization and model state across nodes.

    Python
    Ver en GitHub↗3,870
  • netflix/maestroAvatar de Netflix

    Netflix/maestro

    3,794Ver en GitHub↗

    Maestro is a distributed job scheduler and containerized data pipeline tool designed to coordinate complex sequences of tasks. It functions as a Kubernetes workflow orchestrator and MLOps automation platform, utilizing directed acyclic graphs to manage task dependencies and execution order across computing clusters. The system distinguishes itself through the use of isolated container environments for each workflow step, ensuring consistent runtime dependencies. It incorporates an asynchronous event bus to coordinate state transitions and provides lifecycle hook integration that dispatches sy

    Coordinates the deployment and monitoring of containerized tasks across multiple computing clusters.

    Javaagentic-workflowanalyticsautomation
    Ver en GitHub↗3,794
  • oban-bg/obanAvatar de oban-bg

    oban-bg/oban

    3,812Ver en GitHub↗

    Oban is a distributed background job processing system and task scheduler that uses PostgreSQL for transactional job storage and reliable execution across multiple nodes. It serves as a PostgreSQL-backed background worker and job queue, coordinating task execution and concurrency through a relational database to ensure delivery guarantees. The system differentiates itself through a distributed workflow orchestrator capable of managing multi-step processing pipelines, dependent job sequencing, and shared context. It provides advanced orchestration tools including job batching, chunked processi

    Synchronizes job state and scheduling across cluster nodes using a shared PostgreSQL database as the source of truth.

    Elixir
    Ver en GitHub↗3,812
  • lonng/nanoAvatar de lonng

    lonng/nano

    3,173Ver en GitHub↗

    Nano is a distributed application framework designed for building systems using an actor-based messaging model. It functions as a distributed actor framework that decouples components through asynchronous messaging to maintain state isolation across a server cluster. The system acts as a cluster message dispatcher and session-aware request router, tracking client state to route incoming messages to the specific agent holding the session data. It utilizes a distributed agent registry to coordinate the dispatching of messages between multiple application instances acting as agents. The framewo

    Routes messages to specific application instances using a distributed registry of active agent locations.

    Godistributed-systemsgamegolang
    Ver en GitHub↗3,173
Ant.12Siguiente
  1. Home
  2. Software Engineering & Architecture
  3. Distributed Cluster Coordination

Explorar subetiquetas

  • Database Traffic RoutingRouting mechanisms specifically for directing read and write requests across distributed database nodes. **Distinct from Distributed Cluster Coordination:** Focuses on database request routing (read/write) rather than general compute cluster state synchronization
  • Metadata-Driven Cluster ManagementsTracks the physical location of data shards using a central catalog to coordinate operations across the distributed system. **Distinct from Distributed Cluster Coordination:** Distinct from Distributed Cluster Coordination: focuses specifically on database shard location tracking via a central catalog rather than general job state synchronization.
  • Virtual Cluster CoordinationCoordinates virtual control planes across multiple physical host clusters and data centers. **Distinct from Distributed Cluster Coordination:** Distinct from Distributed Cluster Coordination: specifically manages the coordination of virtualized Kubernetes control planes rather than generic job state synchronization.