awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

9 dépôts

Awesome GitHub RepositoriesData Orchestration

Tools for versioning, quality screening, and managing data pipelines.

Explore 9 awesome GitHub repositories matching part of an awesome list · Data Orchestration. Refine with filters or upvote what's useful.

Awesome Data Orchestration GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • pathwaycom/pathwayAvatar de pathwaycom

    pathwaycom/pathway

    62,959Voir sur GitHub↗

    Pathway is a high-performance data processing framework designed for building unified batch and streaming pipelines. It functions as an orchestrator for complex data transformations, utilizing a differential dataflow engine to process updates incrementally. By treating static datasets and continuous event streams with identical logic, the platform ensures exactly-once processing semantics and consistent results across diverse data sources. The framework distinguishes itself through its specialized support for real-time artificial intelligence and retrieval-augmented generation. It features in

    Performant Python ETL framework with a Rust runtime.

    Pythonbatch-processingdata-analyticsdata-pipelines
    Voir sur GitHub↗62,959
  • uber/cadenceAvatar de uber

    uber/cadence

    9,336Voir sur GitHub↗

    Cadence is a distributed workflow orchestration engine designed to execute long-running, asynchronous business logic with built-in durability and resilience across distributed systems. It functions as a stateful process manager that ensures processes resume from their last known state following system crashes or network outages. The platform utilizes a distributed task queue to manage work across independent worker nodes and supports persistence via SQL or Cassandra backend storage. It includes a workflow visualization dashboard for inspecting execution histories and state traces, alongside a

    Scalable orchestration engine for durable distributed workflows.

    Go
    Voir sur GitHub↗9,336
  • treeverse/lakefsAvatar de treeverse

    treeverse/lakeFS

    5,406Voir sur GitHub↗

    lakeFS est un système de versioning de data lake qui fournit des branches et des commits de type Git pour de grands jeux de données stockés dans un stockage objet. Il fonctionne comme une couche de contrôle de version, permettant la création d'instantanés immuables, de commits atomiques et de branches zero-copy pour créer des environnements isolés pour l'expérimentation de données sans dupliquer les fichiers physiques. Le système sert de passerelle de stockage compatible S3 et de catalogue REST Iceberg, permettant aux protocoles de stockage cloud standard et aux clients compatibles de gérer des tables versionnées. Il agit comme un gardien de la qualité des données en utilisant un système de hooks piloté par événements pour valider les jeux de données par rapport aux politiques de gouvernance avant que les changements ne soient fusionnés en production. La plateforme couvre de larges capacités pour la gouvernance des données, incluant la collaboration via pull requests, le contrôle d'accès basé sur les rôles et le suivi de la lignée des données (data lineage). Elle fournit une intégration pour l'orchestration de workflows, les pipelines de machine learning et divers moteurs de calcul big data, prenant en charge la connectivité de stockage multi-cloud et la synchronisation d'identité via SSO et SCIM. Le logiciel peut être installé en utilisant des binaires, des conteneurs ou des charts Helm pour un déploiement sur Kubernetes.

    Version control for data lakes on object storage.

    Go
    Voir sur GitHub↗5,406
  • bruin-data/bruinAvatar de bruin-data

    bruin-data/bruin

    1,620Voir sur GitHub↗

    Build data pipelines with SQL and Python, ingest data from different sources, add quality checks, and build end-to-end flows.

    Data pipeline framework supporting SQL and Python DAGs.

    Goanalyticsbigquerydata-analysis
    Voir sur GitHub↗1,620
  • projectnessie/nessieAvatar de projectnessie

    projectnessie/nessie

    1,420Voir sur GitHub↗

    Git-like version control for data tables and views.

    Javaaws-lambdadatagit
    Voir sur GitHub↗1,420
  • brexhq/substationAvatar de brexhq

    brexhq/substation

    402Voir sur GitHub↗

    Substation is a toolkit for routing, normalizing, and enriching security event and audit logs.

    Cloud-native data pipeline and transformation toolkit.

    Go
    Voir sur GitHub↗402
  • keboola/keboola-mcp-serverAvatar de keboola

    keboola/keboola-mcp-server

    84Voir sur GitHub↗

    Model Context Protocol (MCP) Server for the Keboola Platform

    Facilitates data workflow management and analytics integration.

    Python
    Voir sur GitHub↗84
  • dataform-co/dataformD

    dataform-co/dataform

    0Voir sur GitHub↗

    Framework for managing SQL operations in data warehouses.

    Voir sur GitHub↗0
  • appdeviq/datascreeniq-pythonA

    AppDevIQ/datascreeniq-python

    0Voir sur GitHub↗

    Real-time data quality screening API for pipeline ingestion.

    Voir sur GitHub↗0
  1. Home
  2. Part of an Awesome List
  3. Databases & Data
  4. Data Orchestration