awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

9 dépôts

Awesome GitHub RepositoriesDistributed Data Processing Engines

Systems for executing large-scale data processing tasks with support for optimization and distributed architectures.

Explore 9 awesome GitHub repositories matching data & databases · Distributed Data Processing Engines. Refine with filters or upvote what's useful.

Awesome Distributed Data Processing Engines GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • apache/sparkAvatar de apache

    apache/spark

    43,467Voir sur GitHub↗

    Apache Spark is a unified distributed data processing engine designed for large-scale data analysis and computation graphs. It functions as a distributed machine learning framework, a graph processing system, a real-time stream processor, and a SQL analytics engine. The system enables the execution of distributed SQL querying, large-scale graph analysis, and real-time stream analytics across clusters of machines. It also provides a scalable environment for implementing machine learning algorithms and predictive model development on massive datasets. The engine incorporates relational query e

    Functions as a unified engine for executing large-scale data analysis and computation graphs across clusters.

    Scalabig-datajavajdbc
    Voir sur GitHub↗43,467
  • joelgrus/data-science-from-scratchAvatar de joelgrus

    joelgrus/data-science-from-scratch

    9,636Voir sur GitHub↗

    This project is a collection of foundational machine learning algorithms and data science tools implemented in Python. It focuses on building the logic of these tools using basic programming primitives rather than relying on specialized libraries. The implementation covers several core domains, including a linear algebra library for matrix and vector operations, a statistical analysis toolkit for probability and hypothesis testing, and a framework for map-reduce distributed processing. It also includes implementations for natural language processing, graph theory for network analysis, and var

    Implements distributed data processing systems using map-reduce techniques to handle large datasets.

    Python
    Voir sur GitHub↗9,636
  • pentaho/pentaho-kettleAvatar de pentaho

    pentaho/pentaho-kettle

    8,353Voir sur GitHub↗

    Pentaho Kettle est une plateforme d'intégration de données ETL d'entreprise conçue pour extraire, transformer et charger des données entre des sources disparates et des bases de données cibles. Il fonctionne comme un orchestrateur piloté par les métadonnées qui utilise un concepteur de flux de travail visuel pour créer et gérer des séquences complexes de tâches de données et de pipelines de transformation. Le système se distingue par son moteur de traitement de données distribué, qui exécute les charges de travail sur des clusters de nœuds de serveur pour augmenter le débit. Il emploie une architecture basée sur des plugins, permettant à la plateforme d'être étendue via des fichiers JAR externes pour fournir une connectivité à diverses bases de données et services cloud. La plateforme couvre un large éventail de capacités d'intégration de données, notamment le chargement en masse, la gestion de fichiers à distance et la transformation de structures de données. Elle fournit des outils pour la validation de la qualité des données, l'automatisation des pipelines et la gestion du cycle de vie des tâches, ainsi que des utilitaires de surveillance pour suivre la santé du serveur et l'état d'exécution en temps réel.

    Implements a processing engine that executes large-scale data transformation tasks with support for distributed architectures.

    Java
    Voir sur GitHub↗8,353
  • apache/stormAvatar de apache

    apache/storm

    6,683Voir sur GitHub↗

    Storm is a distributed stream processing framework designed to execute unbounded computations across a cluster to process real-time data streams. It functions as a data pipeline orchestrator that allows users to define and deploy declarative data flow graphs connecting streaming sources to processing components. The system operates as a multi-tenant distributed compute engine that isolates workloads and limits resource usage across shared clusters using dedicated pools and access control. It is also a secure distributed processing engine that employs encrypted node communication and SSL-secur

    Implements a processing engine with encrypted node communication and SSL-secured management interfaces.

    Java
    Voir sur GitHub↗6,683
  • datajuicer/data-juicerAvatar de datajuicer

    datajuicer/data-juicer

    6,574Voir sur GitHub↗

    Data-Juicer is an open-source framework for cleaning, filtering, deduplicating, and transforming multimodal datasets to prepare them for training large language and vision models. It functions as a distributed data pipeline engine that runs processing jobs across Ray clusters, handling billions of samples with automatic operator fusion and adaptive parallelism. The framework provides a library of operators that leverage large language models for semantic extraction, filtering, and data synthesis within processing pipelines. The project distinguishes itself through a YAML-based data recipe sys

    Runs data processing jobs across Ray clusters, handling billions of samples with automatic operator fusion and adaptive parallelism.

    Pythondatadata-analysisdata-pipeline
    Voir sur GitHub↗6,574
  • tencentmusic/cube-studioAvatar de tencentmusic

    tencentmusic/cube-studio

    5,062Voir sur GitHub↗

    Cube Studio est une plateforme MLOps cloud-native et un orchestrateur d'IA basé sur Kubernetes, conçu pour l'ensemble du cycle de vie du machine learning. Il fournit un framework d'entraînement distribué pour le fine-tuning de modèles à grande échelle, un gestionnaire de ressources GPU pour la virtualisation matérielle, et un orchestrateur de pipelines ML qui utilise des graphes orientés acycliques visuels pour gérer les workflows de bout en bout. La plateforme se distingue par son serveur d'inférence LLM spécialisé, qui prend en charge la génération augmentée par récupération (RAG) et la construction de bases de connaissances privées. Elle dispose d'un système dédié au fine-tuning supervisé et à l'apprentissage par renforcement des grands modèles de langage, complété par des outils de recherche d'hyperparamètres visuels. Le système couvre un large éventail de capacités opérationnelles, incluant l'étiquetage de données multimodales, les pipelines de données distribués et la planification de charges de travail multi-cluster. Il fournit également des environnements de développement interactifs par navigateur, la gestion d'images de conteneurs et un registre de modèles pour le versioning et le déploiement d'API d'inférence scalables avec répartition de trafic. L'infrastructure inclut une surveillance de la santé des clusters intégrée et un contrôle d'accès basé sur les rôles (RBAC) avec intégration SSO.

    Executes distributed jobs to import heterogeneous data and extract features using big data processing engines.

    Pythonaiaihubargo
    Voir sur GitHub↗5,062
  • tensorflow/datasetsAvatar de tensorflow

    tensorflow/datasets

    4,575Voir sur GitHub↗

    This project is a dataset management framework and cross-framework data loader that provides a unified interface for reading data formats compatible with TensorFlow, JAX, and PyTorch. It serves as a library of curated public datasets provided as data streams and includes tools for building, versioning, and documenting large-scale datasets. The system differentiates itself through a distributed data processing engine capable of managing massive datasets across clusters using parallelized pipelines. It utilizes builder-based construction to standardize how data is downloaded and prepared, while

    Integrates with parallel processing engines like Apache Beam to process large-scale data across distributed clusters.

    Python
    Voir sur GitHub↗4,575
  • spark-notebook/spark-notebookAvatar de spark-notebook

    spark-notebook/spark-notebook

    3,144Voir sur GitHub↗

    Ce projet est un environnement de notebook interactif basé sur le web, conçu pour la science des données distribuée et le calcul à grande échelle. Il sert d'outil de développement pour exécuter du code et effectuer des analyses de données spécifiquement au sein du framework Apache Spark, fournissant une interface basée sur navigateur qui combine l'exécution de code avec la visualisation réactive des données. La plateforme se distingue par son intégration profonde avec l'infrastructure distribuée, permettant aux utilisateurs de gérer les ressources du cluster, de configurer les dépendances d'exécution et d'isoler les processus d'exécution pour les notebooks individuels. Elle prend en charge les flux de travail collaboratifs en synchronisant les fichiers de notebook directement avec les systèmes de contrôle de version et fournit un moteur de rendu réactif qui met automatiquement à jour les graphiques et les widgets en réponse aux flux de données en direct et à l'exécution du code. Au-delà de ses capacités d'exécution de base, l'environnement inclut des outils complets pour la gestion de cluster, la sécurité et l'extensibilité. Il prend en charge l'authentification et l'usurpation d'identité des utilisateurs pour un accès sécurisé aux ressources distribuées, tout en offrant des options de configuration flexibles pour les modèles d'environnement, la gestion des dépendances et l'optimisation des performances. Le système propose également une large bibliothèque de composants de visualisation interactifs, incluant la cartographie géospatiale, les graphes de réseau et les tableaux croisés dynamiques, pour faciliter l'exploration complexe des données.

    Provides an interactive environment for running code, queries, and data processing jobs using a pre-configured distributed computing engine.

    JavaScriptapache-sparkdata-sciencenotebook
    Voir sur GitHub↗3,144
  • danielbeach/data-engineering-practiceAvatar de danielbeach

    danielbeach/data-engineering-practice

    2,726Voir sur GitHub↗

    Data engineering practice repository providing tutorials, distributed processing engines, and Python data pipeline automation scripts. The system encompasses automated data validation, distributed compute aggregation, embedded columnar querying, lazy evaluation planning, partitioned storage export, and cloud storage retrieval. The capability surface covers cloud integration and storage, data engineering and pipelines, data processing and analytics, data quality and testing, database and storage, file management, and monitoring and observability.

    Runs lazy evaluations, transformations, and numerical aggregations across large-scale tabular datasets.

    Python
    Voir sur GitHub↗2,726
  1. Home
  2. Data & Databases
  3. Data Processing Pipelines
  4. Data Transformation
  5. Stream and Pipeline Orchestration
  6. Distributed Data Processing Engines

Explorer les sous-tags

  • Secure Processing EnginesDistributed data processing engines that enforce encrypted communication and secured management interfaces. **Distinct from Distributed Data Processing Engines:** Focuses on the security properties of the processing engine rather than just the distribution of tasks.