awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

9 Repos

Awesome GitHub RepositoriesDistributed Data Processing Engines

Systems for executing large-scale data processing tasks with support for optimization and distributed architectures.

Explore 9 awesome GitHub repositories matching data & databases · Distributed Data Processing Engines. Refine with filters or upvote what's useful.

Awesome Distributed Data Processing Engines GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • apache/sparkAvatar von apache

    apache/spark

    43,467Auf GitHub ansehen↗

    Apache Spark is a unified distributed data processing engine designed for large-scale data analysis and computation graphs. It functions as a distributed machine learning framework, a graph processing system, a real-time stream processor, and a SQL analytics engine. The system enables the execution of distributed SQL querying, large-scale graph analysis, and real-time stream analytics across clusters of machines. It also provides a scalable environment for implementing machine learning algorithms and predictive model development on massive datasets. The engine incorporates relational query e

    Functions as a unified engine for executing large-scale data analysis and computation graphs across clusters.

    Scalabig-datajavajdbc
    Auf GitHub ansehen↗43,467
  • joelgrus/data-science-from-scratchAvatar von joelgrus

    joelgrus/data-science-from-scratch

    9,636Auf GitHub ansehen↗

    This project is a collection of foundational machine learning algorithms and data science tools implemented in Python. It focuses on building the logic of these tools using basic programming primitives rather than relying on specialized libraries. The implementation covers several core domains, including a linear algebra library for matrix and vector operations, a statistical analysis toolkit for probability and hypothesis testing, and a framework for map-reduce distributed processing. It also includes implementations for natural language processing, graph theory for network analysis, and var

    Implements distributed data processing systems using map-reduce techniques to handle large datasets.

    Python
    Auf GitHub ansehen↗9,636
  • pentaho/pentaho-kettleAvatar von pentaho

    pentaho/pentaho-kettle

    8,353Auf GitHub ansehen↗

    Pentaho Kettle ist eine Enterprise-ETL-Datenintegrationsplattform, die darauf ausgelegt ist, Daten zwischen unterschiedlichen Quellen und Zieldatenbanken zu extrahieren, zu transformieren und zu laden. Sie fungiert als metadatengesteuerter Orchestrator, der einen visuellen Workflow-Designer nutzt, um komplexe Sequenzen von Datenaufgaben und Transformationspipelines zu erstellen und zu verwalten. Das System zeichnet sich durch seine verteilte Datenverarbeitungs-Engine aus, die Workloads über Cluster von Server-Nodes hinweg ausführt, um den Durchsatz zu erhöhen. Es verwendet eine Plugin-basierte Architektur, die es ermöglicht, die Plattform über externe JAR-Dateien zu erweitern, um Konnektivität zu diversen Datenbanken und Cloud-Diensten bereitzustellen. Die Plattform deckt ein breites Spektrum an Datenintegrationsfunktionen ab, einschließlich Bulk-Loading, Remote-Dateiverwaltung und Datenstrukturtransformation. Sie bietet Werkzeuge für Datenqualitätsvalidierung, Pipeline-Automatisierung und Job-Lebenszyklusmanagement sowie Überwachungsprogramme zur Verfolgung des Serverzustands und des Echtzeit-Ausführungsstatus.

    Implements a processing engine that executes large-scale data transformation tasks with support for distributed architectures.

    Java
    Auf GitHub ansehen↗8,353
  • apache/stormAvatar von apache

    apache/storm

    6,683Auf GitHub ansehen↗

    Storm is a distributed stream processing framework designed to execute unbounded computations across a cluster to process real-time data streams. It functions as a data pipeline orchestrator that allows users to define and deploy declarative data flow graphs connecting streaming sources to processing components. The system operates as a multi-tenant distributed compute engine that isolates workloads and limits resource usage across shared clusters using dedicated pools and access control. It is also a secure distributed processing engine that employs encrypted node communication and SSL-secur

    Implements a processing engine with encrypted node communication and SSL-secured management interfaces.

    Java
    Auf GitHub ansehen↗6,683
  • datajuicer/data-juicerAvatar von datajuicer

    datajuicer/data-juicer

    6,574Auf GitHub ansehen↗

    Data-Juicer is an open-source framework for cleaning, filtering, deduplicating, and transforming multimodal datasets to prepare them for training large language and vision models. It functions as a distributed data pipeline engine that runs processing jobs across Ray clusters, handling billions of samples with automatic operator fusion and adaptive parallelism. The framework provides a library of operators that leverage large language models for semantic extraction, filtering, and data synthesis within processing pipelines. The project distinguishes itself through a YAML-based data recipe sys

    Runs data processing jobs across Ray clusters, handling billions of samples with automatic operator fusion and adaptive parallelism.

    Pythondatadata-analysisdata-pipeline
    Auf GitHub ansehen↗6,574
  • tencentmusic/cube-studioAvatar von tencentmusic

    tencentmusic/cube-studio

    5,062Auf GitHub ansehen↗

    Cube Studio ist eine Cloud-native MLOps-Plattform und ein Kubernetes-basierter KI-Orchestrator, der für den gesamten Lebenszyklus des maschinellen Lernens konzipiert ist. Es bietet ein Framework für verteiltes Training zur Feinabstimmung großer Modelle, einen GPU-Ressourcenmanager für Hardware-Virtualisierung und einen ML-Pipeline-Orchestrator, der visuelle gerichtete azyklische Graphen zur Verwaltung von End-to-End-Workflows nutzt. Die Plattform zeichnet sich durch ihren spezialisierten LLM-Inference-Server aus, der Retrieval-Augmented Generation und den Aufbau privater Wissensdatenbanken unterstützt. Sie verfügt über ein dediziertes System für das überwachte Fine-Tuning und Reinforcement Learning großer Sprachmodelle, ergänzt durch visuelle Tools zur Hyperparameter-Suche. Das System deckt ein breites Spektrum operativer Fähigkeiten ab, darunter multimodale Datenlabeling-Prozesse, verteilte Datenpipelines und Multi-Cluster-Workload-Scheduling. Zudem bietet es browserbasierte interaktive Entwicklungsumgebungen, Container-Image-Management und eine Modell-Registry für die Versionierung und Bereitstellung skalierbarer Inference-APIs mit Traffic-Splitting. Die Infrastruktur umfasst ein integriertes Cluster-Health-Monitoring sowie rollenbasierte Zugriffskontrolle mit Single-Sign-On-Integration.

    Executes distributed jobs to import heterogeneous data and extract features using big data processing engines.

    Pythonaiaihubargo
    Auf GitHub ansehen↗5,062
  • tensorflow/datasetsAvatar von tensorflow

    tensorflow/datasets

    4,575Auf GitHub ansehen↗

    This project is a dataset management framework and cross-framework data loader that provides a unified interface for reading data formats compatible with TensorFlow, JAX, and PyTorch. It serves as a library of curated public datasets provided as data streams and includes tools for building, versioning, and documenting large-scale datasets. The system differentiates itself through a distributed data processing engine capable of managing massive datasets across clusters using parallelized pipelines. It utilizes builder-based construction to standardize how data is downloaded and prepared, while

    Integrates with parallel processing engines like Apache Beam to process large-scale data across distributed clusters.

    Python
    Auf GitHub ansehen↗4,575
  • spark-notebook/spark-notebookAvatar von spark-notebook

    spark-notebook/spark-notebook

    3,144Auf GitHub ansehen↗

    Dieses Projekt ist eine interaktive, webbasierte Notebook-Umgebung für verteilte Data Science und groß angelegtes Computing. Es dient als Entwicklungstool zum Ausführen von Code und zur Durchführung von Datenanalysen speziell innerhalb des Apache Spark-Frameworks und bietet ein browserbasiertes Interface, das Codeausführung mit reaktiver Datenvisualisierung kombiniert. Die Plattform zeichnet sich durch ihre tiefe Integration in verteilte Infrastrukturen aus, die es Benutzern ermöglicht, Cluster-Ressourcen zu verwalten, Laufzeitabhängigkeiten zu konfigurieren und Ausführungsprozesse für einzelne Notebooks zu isolieren. Sie unterstützt kollaborative Workflows durch die Synchronisation von Notebook-Dateien direkt mit Versionskontrollsystemen und bietet eine reaktive Rendering-Engine, die Diagramme und Widgets automatisch als Reaktion auf Live-Datenströme und Codeausführung aktualisiert. Über ihre Kern-Ausführungsfähigkeiten hinaus enthält die Umgebung umfassende Tools für Cluster-Management, Sicherheit und Erweiterbarkeit. Sie unterstützt Benutzerauthentifizierung und Identitätswechsel für den sicheren Zugriff auf verteilte Ressourcen und bietet flexible Konfigurationsoptionen für Umgebungsvorlagen, Abhängigkeitsmanagement und Performance-Tuning. Das System verfügt zudem über eine breite Bibliothek interaktiver Visualisierungskomponenten, einschließlich Geodaten-Mapping, Netzwerkgraphen und Pivot-Tabellen, um komplexe Datenexplorationen zu erleichtern.

    Provides an interactive environment for running code, queries, and data processing jobs using a pre-configured distributed computing engine.

    JavaScriptapache-sparkdata-sciencenotebook
    Auf GitHub ansehen↗3,144
  • danielbeach/data-engineering-practiceAvatar von danielbeach

    danielbeach/data-engineering-practice

    2,726Auf GitHub ansehen↗

    Data engineering practice repository providing tutorials, distributed processing engines, and Python data pipeline automation scripts. The system encompasses automated data validation, distributed compute aggregation, embedded columnar querying, lazy evaluation planning, partitioned storage export, and cloud storage retrieval. The capability surface covers cloud integration and storage, data engineering and pipelines, data processing and analytics, data quality and testing, database and storage, file management, and monitoring and observability.

    Runs lazy evaluations, transformations, and numerical aggregations across large-scale tabular datasets.

    Python
    Auf GitHub ansehen↗2,726
  1. Home
  2. Data & Databases
  3. Data Processing Pipelines
  4. Data Transformation
  5. Stream and Pipeline Orchestration
  6. Distributed Data Processing Engines

Unter-Tags erkunden

  • Secure Processing EnginesDistributed data processing engines that enforce encrypted communication and secured management interfaces. **Distinct from Distributed Data Processing Engines:** Focuses on the security properties of the processing engine rather than just the distribution of tasks.