awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

9 repositorios

Awesome GitHub RepositoriesDistributed Data Processing Engines

Systems for executing large-scale data processing tasks with support for optimization and distributed architectures.

Explore 9 awesome GitHub repositories matching data & databases · Distributed Data Processing Engines. Refine with filters or upvote what's useful.

Awesome Distributed Data Processing Engines GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • apache/sparkAvatar de apache

    apache/spark

    43,467Ver en GitHub↗

    Apache Spark is a unified distributed data processing engine designed for large-scale data analysis and computation graphs. It functions as a distributed machine learning framework, a graph processing system, a real-time stream processor, and a SQL analytics engine. The system enables the execution of distributed SQL querying, large-scale graph analysis, and real-time stream analytics across clusters of machines. It also provides a scalable environment for implementing machine learning algorithms and predictive model development on massive datasets. The engine incorporates relational query e

    Functions as a unified engine for executing large-scale data analysis and computation graphs across clusters.

    Scalabig-datajavajdbc
    Ver en GitHub↗43,467
  • joelgrus/data-science-from-scratchAvatar de joelgrus

    joelgrus/data-science-from-scratch

    9,636Ver en GitHub↗

    This project is a collection of foundational machine learning algorithms and data science tools implemented in Python. It focuses on building the logic of these tools using basic programming primitives rather than relying on specialized libraries. The implementation covers several core domains, including a linear algebra library for matrix and vector operations, a statistical analysis toolkit for probability and hypothesis testing, and a framework for map-reduce distributed processing. It also includes implementations for natural language processing, graph theory for network analysis, and var

    Implements distributed data processing systems using map-reduce techniques to handle large datasets.

    Python
    Ver en GitHub↗9,636
  • pentaho/pentaho-kettleAvatar de pentaho

    pentaho/pentaho-kettle

    8,353Ver en GitHub↗

    Pentaho Kettle es una plataforma empresarial de integración de datos ETL diseñada para extraer, transformar y cargar datos entre fuentes dispares y bases de datos de destino. Funciona como un orquestador basado en metadatos que utiliza un diseñador de flujo de trabajo visual para crear y gestionar secuencias complejas de tareas de datos y tuberías de transformación. El sistema se distingue por su motor de procesamiento de datos distribuido, que ejecuta cargas de trabajo a través de clústeres de nodos de servidor para aumentar el rendimiento. Emplea una arquitectura basada en plugins, lo que permite extender la plataforma mediante archivos JAR externos para proporcionar conectividad a diversas bases de datos y servicios en la nube. La plataforma cubre una amplia gama de capacidades de integración de datos, incluyendo carga masiva, gestión remota de archivos y transformación de estructuras de datos. Proporciona herramientas para la validación de la calidad de los datos, automatización de tuberías y gestión del ciclo de vida de los trabajos, junto con utilidades de monitoreo para rastrear la salud del servidor y el estado de ejecución en tiempo real.

    Implements a processing engine that executes large-scale data transformation tasks with support for distributed architectures.

    Java
    Ver en GitHub↗8,353
  • apache/stormAvatar de apache

    apache/storm

    6,683Ver en GitHub↗

    Storm is a distributed stream processing framework designed to execute unbounded computations across a cluster to process real-time data streams. It functions as a data pipeline orchestrator that allows users to define and deploy declarative data flow graphs connecting streaming sources to processing components. The system operates as a multi-tenant distributed compute engine that isolates workloads and limits resource usage across shared clusters using dedicated pools and access control. It is also a secure distributed processing engine that employs encrypted node communication and SSL-secur

    Implements a processing engine with encrypted node communication and SSL-secured management interfaces.

    Java
    Ver en GitHub↗6,683
  • datajuicer/data-juicerAvatar de datajuicer

    datajuicer/data-juicer

    6,574Ver en GitHub↗

    Data-Juicer is an open-source framework for cleaning, filtering, deduplicating, and transforming multimodal datasets to prepare them for training large language and vision models. It functions as a distributed data pipeline engine that runs processing jobs across Ray clusters, handling billions of samples with automatic operator fusion and adaptive parallelism. The framework provides a library of operators that leverage large language models for semantic extraction, filtering, and data synthesis within processing pipelines. The project distinguishes itself through a YAML-based data recipe sys

    Runs data processing jobs across Ray clusters, handling billions of samples with automatic operator fusion and adaptive parallelism.

    Pythondatadata-analysisdata-pipeline
    Ver en GitHub↗6,574
  • tencentmusic/cube-studioAvatar de tencentmusic

    tencentmusic/cube-studio

    5,062Ver en GitHub↗

    Cube Studio es una plataforma MLOps nativa de la nube y un orquestador de IA basado en Kubernetes, diseñado para todo el ciclo de vida del machine learning. Proporciona un framework de entrenamiento distribuido para el ajuste fino de modelos a gran escala, un gestor de recursos GPU para virtualización de hardware y un orquestador de pipelines de ML que utiliza grafos acíclicos dirigidos visuales para gestionar flujos de trabajo de extremo a extremo. La plataforma se distingue por su servidor de inferencia LLM especializado, que soporta generación aumentada por recuperación (RAG) y la construcción de bases de conocimiento privadas. Cuenta con un sistema dedicado para el ajuste fino supervisado y aprendizaje por refuerzo de modelos de lenguaje grandes, complementado con herramientas visuales de búsqueda de hiperparámetros. El sistema cubre una amplia gama de capacidades operativas, incluyendo etiquetado de datos multimodales, pipelines de datos distribuidos y programación de cargas de trabajo en múltiples clústeres. También ofrece entornos de desarrollo interactivos basados en navegador, gestión de imágenes de contenedor y un registro de modelos para versionar y desplegar APIs de inferencia escalables con división de tráfico. La infraestructura incluye monitorización de salud del clúster integrada y control de acceso basado en roles con integración de inicio de sesión único (SSO).

    Executes distributed jobs to import heterogeneous data and extract features using big data processing engines.

    Pythonaiaihubargo
    Ver en GitHub↗5,062
  • tensorflow/datasetsAvatar de tensorflow

    tensorflow/datasets

    4,575Ver en GitHub↗

    This project is a dataset management framework and cross-framework data loader that provides a unified interface for reading data formats compatible with TensorFlow, JAX, and PyTorch. It serves as a library of curated public datasets provided as data streams and includes tools for building, versioning, and documenting large-scale datasets. The system differentiates itself through a distributed data processing engine capable of managing massive datasets across clusters using parallelized pipelines. It utilizes builder-based construction to standardize how data is downloaded and prepared, while

    Integrates with parallel processing engines like Apache Beam to process large-scale data across distributed clusters.

    Python
    Ver en GitHub↗4,575
  • spark-notebook/spark-notebookAvatar de spark-notebook

    spark-notebook/spark-notebook

    3,144Ver en GitHub↗

    Este proyecto es un entorno de notebook interactivo basado en la web diseñado para la ciencia de datos distribuida y la computación a gran escala. Sirve como una herramienta de desarrollo para ejecutar código y realizar análisis de datos específicamente dentro del framework Apache Spark, proporcionando una interfaz basada en navegador que combina la ejecución de código con la visualización de datos reactiva. La plataforma se distingue por su profunda integración con la infraestructura distribuida, permitiendo a los usuarios gestionar recursos de cluster, configurar dependencias de tiempo de ejecución y aislar procesos de ejecución para notebooks individuales. Admite flujos de trabajo colaborativos sincronizando archivos de notebook directamente con sistemas de control de versiones y proporciona un motor de renderizado reactivo que actualiza automáticamente gráficos y widgets en respuesta a flujos de datos en vivo y ejecución de código. Más allá de sus capacidades de ejecución central, el entorno incluye herramientas integrales para la gestión de clusters, seguridad y extensibilidad. Admite la autenticación y suplantación de usuarios para un acceso seguro a recursos distribuidos, mientras ofrece opciones de configuración flexibles para plantillas de entorno, gestión de dependencias y ajuste de rendimiento. El sistema también cuenta con una amplia biblioteca de componentes de visualización interactivos, incluyendo mapeo geoespacial, grafos de red y tablas dinámicas, para facilitar la exploración compleja de datos.

    Provides an interactive environment for running code, queries, and data processing jobs using a pre-configured distributed computing engine.

    JavaScriptapache-sparkdata-sciencenotebook
    Ver en GitHub↗3,144
  • danielbeach/data-engineering-practiceAvatar de danielbeach

    danielbeach/data-engineering-practice

    2,726Ver en GitHub↗

    Data engineering practice repository providing tutorials, distributed processing engines, and Python data pipeline automation scripts. The system encompasses automated data validation, distributed compute aggregation, embedded columnar querying, lazy evaluation planning, partitioned storage export, and cloud storage retrieval. The capability surface covers cloud integration and storage, data engineering and pipelines, data processing and analytics, data quality and testing, database and storage, file management, and monitoring and observability.

    Runs lazy evaluations, transformations, and numerical aggregations across large-scale tabular datasets.

    Python
    Ver en GitHub↗2,726
  1. Home
  2. Data & Databases
  3. Data Processing Pipelines
  4. Data Transformation
  5. Stream and Pipeline Orchestration
  6. Distributed Data Processing Engines

Explorar subetiquetas

  • Secure Processing EnginesDistributed data processing engines that enforce encrypted communication and secured management interfaces. **Distinct from Distributed Data Processing Engines:** Focuses on the security properties of the processing engine rather than just the distribution of tasks.