awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

10 repositorios

Awesome GitHub RepositoriesBig Data and Distributed Computing

Frameworks for processing large-scale datasets and distributed execution.

Explore 10 awesome GitHub repositories matching part of an awesome list · Big Data and Distributed Computing. Refine with filters or upvote what's useful.

Awesome Big Data and Distributed Computing GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • ray-project/rayAvatar de ray-project

    ray-project/ray

    42,895Ver en GitHub↗

    Ray is a distributed computing framework designed to scale Python and Java applications across clusters by abstracting task scheduling and resource management. It functions as a resource-aware execution engine that manages task dependencies, placement, and fault tolerance across networked compute nodes. At its core, the system provides a stateful actor model, allowing developers to define classes that run in dedicated processes to maintain and mutate internal state across remote method calls. The framework distinguishes itself through a robust cross-language interoperability layer, enabling f

    Distributed execution framework for scaling applications.

    Pythondata-sciencedeep-learningdeployment
    Ver en GitHub↗42,895
  • dask/daskAvatar de dask

    dask/dask

    13,746Ver en GitHub↗

    Dask es un framework de computación paralela y un programador de tareas distribuido diseñado para escalar flujos de trabajo de ciencia de datos en Python desde máquinas individuales hasta grandes clústeres. Funciona como un gestor de recursos de clúster que orquesta la lógica computacional representando las tareas y sus dependencias como grafos acíclicos dirigidos. Esta arquitectura permite al sistema automatizar la distribución de cargas de trabajo a través del hardware disponible mientras gestiona requisitos de ejecución complejos. El proyecto se distingue por un motor de evaluación perezosa que difiere las operaciones de datos hasta que se solicitan explícitamente, permitiendo la optimización global del grafo y una asignación eficiente de recursos. Incorpora el volcado de datos consciente de la memoria para evitar fallos del sistema al procesar conjuntos de datos que exceden la memoria disponible, y utiliza la fusión de grafos de tareas para combinar secuencias de operaciones en pasos de ejecución únicos, minimizando la sobrecarga de programación y la comunicación entre nodos. La plataforma proporciona una superficie de capacidades integral para el análisis de datos a gran escala, incluyendo soporte para aprendizaje automático distribuido, integración de computación de alto rendimiento y procesamiento de datos en paralelo. Ofrece herramientas extensas para la gestión del ciclo de vida del clúster, perfilado de rendimiento y monitoreo en tiempo real de la ejecución de tareas. Los usuarios pueden desplegar estos entornos en diversas infraestructuras, incluyendo hardware local, proveedores de nube, sistemas en contenedores y clústeres de computación de alto rendimiento.

    Distributed computing and parallel dataframe processing.

    Pythondasknumpypandas
    Ver en GitHub↗13,746
  • cupy/cupyAvatar de cupy

    cupy/cupy

    11,000Ver en GitHub↗

    CuPy es una biblioteca de computación de matrices CUDA que implementa una interfaz compatible con NumPy para ejecutar operaciones de matrices y computación numérica en GPUs NVIDIA. Sirve como una biblioteca numérica acelerada por GPU y una implementación de SciPy basada en CUDA, descargando cálculos pesados al hardware gráfico para aumentar la velocidad de procesamiento para cargas de trabajo científicas y de ingeniería. La biblioteca permite el intercambio de tensores entre múltiples frameworks, permitiendo que los búferes de datos se compartan entre diferentes frameworks de aprendizaje profundo utilizando diseños de memoria estandarizados para evitar copias de memoria. También admite la integración de kernels de GPU personalizados, permitiendo que los datos de las matrices se conecten a APIs de bajo nivel para un control preciso sobre la ejecución del hardware. En términos generales, el proyecto cubre flujos de trabajo de procesamiento de matrices y computación científica de alto rendimiento. Sus capacidades incluyen la aceleración de cálculos de matrices y la provisión de herramientas para cálculos numéricos a gran escala.

    CUDA-accelerated NumPy-compatible array operations.

    Python
    Ver en GitHub↗11,000
  • rapidsai/cudfAvatar de rapidsai

    rapidsai/cudf

    9,672Ver en GitHub↗

    cuDF is a GPU-accelerated dataframe library and data processing engine designed for manipulating and analyzing large tabular datasets. It provides a high-level API for executing filtering, joining, and aggregating operations directly on GPU hardware. The project integrates the Apache Arrow memory format to enable zero-copy data transfers and includes a just-in-time compiler for executing custom user-defined functions on the GPU. The library features specialized acceleration for existing workflows by redirecting standard Pandas dataframe calls and Polars query plans to a GPU backend. It also p

    GPU-accelerated dataframe library.

    C++
    Ver en GitHub↗9,672
  • h2oai/h2o-3Avatar de h2oai

    h2oai/h2o-3

    7,493Ver en GitHub↗

    h2o-3 is a distributed machine learning platform and automated machine learning framework designed for training and deploying predictive models using distributed in-memory computing. It functions as a deep learning framework and a distributed model scoring engine, capable of operating as a Kubernetes ML cluster to process large datasets in parallel. The platform distinguishes itself through automated machine learning capabilities that automatically select the best algorithms and hyperparameters to optimize model performance. It provides specialized deep learning toolkits for tasks including i

    Distributed machine learning and out-of-memory dataframes.

    Jupyter Notebookautomlbig-datadata-science
    Ver en GitHub↗7,493
  • zarr-developers/zarr-pythonAvatar de zarr-developers

    zarr-developers/zarr-python

    1,998Ver en GitHub↗

    An implementation of chunked, compressed, N-dimensional arrays for Python.

    Distributed storage for multi-dimensional arrays.

    Python
    Ver en GitHub↗1,998
  • uber/petastormAvatar de uber

    uber/petastorm

    1,889Ver en GitHub↗

    Petastorm library enables single machine or distributed training and evaluation of deep learning models from datasets in Apache Parquet format. It supports ML frameworks such as Tensorflow, Pytorch, and PySpark and can be used from pure Python code.

    Data access library for parquet files.

    Python
    Ver en GitHub↗1,889
  • google/tensorstoreAvatar de google

    google/tensorstore

    1,522Ver en GitHub↗

    Library for reading and writing large multi-dimensional arrays.

    Reading and writing large multi-dimensional arrays.

    C++
    Ver en GitHub↗1,522
  • kwgoodman/bottleneckAvatar de kwgoodman

    kwgoodman/bottleneck

    1,179Ver en GitHub↗

    Fast NumPy array functions written in C

    Fast NumPy array functions implemented in C.

    Python
    Ver en GitHub↗1,179
  • nvidia/nvtabularN

    NVIDIA/NVTabular

    0Ver en GitHub↗

    Feature engineering for large-scale tabular data.

    Ver en GitHub↗0
  1. Home
  2. Part of an Awesome List
  3. Databases & Data
  4. Big Data and Distributed Computing