awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

10 repository-uri

Awesome GitHub RepositoriesBig Data and Distributed Computing

Frameworks for processing large-scale datasets and distributed execution.

Explore 10 awesome GitHub repositories matching part of an awesome list · Big Data and Distributed Computing. Refine with filters or upvote what's useful.

Awesome Big Data and Distributed Computing GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • ray-project/rayAvatar ray-project

    ray-project/ray

    42,895Vezi pe GitHub↗

    Ray is a distributed computing framework designed to scale Python and Java applications across clusters by abstracting task scheduling and resource management. It functions as a resource-aware execution engine that manages task dependencies, placement, and fault tolerance across networked compute nodes. At its core, the system provides a stateful actor model, allowing developers to define classes that run in dedicated processes to maintain and mutate internal state across remote method calls. The framework distinguishes itself through a robust cross-language interoperability layer, enabling f

    Distributed execution framework for scaling applications.

    Pythondata-sciencedeep-learningdeployment
    Vezi pe GitHub↗42,895
  • dask/daskAvatar dask

    dask/dask

    13,746Vezi pe GitHub↗

    Dask este un framework de calcul paralel și un scheduler de sarcini distribuit conceput pentru a scala fluxurile de lucru de știința datelor în Python de la mașini individuale la clustere mari. Acesta funcționează ca un manager de resurse de cluster care orchestrează logica computațională prin reprezentarea sarcinilor și a dependențelor acestora sub formă de grafuri aciclice direcționate. Această arhitectură permite sistemului să automatizeze distribuția sarcinilor de lucru pe hardware-ul disponibil, gestionând în același timp cerințe complexe de execuție. Proiectul se distinge printr-un motor de evaluare leneșă (lazy) care amână operațiunile pe date până când sunt solicitate explicit, permițând optimizarea globală a grafului și alocarea eficientă a resurselor. Acesta încorporează „spilling” de date conștient de memorie pentru a preveni blocarea sistemului la procesarea seturilor de date care depășesc memoria disponibilă și utilizează fuziunea grafului de sarcini pentru a combina secvențe de operațiuni în pași de execuție unici, minimizând overhead-ul de programare și comunicarea între noduri. Platforma oferă o suprafață cuprinzătoare de capabilități pentru analiza datelor la scară largă, inclusiv suport pentru învățare automată distribuită, integrare cu calcul de înaltă performanță și procesare paralelă a datelor. Oferă instrumente extinse pentru gestionarea ciclului de viață al clusterului, profilarea performanței și monitorizarea în timp real a execuției sarcinilor. Utilizatorii pot implementa aceste medii pe diverse infrastructuri, inclusiv hardware local, furnizori de cloud, sisteme containerizate și clustere de calcul de înaltă performanță.

    Distributed computing and parallel dataframe processing.

    Pythondasknumpypandas
    Vezi pe GitHub↗13,746
  • cupy/cupyAvatar cupy

    cupy/cupy

    11,000Vezi pe GitHub↗

    CuPy este o bibliotecă de calcul array CUDA care implementează o interfață compatibilă cu NumPy pentru executarea operațiunilor pe array-uri și calcul numeric pe GPU-uri NVIDIA. Acesta servește ca bibliotecă numerică accelerată GPU și o implementare SciPy bazată pe CUDA, descărcând calculele grele pe hardware-ul grafic pentru a crește viteza de procesare pentru sarcinile de lucru științifice și inginerești. Biblioteca permite schimbul de tensori între framework-uri, permițând partajarea bufferelor de date între diferite framework-uri de deep learning folosind layout-uri de memorie standardizate pentru a evita copiile de memorie. De asemenea, suportă integrarea kernel-urilor GPU personalizate, permițând conectarea datelor de tip array la API-uri de nivel scăzut pentru un control precis asupra execuției hardware. În linii mari, proiectul acoperă fluxuri de lucru de procesare de array-uri de înaltă performanță și calcul științific. Capabilitățile sale includ accelerarea calculelor pe array-uri și furnizarea de instrumente pentru calcule numerice la scară largă.

    CUDA-accelerated NumPy-compatible array operations.

    Python
    Vezi pe GitHub↗11,000
  • rapidsai/cudfAvatar rapidsai

    rapidsai/cudf

    9,672Vezi pe GitHub↗

    cuDF is a GPU-accelerated dataframe library and data processing engine designed for manipulating and analyzing large tabular datasets. It provides a high-level API for executing filtering, joining, and aggregating operations directly on GPU hardware. The project integrates the Apache Arrow memory format to enable zero-copy data transfers and includes a just-in-time compiler for executing custom user-defined functions on the GPU. The library features specialized acceleration for existing workflows by redirecting standard Pandas dataframe calls and Polars query plans to a GPU backend. It also p

    GPU-accelerated dataframe library.

    C++
    Vezi pe GitHub↗9,672
  • h2oai/h2o-3Avatar h2oai

    h2oai/h2o-3

    7,493Vezi pe GitHub↗

    h2o-3 is a distributed machine learning platform and automated machine learning framework designed for training and deploying predictive models using distributed in-memory computing. It functions as a deep learning framework and a distributed model scoring engine, capable of operating as a Kubernetes ML cluster to process large datasets in parallel. The platform distinguishes itself through automated machine learning capabilities that automatically select the best algorithms and hyperparameters to optimize model performance. It provides specialized deep learning toolkits for tasks including i

    Distributed machine learning and out-of-memory dataframes.

    Jupyter Notebookautomlbig-datadata-science
    Vezi pe GitHub↗7,493
  • zarr-developers/zarr-pythonAvatar zarr-developers

    zarr-developers/zarr-python

    1,998Vezi pe GitHub↗

    An implementation of chunked, compressed, N-dimensional arrays for Python.

    Distributed storage for multi-dimensional arrays.

    Python
    Vezi pe GitHub↗1,998
  • uber/petastormAvatar uber

    uber/petastorm

    1,889Vezi pe GitHub↗

    Petastorm library enables single machine or distributed training and evaluation of deep learning models from datasets in Apache Parquet format. It supports ML frameworks such as Tensorflow, Pytorch, and PySpark and can be used from pure Python code.

    Data access library for parquet files.

    Python
    Vezi pe GitHub↗1,889
  • google/tensorstoreAvatar google

    google/tensorstore

    1,522Vezi pe GitHub↗

    Library for reading and writing large multi-dimensional arrays.

    Reading and writing large multi-dimensional arrays.

    C++
    Vezi pe GitHub↗1,522
  • kwgoodman/bottleneckAvatar kwgoodman

    kwgoodman/bottleneck

    1,179Vezi pe GitHub↗

    Fast NumPy array functions written in C

    Fast NumPy array functions implemented in C.

    Python
    Vezi pe GitHub↗1,179
  • nvidia/nvtabularN

    NVIDIA/NVTabular

    0Vezi pe GitHub↗

    Feature engineering for large-scale tabular data.

    Vezi pe GitHub↗0
  1. Home
  2. Part of an Awesome List
  3. Databases & Data
  4. Big Data and Distributed Computing