10 dépôts
Frameworks for processing large-scale datasets and distributed execution.
Explore 10 awesome GitHub repositories matching part of an awesome list · Big Data and Distributed Computing. Refine with filters or upvote what's useful.
Ray is a distributed computing framework designed to scale Python and Java applications across clusters by abstracting task scheduling and resource management. It functions as a resource-aware execution engine that manages task dependencies, placement, and fault tolerance across networked compute nodes. At its core, the system provides a stateful actor model, allowing developers to define classes that run in dedicated processes to maintain and mutate internal state across remote method calls. The framework distinguishes itself through a robust cross-language interoperability layer, enabling f
Distributed execution framework for scaling applications.
Dask est un framework de calcul parallèle et un planificateur de tâches distribué conçu pour mettre à l'échelle les flux de travail de science des données Python, des machines uniques aux grands clusters. Il fonctionne comme un gestionnaire de ressources de cluster qui orchestre la logique computationnelle en représentant les tâches et leurs dépendances sous forme de graphes acycliques dirigés. Cette architecture permet au système d'automatiser la distribution des charges de travail sur le matériel disponible tout en gérant des exigences d'exécution complexes. Le projet se distingue par un moteur d'évaluation paresseuse qui diffère les opérations sur les données jusqu'à ce qu'elles soient explicitement demandées, permettant une optimisation globale du graphe et une allocation efficace des ressources. Il intègre le déversement de données conscient de la mémoire pour éviter les plantages du système lors du traitement de jeux de données dépassant la mémoire disponible, et il utilise la fusion de graphes de tâches pour combiner des séquences d'opérations en étapes d'exécution uniques, minimisant la surcharge de planification et la communication entre nœuds. La plateforme fournit une surface de capacités complète pour l'analyse de données à grande échelle, incluant le support pour l'apprentissage automatique distribué, l'intégration du calcul haute performance et le traitement de données parallèle. Elle offre des outils étendus pour la gestion du cycle de vie des clusters, le profilage des performances et la surveillance en temps réel de l'exécution des tâches. Les utilisateurs peuvent déployer ces environnements sur diverses infrastructures, incluant le matériel local, les fournisseurs cloud, les systèmes conteneurisés et les clusters de calcul haute performance.
Distributed computing and parallel dataframe processing.
CuPy est une bibliothèque de calcul de tableaux CUDA qui implémente une interface compatible avec NumPy pour exécuter des opérations sur tableaux et du calcul numérique sur des GPU NVIDIA. Elle sert de bibliothèque numérique accélérée par GPU et d'implémentation SciPy basée sur CUDA, déchargeant les calculs lourds sur le matériel graphique pour augmenter la vitesse de traitement pour les charges de travail scientifiques et d'ingénierie. La bibliothèque permet l'échange de tenseurs multi-framework, permettant aux tampons de données d'être partagés entre différents frameworks d'apprentissage profond en utilisant des mises en page mémoire standardisées pour éviter les copies mémoire. Elle prend également en charge l'intégration de noyaux GPU personnalisés, permettant aux données de tableaux d'être connectées à des API de bas niveau pour un contrôle précis sur l'exécution matérielle. Globalement, le projet couvre le traitement de tableaux haute performance et les flux de travail de calcul scientifique. Ses capacités incluent l'accélération des calculs de tableaux et la fourniture d'outils pour les calculs numériques à grande échelle.
CUDA-accelerated NumPy-compatible array operations.
cuDF is a GPU-accelerated dataframe library and data processing engine designed for manipulating and analyzing large tabular datasets. It provides a high-level API for executing filtering, joining, and aggregating operations directly on GPU hardware. The project integrates the Apache Arrow memory format to enable zero-copy data transfers and includes a just-in-time compiler for executing custom user-defined functions on the GPU. The library features specialized acceleration for existing workflows by redirecting standard Pandas dataframe calls and Polars query plans to a GPU backend. It also p
GPU-accelerated dataframe library.
h2o-3 is a distributed machine learning platform and automated machine learning framework designed for training and deploying predictive models using distributed in-memory computing. It functions as a deep learning framework and a distributed model scoring engine, capable of operating as a Kubernetes ML cluster to process large datasets in parallel. The platform distinguishes itself through automated machine learning capabilities that automatically select the best algorithms and hyperparameters to optimize model performance. It provides specialized deep learning toolkits for tasks including i
Distributed machine learning and out-of-memory dataframes.
An implementation of chunked, compressed, N-dimensional arrays for Python.
Distributed storage for multi-dimensional arrays.
Petastorm library enables single machine or distributed training and evaluation of deep learning models from datasets in Apache Parquet format. It supports ML frameworks such as Tensorflow, Pytorch, and PySpark and can be used from pure Python code.
Data access library for parquet files.
Library for reading and writing large multi-dimensional arrays.
Reading and writing large multi-dimensional arrays.
Fast NumPy array functions written in C
Fast NumPy array functions implemented in C.