awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 dépôts

Awesome GitHub RepositoriesDistributed Training Platforms

Systems designed for scaling model training across distributed hardware clusters.

Distinct from Machine Learning Platforms: Distinct from general machine learning platforms: focuses on the distributed training and scaling aspect.

Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Distributed Training Platforms. Refine with filters or upvote what's useful.

Awesome Distributed Training Platforms GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • microsoft/lightgbmAvatar de microsoft

    microsoft/LightGBM

    18,096Voir sur GitHub↗

    LightGBM is a high-performance machine learning framework designed for constructing gradient-boosted decision tree ensembles. It provides a platform for training classification, regression, and ranking models, with a focus on memory efficiency and large-scale distributed computing. The framework distinguishes itself through specialized algorithmic strategies, including leaf-wise tree growth and histogram-based decision learning, which prioritize convergence speed. It optimizes memory usage by bundling mutually exclusive features and employs gradient-based sampling to reduce training complexit

    Scales model training across multiple nodes and hardware accelerators to handle large-scale datasets.

    C++data-miningdecision-treesdistributed
    Voir sur GitHub↗18,096
  • h2oai/h2o-3Avatar de h2oai

    h2oai/h2o-3

    7,493Voir sur GitHub↗

    h2o-3 is a distributed machine learning platform and automated machine learning framework designed for training and deploying predictive models using distributed in-memory computing. It functions as a deep learning framework and a distributed model scoring engine, capable of operating as a Kubernetes ML cluster to process large datasets in parallel. The platform distinguishes itself through automated machine learning capabilities that automatically select the best algorithms and hyperparameters to optimize model performance. It provides specialized deep learning toolkits for tasks including i

    Provides a platform for scaling machine learning model training across distributed hardware clusters to handle large-scale datasets.

    Jupyter Notebookautomlbig-datadata-science
    Voir sur GitHub↗7,493
  • alibaba/x-deeplearningAvatar de alibaba

    alibaba/x-deeplearning

    4,301Voir sur GitHub↗

    Ce projet est une plateforme d'apprentissage automatique distribué et un framework d'apprentissage profond creux (sparse) conçu pour entraîner et servir des modèles avec des données creuses de haute dimension. Il fonctionne comme une infrastructure de service de modèles en ligne et un moteur de système de recommandation, permettant la récupération et le scoring d'éléments en temps réel en utilisant le deep tree matching et les réseaux de neurones. Le système se distingue par un framework d'apprentissage multi-tâches qui optimise plusieurs fonctions objectives au sein d'un espace de représentation partagé. Il dispose d'une infrastructure de service en ligne spécialisée qui prend en charge le chargement à chaud dynamique des modèles et la transformation des checkpoints standard en un format optimisé personnalisé pour une inférence haute performance. La plateforme couvre un large éventail de capacités, incluant la gestion distribuée des paramètres pour mettre à l'échelle l'entraînement sur plusieurs travailleurs, le calcul d'embeddings creux pour les caractéristiques catégorielles, et la récupération neuronale basée sur des arbres pour les catalogues à grande échelle. Elle fournit également des outils pour la gestion de l'entraînement en flux continu, le contrôle du cycle de vie des caractéristiques via des seuils de probabilité, et le profilage de performance pour identifier les goulots d'étranglement d'exécution. Le projet inclut une interface d'entraînement unifiée et une intégration de framework backend pour standardiser l'exécution des tâches d'entraînement, de prédiction et d'évaluation.

    Provides a system for scaling model training across distributed hardware clusters using centralized scheduling.

    PureBasic
    Voir sur GitHub↗4,301
  • azure/machinelearningnotebooksAvatar de Azure

    Azure/MachineLearningNotebooks

    4,354Voir sur GitHub↗

    Azure Machine Learning Notebooks is a cloud-based environment for developing and executing interactive Jupyter notebooks within a managed machine learning workspace. It provides managed machine learning compute through cloud-based workstations and containerized environments pre-configured with GPU drivers and kernels for high-performance model training. The project functions as a distributed GPU training platform and an ML experiment tracking system to monitor training metrics and version data assets. It also serves as an MLOps pipeline orchestrator for automating modular workflows and a mode

    Provides a platform for executing containerized training jobs across GPU clusters with managed compute resources.

    Jupyter Notebookazureazure-machine-learningazure-ml
    Voir sur GitHub↗4,354
  • fedml-ai/fedmlAvatar de FedML-AI

    FedML-AI/FedML

    4,048Voir sur GitHub↗

    FedML est une bibliothèque d'apprentissage automatique distribué, un framework d'apprentissage fédéré et un orchestrateur de charges de travail GPU. Il fournit les composants système essentiels pour exécuter l'entraînement et le fine-tuning de modèles à grande échelle sur des clusters GPU multi-cloud, sur site et décentralisés, tout en offrant un moteur dédié pour le déploiement de modèles évolutifs et un gestionnaire de pipeline MLOps pour la gestion du cycle de vie de bout en bout. La plateforme se distingue en permettant un apprentissage fédéré préservant la vie privée sur des appareils périphériques décentralisés et des silos organisationnels, en conservant les données brutes sur le matériel local. Elle propose également une place de marché de calcul par mise en commun de ressources qui permet aux utilisateurs de contribuer leur capacité GPU inutilisée à un pool partagé pour l'exécution de tâches distribuées. Le système couvre un large éventail de capacités, notamment l'orchestration GPU multi-cloud, la gestion automatisée des pipelines d'apprentissage automatique et le déploiement d'IA en périphérie pour les appareils IoT et les smartphones. Il intègre en outre des outils pour le fine-tuning de modèles fondamentaux, le déploiement d'inférence à faible latence et le suivi des expériences d'entraînement avec profilage des performances matérielles. Les utilisateurs peuvent lancer et planifier des charges de travail à l'aide d'une interface en ligne de commande et de fichiers de configuration déclaratifs.

    Implements a platform designed for scaling model training across distributed hardware clusters, including on-premise and cloud environments.

    Python
    Voir sur GitHub↗4,048
  1. Home
  2. Artificial Intelligence & ML
  3. Machine Learning
  4. Infrastructure
  5. Integrated Development Platforms
  6. Machine Learning Platforms
  7. Distributed Training Platforms