awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

9 dépôts

Awesome GitHub RepositoriesDistributed ML Trainers

Scalable systems for distributing the construction of machine learning models across compute clusters.

Distinct from Language Model Trainers: Candidates focus on language models or Redis clusters; this is for general gradient boosting training distribution.

Explore 9 awesome GitHub repositories matching artificial intelligence & ml · Distributed ML Trainers. Refine with filters or upvote what's useful.

Awesome Distributed ML Trainers GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • catboost/catboostAvatar de catboost

    catboost/catboost

    8,808Voir sur GitHub↗

    CatBoost is a gradient boosting machine learning library used to train decision tree ensembles for regression, classification, and ranking tasks. It functions as a high-performance framework that provides a categorical data processor for transforming non-numeric features, a distributed trainer for large-scale datasets, and GPU acceleration to speed up model construction. The library distinguishes itself through native handling of categorical data and text features, removing the need for manual encoding. It includes a specialized model interpretability tool that leverages SHAP values and featu

    Scales model construction across a cluster using Apache Spark for massive datasets.

    C++big-datacatboostcategorical-features
    Voir sur GitHub↗8,808
  • tensortrade-org/tensortradeAvatar de tensortrade-org

    tensortrade-org/tensortrade

    6,346Voir sur GitHub↗

    TensorTrade is a reinforcement learning trading framework designed for training and deploying autonomous agents that optimize financial market strategies. It provides an algorithmic trading simulation environment where agents can be tested against market data using simulated broker environments. The framework features a distributed training system using RLlib to optimize decision policies across large datasets. It includes a walk-forward validation tool that evaluates trading strategies through windowed performance analysis to prevent overfitting and measure real-world viability. The project

    Uses a distributed training system to optimize decision policies across large datasets for financial agents.

    Python
    Voir sur GitHub↗6,346
  • mosaicml/llm-foundryAvatar de mosaicml

    mosaicml/llm-foundry

    4,415Voir sur GitHub↗

    llm-foundry est un framework d'entraînement pour grands modèles de langage, fournissant un système pour le pré-entraînement de modèles de fondation et le fine-tuning supervisé. Il inclut un entraîneur distribué pour mettre à l'échelle les charges de travail sur plusieurs nœuds et GPU, un pipeline de streaming de données pour charger les données depuis le stockage cloud, et une implémentation de fine-tuning efficace en paramètres. Le framework se distingue par son utilisation du sharding de paramètres et du streaming de données à haut débit pour maintenir la stabilité lors d'entraînements à grande échelle. Il intègre l'adaptation de bas rang (LoRA) pour réduire les coûts de calcul et utilise une précision en virgule flottante 8 bits pour augmenter la vitesse de calcul sur le matériel compatible. La base de code couvre un large éventail de capacités, incluant l'ingénierie de jeux de données pour transformer des données brutes en formats compressés, le benchmarking des performances des modèles via une suite d'évaluation, et la capacité d'exporter les poids des modèles dans des formats industriels standardisés. Il prend également en charge l'enregistrement de composants personnalisés via des décorateurs et offre un contrôle sur les méthodes d'embedding positionnel.

    Ships a scalable trainer for distributing LLM workloads across compute clusters using parameter sharding.

    Pythondeep-learningllmneural-networks
    Voir sur GitHub↗4,415
  • kubeflow/pipelinesAvatar de kubeflow

    kubeflow/pipelines

    4,154Voir sur GitHub↗

    Ce projet est un moteur de workflow d'apprentissage automatique conteneurisé et un orchestrateur conçu pour automatiser le cycle de vie complet des modèles d'apprentissage automatique sur des clusters Kubernetes. Il fonctionne comme un compilateur de pipeline MLOps qui transforme un langage spécifique au domaine en spécifications structurées pour un déploiement portable et évolutif. La plateforme fournit un environnement multi-tenant avec des espaces de noms isolés et une authentification par fournisseur d'identité. Elle se distingue par une combinaison d'isolation des tâches basée sur des conteneurs, une gestion des artefacts fortement typée pour le passage de données et une mise en cache des résultats adressable par contenu pour éviter les calculs redondants. Le système couvre l'orchestration complète des workflows, incluant l'exécution parallèle des tâches, la planification récurrente des exécutions et la logique de branchement conditionnel. Il prend en outre en charge le suivi des expériences, la collecte des métriques de workflow et la gestion des composants de pipeline réutilisables, avec la possibilité de configurer des demandes de ressources matérielles spécifiques pour le CPU, la mémoire et le GPU. Le logiciel est distribué via un SDK Python et peut être déployé dans des environnements autonomes, locaux ou multi-tenant.

    Implements scalable systems for distributing the construction of machine learning models across compute clusters.

    Python
    Voir sur GitHub↗4,154
  • facebookresearch/dlrmAvatar de facebookresearch

    facebookresearch/dlrm

    4,044Voir sur GitHub↗

    Il s'agit d'un framework de recommandation PyTorch et d'un modèle de recommandation d'apprentissage profond conçu pour générer des prédictions de contenu personnalisées. Il fonctionne comme un entraîneur d'embeddings distribué qui traite des caractéristiques denses et creuses via une architecture de réseau neuronal pour prédire les préférences des utilisateurs. Le projet implémente un système d'apprentissage automatique optimisé pour CUDA utilisant des noyaux GPU spécialisés pour accélérer la recherche et l'agrégation d'embeddings. Il emploie une approche distribuée pour fragmenter (shard) des tables de caractéristiques creuses massives sur plusieurs GPU, permettant l'entraînement de modèles à grande échelle. Le système utilise une architecture à deux tours pour l'interaction des caractéristiques et prend en charge le parallélisme hybride, combinant le parallélisme de données et de modèle sur des clusters de calcul. Sa surface de capacités inclut l'entraînement distribué sur des nœuds réseau, l'optimisation de la mémoire GPU et la récupération d'état basée sur des points de contrôle (checkpoints).

    Implements a scalable system for distributing the training of large-scale embedding models across compute clusters.

    Python
    Voir sur GitHub↗4,044
  • openmanus/openmanus-rlAvatar de OpenManus

    OpenManus/OpenManus-RL

    3,916Voir sur GitHub↗

    OpenManus-RL is a reinforcement learning framework and distributed training pipeline designed to train large language models as agents. It serves as an agentic reasoning optimizer and reward model trainer, providing the infrastructure to improve model decision-making through reward-based policy optimization. The project distinguishes itself through a distributed architecture that supports parameter sharding across multiple compute nodes and a coordinated rollout system for collecting interaction trajectories. It incorporates advanced reasoning strategies, such as Tree-of-Thoughts and Monte Ca

    Coordinates environment initialization, worker group scaling, and policy updates across multiple compute nodes.

    Python
    Voir sur GitHub↗3,916
  • fudan-generative-vision/hallo2Avatar de fudan-generative-vision

    fudan-generative-vision/hallo2

    3,713Voir sur GitHub↗

    Hallo2 is an AI video generation tool and audio-driven portrait animation framework designed to transform static images into speaking videos. It functions as a portrait image animator that synchronizes a single photo with an audio track to produce high-resolution talking head videos. The system includes a distributed animation trainer for fine-tuning deep learning models using custom datasets and distributed computing resources. It employs hierarchical video generation and temporal consistency modeling to produce long-form character animations that remain stable over extended durations. The

    Provides a scalable system for distributing the fine-tuning of animation models across compute clusters.

    Python
    Voir sur GitHub↗3,713
  • allenai/open-instructAvatar de allenai

    allenai/open-instruct

    3,586Voir sur GitHub↗

    Open-Instruct is a distributed training and instruction tuning framework for large language models. It functions as a coordinator for supervised fine-tuning, reinforcement learning from human feedback pipelines, and tool-use training, providing specialized roles for dataset curation and model alignment. The project distinguishes itself through a high-performance training architecture that utilizes actor-based distributed coordination and hybrid sharding to manage large GPU clusters. It implements advanced alignment techniques including direct preference optimization, group relative policy opt

    Provides a coordinator for managing environment initialization and worker scaling across large GPU clusters during distributed training.

    Python
    Voir sur GitHub↗3,586
  • dllxw/baby-llama2-chineseAvatar de DLLXW

    DLLXW/baby-llama2-chinese

    2,891Voir sur GitHub↗

    This project is a training pipeline and framework for developing Chinese language models based on the Llama 2 architecture. It functions as a distributed GPU trainer and dataset preprocessing toolkit designed for both the initial pre-training of baseline models and subsequent supervised fine-tuning. The system distinguishes itself through a specialized workflow for Chinese text, incorporating a data curation pipeline that uses similarity hashing for deduplication and a tokenization process that converts raw text into memory-mapped binary files for efficient disk access. It implements a superv

    Provides a scalable system for distributing the training of language models across multiple GPU compute nodes.

    Python
    Voir sur GitHub↗2,891
  1. Home
  2. Artificial Intelligence & ML
  3. Distributed ML Trainers

Explorer les sous-tags

  • Trainer CoordinationManagement of environment initialization and worker scaling for distributed ML training. **Distinct from Distributed ML Trainers:** Focuses on the orchestration of training workers rather than the general distribution of the model.