9 dépôts
Scalable systems for distributing the construction of machine learning models across compute clusters.
Distinct from Language Model Trainers: Candidates focus on language models or Redis clusters; this is for general gradient boosting training distribution.
Explore 9 awesome GitHub repositories matching artificial intelligence & ml · Distributed ML Trainers. Refine with filters or upvote what's useful.
CatBoost is a gradient boosting machine learning library used to train decision tree ensembles for regression, classification, and ranking tasks. It functions as a high-performance framework that provides a categorical data processor for transforming non-numeric features, a distributed trainer for large-scale datasets, and GPU acceleration to speed up model construction. The library distinguishes itself through native handling of categorical data and text features, removing the need for manual encoding. It includes a specialized model interpretability tool that leverages SHAP values and featu
Scales model construction across a cluster using Apache Spark for massive datasets.
TensorTrade is a reinforcement learning trading framework designed for training and deploying autonomous agents that optimize financial market strategies. It provides an algorithmic trading simulation environment where agents can be tested against market data using simulated broker environments. The framework features a distributed training system using RLlib to optimize decision policies across large datasets. It includes a walk-forward validation tool that evaluates trading strategies through windowed performance analysis to prevent overfitting and measure real-world viability. The project
Uses a distributed training system to optimize decision policies across large datasets for financial agents.
llm-foundry est un framework d'entraînement pour grands modèles de langage, fournissant un système pour le pré-entraînement de modèles de fondation et le fine-tuning supervisé. Il inclut un entraîneur distribué pour mettre à l'échelle les charges de travail sur plusieurs nœuds et GPU, un pipeline de streaming de données pour charger les données depuis le stockage cloud, et une implémentation de fine-tuning efficace en paramètres. Le framework se distingue par son utilisation du sharding de paramètres et du streaming de données à haut débit pour maintenir la stabilité lors d'entraînements à grande échelle. Il intègre l'adaptation de bas rang (LoRA) pour réduire les coûts de calcul et utilise une précision en virgule flottante 8 bits pour augmenter la vitesse de calcul sur le matériel compatible. La base de code couvre un large éventail de capacités, incluant l'ingénierie de jeux de données pour transformer des données brutes en formats compressés, le benchmarking des performances des modèles via une suite d'évaluation, et la capacité d'exporter les poids des modèles dans des formats industriels standardisés. Il prend également en charge l'enregistrement de composants personnalisés via des décorateurs et offre un contrôle sur les méthodes d'embedding positionnel.
Ships a scalable trainer for distributing LLM workloads across compute clusters using parameter sharding.
Ce projet est un moteur de workflow d'apprentissage automatique conteneurisé et un orchestrateur conçu pour automatiser le cycle de vie complet des modèles d'apprentissage automatique sur des clusters Kubernetes. Il fonctionne comme un compilateur de pipeline MLOps qui transforme un langage spécifique au domaine en spécifications structurées pour un déploiement portable et évolutif. La plateforme fournit un environnement multi-tenant avec des espaces de noms isolés et une authentification par fournisseur d'identité. Elle se distingue par une combinaison d'isolation des tâches basée sur des conteneurs, une gestion des artefacts fortement typée pour le passage de données et une mise en cache des résultats adressable par contenu pour éviter les calculs redondants. Le système couvre l'orchestration complète des workflows, incluant l'exécution parallèle des tâches, la planification récurrente des exécutions et la logique de branchement conditionnel. Il prend en outre en charge le suivi des expériences, la collecte des métriques de workflow et la gestion des composants de pipeline réutilisables, avec la possibilité de configurer des demandes de ressources matérielles spécifiques pour le CPU, la mémoire et le GPU. Le logiciel est distribué via un SDK Python et peut être déployé dans des environnements autonomes, locaux ou multi-tenant.
Implements scalable systems for distributing the construction of machine learning models across compute clusters.
Il s'agit d'un framework de recommandation PyTorch et d'un modèle de recommandation d'apprentissage profond conçu pour générer des prédictions de contenu personnalisées. Il fonctionne comme un entraîneur d'embeddings distribué qui traite des caractéristiques denses et creuses via une architecture de réseau neuronal pour prédire les préférences des utilisateurs. Le projet implémente un système d'apprentissage automatique optimisé pour CUDA utilisant des noyaux GPU spécialisés pour accélérer la recherche et l'agrégation d'embeddings. Il emploie une approche distribuée pour fragmenter (shard) des tables de caractéristiques creuses massives sur plusieurs GPU, permettant l'entraînement de modèles à grande échelle. Le système utilise une architecture à deux tours pour l'interaction des caractéristiques et prend en charge le parallélisme hybride, combinant le parallélisme de données et de modèle sur des clusters de calcul. Sa surface de capacités inclut l'entraînement distribué sur des nœuds réseau, l'optimisation de la mémoire GPU et la récupération d'état basée sur des points de contrôle (checkpoints).
Implements a scalable system for distributing the training of large-scale embedding models across compute clusters.
OpenManus-RL is a reinforcement learning framework and distributed training pipeline designed to train large language models as agents. It serves as an agentic reasoning optimizer and reward model trainer, providing the infrastructure to improve model decision-making through reward-based policy optimization. The project distinguishes itself through a distributed architecture that supports parameter sharding across multiple compute nodes and a coordinated rollout system for collecting interaction trajectories. It incorporates advanced reasoning strategies, such as Tree-of-Thoughts and Monte Ca
Coordinates environment initialization, worker group scaling, and policy updates across multiple compute nodes.
Hallo2 is an AI video generation tool and audio-driven portrait animation framework designed to transform static images into speaking videos. It functions as a portrait image animator that synchronizes a single photo with an audio track to produce high-resolution talking head videos. The system includes a distributed animation trainer for fine-tuning deep learning models using custom datasets and distributed computing resources. It employs hierarchical video generation and temporal consistency modeling to produce long-form character animations that remain stable over extended durations. The
Provides a scalable system for distributing the fine-tuning of animation models across compute clusters.
Open-Instruct is a distributed training and instruction tuning framework for large language models. It functions as a coordinator for supervised fine-tuning, reinforcement learning from human feedback pipelines, and tool-use training, providing specialized roles for dataset curation and model alignment. The project distinguishes itself through a high-performance training architecture that utilizes actor-based distributed coordination and hybrid sharding to manage large GPU clusters. It implements advanced alignment techniques including direct preference optimization, group relative policy opt
Provides a coordinator for managing environment initialization and worker scaling across large GPU clusters during distributed training.
This project is a training pipeline and framework for developing Chinese language models based on the Llama 2 architecture. It functions as a distributed GPU trainer and dataset preprocessing toolkit designed for both the initial pre-training of baseline models and subsequent supervised fine-tuning. The system distinguishes itself through a specialized workflow for Chinese text, incorporating a data curation pipeline that uses similarity hashing for deduplication and a tokenization process that converts raw text into memory-mapped binary files for efficient disk access. It implements a superv
Provides a scalable system for distributing the training of language models across multiple GPU compute nodes.