awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

9 repositorios

Awesome GitHub RepositoriesDistributed ML Trainers

Scalable systems for distributing the construction of machine learning models across compute clusters.

Distinct from Language Model Trainers: Candidates focus on language models or Redis clusters; this is for general gradient boosting training distribution.

Explore 9 awesome GitHub repositories matching artificial intelligence & ml · Distributed ML Trainers. Refine with filters or upvote what's useful.

Awesome Distributed ML Trainers GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • catboost/catboostAvatar de catboost

    catboost/catboost

    8,808Ver en GitHub↗

    CatBoost is a gradient boosting machine learning library used to train decision tree ensembles for regression, classification, and ranking tasks. It functions as a high-performance framework that provides a categorical data processor for transforming non-numeric features, a distributed trainer for large-scale datasets, and GPU acceleration to speed up model construction. The library distinguishes itself through native handling of categorical data and text features, removing the need for manual encoding. It includes a specialized model interpretability tool that leverages SHAP values and featu

    Scales model construction across a cluster using Apache Spark for massive datasets.

    C++big-datacatboostcategorical-features
    Ver en GitHub↗8,808
  • tensortrade-org/tensortradeAvatar de tensortrade-org

    tensortrade-org/tensortrade

    6,346Ver en GitHub↗

    TensorTrade is a reinforcement learning trading framework designed for training and deploying autonomous agents that optimize financial market strategies. It provides an algorithmic trading simulation environment where agents can be tested against market data using simulated broker environments. The framework features a distributed training system using RLlib to optimize decision policies across large datasets. It includes a walk-forward validation tool that evaluates trading strategies through windowed performance analysis to prevent overfitting and measure real-world viability. The project

    Uses a distributed training system to optimize decision policies across large datasets for financial agents.

    Python
    Ver en GitHub↗6,346
  • mosaicml/llm-foundryAvatar de mosaicml

    mosaicml/llm-foundry

    4,415Ver en GitHub↗

    llm-foundry es un framework de entrenamiento para modelos de lenguaje de gran tamaño (LLM), que proporciona un sistema para el preentrenamiento de modelos base y el ajuste fino (fine-tuning) supervisado. Incluye un entrenador distribuido para escalar cargas de trabajo a través de múltiples nodos y GPUs, un pipeline de streaming de datasets para cargar datos desde almacenamiento en la nube y una implementación de ajuste fino eficiente en parámetros. El framework se distingue por su uso de fragmentación de parámetros (sharding) y streaming de datos de alto rendimiento para mantener la estabilidad durante el entrenamiento a gran escala. Incorpora adaptación de bajo rango (LoRA) para reducir los costes computacionales y utiliza precisión de punto flotante de ocho bits para aumentar la velocidad de cómputo en hardware compatible. El código base cubre una amplia gama de capacidades, incluyendo ingeniería de datasets para transformar datos crudos en formatos comprimidos, evaluación del rendimiento del modelo mediante una suite de evaluación y la capacidad de exportar pesos del modelo a formatos estándar de la industria. También admite el registro de componentes personalizados mediante decoradores y proporciona control sobre los métodos de embedding posicional.

    Ships a scalable trainer for distributing LLM workloads across compute clusters using parameter sharding.

    Pythondeep-learningllmneural-networks
    Ver en GitHub↗4,415
  • kubeflow/pipelinesAvatar de kubeflow

    kubeflow/pipelines

    4,154Ver en GitHub↗

    Este proyecto es un motor de flujo de trabajo de aprendizaje automático contenerizado y orquestador diseñado para automatizar el ciclo de vida completo de modelos de aprendizaje automático en clusters de Kubernetes. Funciona como un compilador de pipeline de MLOps que transforma un lenguaje específico de dominio en especificaciones estructuradas para un despliegue portátil y escalable. La plataforma proporciona un entorno multi-inquilino con namespaces aislados y autenticación mediante proveedor de identidad. Se distingue por una combinación de aislamiento de tareas basado en contenedores, gestión de artefactos fuertemente tipados para el paso de datos y caché de resultados direccionable por contenido para evitar cálculos redundantes. El sistema cubre la orquestación integral de flujos de trabajo, incluyendo ejecución de tareas en paralelo, programación de ejecuciones recurrentes y lógica de ramificación condicional. Además, admite el seguimiento de experimentos, la recolección de métricas de flujo de trabajo y la gestión de componentes de pipeline reutilizables, con la capacidad de configurar solicitudes de recursos de hardware específicos para CPU, memoria y GPU. El software se distribuye a través de un SDK de Python y puede desplegarse en entornos independientes, locales o multi-inquilino.

    Implements scalable systems for distributing the construction of machine learning models across compute clusters.

    Python
    Ver en GitHub↗4,154
  • facebookresearch/dlrmAvatar de facebookresearch

    facebookresearch/dlrm

    4,044Ver en GitHub↗

    Este es un framework de recomendación de PyTorch y modelo de recomendación de aprendizaje profundo diseñado para generar predicciones de contenido personalizadas. Funciona como un entrenador de embeddings distribuido que procesa características densas y dispersas a través de una arquitectura de red neuronal para predecir las preferencias del usuario. El proyecto implementa un sistema de aprendizaje automático optimizado para CUDA utilizando kernels de GPU especializados para acelerar la búsqueda y agregación de embeddings. Emplea un enfoque distribuido para fragmentar tablas de características dispersas masivas a través de múltiples GPU, permitiendo el entrenamiento de modelos a gran escala. El sistema utiliza una arquitectura de dos torres para la interacción de características y admite paralelismo híbrido, combinando paralelismo de datos y de modelo a través de clústeres de cómputo. Su superficie de capacidades incluye entrenamiento distribuido a través de nodos de red, optimización de memoria de GPU y recuperación de estado basada en puntos de control.

    Implements a scalable system for distributing the training of large-scale embedding models across compute clusters.

    Python
    Ver en GitHub↗4,044
  • openmanus/openmanus-rlAvatar de OpenManus

    OpenManus/OpenManus-RL

    3,916Ver en GitHub↗

    OpenManus-RL is a reinforcement learning framework and distributed training pipeline designed to train large language models as agents. It serves as an agentic reasoning optimizer and reward model trainer, providing the infrastructure to improve model decision-making through reward-based policy optimization. The project distinguishes itself through a distributed architecture that supports parameter sharding across multiple compute nodes and a coordinated rollout system for collecting interaction trajectories. It incorporates advanced reasoning strategies, such as Tree-of-Thoughts and Monte Ca

    Coordinates environment initialization, worker group scaling, and policy updates across multiple compute nodes.

    Python
    Ver en GitHub↗3,916
  • fudan-generative-vision/hallo2Avatar de fudan-generative-vision

    fudan-generative-vision/hallo2

    3,713Ver en GitHub↗

    Hallo2 is an AI video generation tool and audio-driven portrait animation framework designed to transform static images into speaking videos. It functions as a portrait image animator that synchronizes a single photo with an audio track to produce high-resolution talking head videos. The system includes a distributed animation trainer for fine-tuning deep learning models using custom datasets and distributed computing resources. It employs hierarchical video generation and temporal consistency modeling to produce long-form character animations that remain stable over extended durations. The

    Provides a scalable system for distributing the fine-tuning of animation models across compute clusters.

    Python
    Ver en GitHub↗3,713
  • allenai/open-instructAvatar de allenai

    allenai/open-instruct

    3,586Ver en GitHub↗

    Open-Instruct is a distributed training and instruction tuning framework for large language models. It functions as a coordinator for supervised fine-tuning, reinforcement learning from human feedback pipelines, and tool-use training, providing specialized roles for dataset curation and model alignment. The project distinguishes itself through a high-performance training architecture that utilizes actor-based distributed coordination and hybrid sharding to manage large GPU clusters. It implements advanced alignment techniques including direct preference optimization, group relative policy opt

    Provides a coordinator for managing environment initialization and worker scaling across large GPU clusters during distributed training.

    Python
    Ver en GitHub↗3,586
  • dllxw/baby-llama2-chineseAvatar de DLLXW

    DLLXW/baby-llama2-chinese

    2,891Ver en GitHub↗

    This project is a training pipeline and framework for developing Chinese language models based on the Llama 2 architecture. It functions as a distributed GPU trainer and dataset preprocessing toolkit designed for both the initial pre-training of baseline models and subsequent supervised fine-tuning. The system distinguishes itself through a specialized workflow for Chinese text, incorporating a data curation pipeline that uses similarity hashing for deduplication and a tokenization process that converts raw text into memory-mapped binary files for efficient disk access. It implements a superv

    Provides a scalable system for distributing the training of language models across multiple GPU compute nodes.

    Python
    Ver en GitHub↗2,891
  1. Home
  2. Artificial Intelligence & ML
  3. Distributed ML Trainers

Explorar subetiquetas

  • Trainer CoordinationManagement of environment initialization and worker scaling for distributed ML training. **Distinct from Distributed ML Trainers:** Focuses on the orchestration of training workers rather than the general distribution of the model.