22 repositorios
Pipelines for batching and processing large-scale datasets specifically for model training.
Distinct from Cloud Batch Processing: The candidates are focused on audio, images, or generic cloud batching; this is specific to ML training data like JSONL
Explore 22 awesome GitHub repositories matching artificial intelligence & ml · Training Dataset Processing. Refine with filters or upvote what's useful.
This repository is a collection of Jupyter notebooks providing reference implementations and templates for building, training, and deploying machine learning models using Amazon SageMaker. It serves as an example library for implementing model architectures and automating the machine learning lifecycle. The library provides practical patterns for machine learning training, data engineering, and model deployment. It includes implementation guides for MLOps, including workflows for model monitoring, lineage tracking, and hyperparameter tuning. The examples cover a broad range of capabilities i
Transforms and cleans large datasets using distributed computing tools to prepare high-quality features for training.
This project is a structured learning curriculum and technical reference for mastering deep learning with TensorFlow. It provides a comprehensive guide for building, training, and deploying neural networks, combining theoretical fundamentals with practical implementation examples. The repository distinguishes itself by covering the end-to-end machine learning workflow, from low-level tensor mathematics and linear algebra to the creation of complex model architectures. It includes specific guidance on developing data pipelines for diverse data types, such as images, text, and time-series seque
Provides pipelines for batching and processing large-scale datasets specifically for model training.
ART is a platform for agentic training, providing a reinforcement learning framework, training environment, and compute orchestrator. It enables the improvement of multi-step agent reasoning and tool usage through group relative policy optimization and a judge-based reward modeling system. The project features tools for model distillation to transfer capabilities from large teacher models to smaller architectures, as well as a system for capturing execution trajectories to generate synthetic training data. It supports specialized training workflows including supervised fine-tuning for baselin
Processes high-volume training data from JSONL files using automated batching and learning rate schedules.
This repository contains programming assignments and lecture notes from Andrew Ng's foundational deep learning course specialization on Coursera. The materials cover core neural network training techniques including optimization algorithms, normalization methods, regularization approaches, parameter initialization strategies, and learning rate scheduling to improve model convergence and generalization. The coursework explores design principles where successive neural network layers learn progressively more abstract feature representations from input data. It provides guidance on selecting ope
Covers mini-batch gradient descent optimization for processing training data in small groups to speed up iterations.
gpt-neox is a distributed training system and framework for building large-scale autoregressive language models. It implements the transformer architecture and provides a toolkit for training models with billions of parameters by distributing weights across compute clusters. The framework distinguishes itself through extensive support for distributed model parallelism, including pipeline and sequence parallelism, to overcome single-device memory limits. It further supports sparse model architectures using a mixture of experts system with Sinkhorn-based routing. The project covers a broad ran
Handles training, validation, and test data paths with support for weighted sampling from multiple sources.
This project is a machine learning educational resource and implementation guide for Python. It provides a collection of executable code and notebooks that demonstrate predictive modeling, data analysis workflows, and the implementation of various machine learning algorithms. The repository features practical examples of classification, regression, and clustering tasks using Scikit-Learn, alongside tutorials for building and training deep learning architectures with TensorFlow. These include implementations of convolutional and recurrent networks. The content covers a broad range of capabili
Executes cleaning and dimensionality reduction workflows to prepare raw datasets for model training.
Feast is a machine learning feature store and MLOps data infrastructure layer. It provides a centralized system for managing and serving features across offline training and online production environments, utilizing an online feature serving layer for low-latency retrieval. The project centers on a feature registry that acts as a central catalog for defining, governing, and discovering feature services. It employs a unified data access layer to decouple feature retrieval from physical storage and includes a point-in-time data generator to create historically accurate training datasets that pr
Generates point-in-time correct historical datasets for machine learning training while preventing data leakage.
MMDetection3D is an open-source toolbox for 3D perception, providing a unified framework for detecting and segmenting objects in three-dimensional environments. It supports a range of core tasks including monocular 3D object detection from single camera images, LiDAR-based 3D object detection from raw point clouds, and multi-modal fusion that combines camera images with LiDAR data. The toolbox also covers point cloud semantic segmentation, assigning class labels to every point in a scan for scene understanding. The project distinguishes itself through a config-driven pipeline that orchestrate
Provides a pipeline for training 3D detection models on custom point cloud datasets with user-provided annotations.
Este proyecto es una serie de tutoriales de aprendizaje profundo y un currículo educativo diseñado para enseñar los fundamentos de PyTorch. Sirve como una guía de entrenamiento estructurada para dominar la arquitectura de redes neuronales, la diferenciación automática y el uso de tensores y grafos de computación dinámica. El currículo se centra en implementaciones prácticas, guiando específicamente el desarrollo de sistemas de recomendación, modelos de publicidad y redes de interés para predecir las preferencias del usuario. También proporciona contenido instructivo para el pronóstico de series temporales y el procesamiento de datos secuenciales. El material cubre una amplia gama de capacidades de aprendizaje profundo, incluyendo la construcción de modelos para clasificación de imágenes y texto, así como datos estructurados. Incorpora flujos de trabajo para aceleración por GPU, visualización de métricas de entrenamiento y la creación de interfaces basadas en web para probar las predicciones del modelo. El proyecto se entrega como una colección de Jupyter Notebooks.
Teaches how to organize raw datasets into shuffled mini-batches for efficient training.
River es un framework de Python para machine learning online, diseñado para entrenar y evaluar modelos en datos de streaming. Permite el aprendizaje incremental actualizando los parámetros del modelo una observación a la vez, eliminando la necesidad de almacenar datasets de entrenamiento completos en memoria. La librería se distingue por un sistema dedicado de detección de concept drift que monitorea cambios en las distribuciones de datos para disparar la adaptación del modelo. También proporciona un framework de validación progresiva que simula el despliegue en tiempo real probando modelos en muestras antes de usarlos para el entrenamiento. El sistema cubre un amplio rango de capacidades de streaming, incluyendo ingeniería de características en tiempo real, pronóstico de series temporales y detección de anomalías online. Soporta aprendizaje no supervisado mediante clustering incremental y árboles de decisión, así como agregación de ensamblajes y políticas de bandidos para la selección de modelos. El proyecto incluye utilidades para la ingesta de datos de streaming desde fuentes como archivos CSV y APIs, así como herramientas para calcular estadísticas en ejecución y sketches de datos eficientes en memoria.
Handles small groups of observations using data frames to balance batch efficiency with online learning requirements.
Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a config-driven system for instantiating components, orchestrating distributed training, and managing parameter-efficient fine-tuning with quantization support, all through YAML-based configurations and command-line overrides. The library distinguishes itself through its comprehensive post-training workflow orchestration, combining supervised fine-tuning, preference optimization (DPO, PPO, GRPO), knowledge distillation, and quantization-aware training in a single configurable pip
Supports fine-tuning on custom instruct, chat, and preference datasets with full-parameter or LoRA methods.
Este proyecto es un framework de alineación y un conjunto de pipelines para entrenar modelos de lenguaje mediante fine-tuning supervisado y optimización de preferencias. Proporciona herramientas para ejecutar entrenamiento distribuido a gran escala a través de múltiples GPU y nodos de cómputo, junto con un sistema para medir la utilidad del modelo y la calidad del diálogo mediante benchmarks de turno único y turnos múltiples. El framework incluye herramientas especializadas para la optimización directa de preferencias (DPO) con el fin de refinar el comportamiento del modelo utilizando datos emparejados sin necesidad de un modelo de recompensa independiente. También admite la alineación mediante IA constitucional y el entrenamiento de modelos de recompensa para clasificar y puntuar respuestas basadas en criterios de preferencia. El proyecto cubre capacidades más amplias para la mezcla y combinación de datasets, fine-tuning eficiente en parámetros mediante adaptación de bajo rango (LoRA) y optimización mediante muestreo de rechazo. Gestiona el ciclo de vida del entrenamiento a través de recetas basadas en configuración y proporciona sistemas para transmitir métricas de rendimiento en tiempo real a paneles de control externos.
Combines multiple datasets with weighted sampling and formats them into chat templates for training.
PCDet es una caja de herramientas para la detección de objetos 3D mediante LiDAR y una librería de procesamiento de nubes de puntos construida sobre el framework de deep learning PyTorch. Proporciona un sistema para identificar y localizar objetos tridimensionales dentro de datos de nubes de puntos. El proyecto utiliza un patrón de separación de datos y modelo para desacoplar la lógica de carga del dataset del pipeline de detección principal. Cuenta con un pipeline de fusión multisensor que combina datos de múltiples sensores en una vista espacial compartida y un sistema de entrenamiento distribuido en GPU para escalar las cargas de trabajo a través de múltiples procesadores gráficos. El toolkit cubre varias áreas de capacidad, incluyendo la extracción de características basada en vóxeles y el análisis temporal de nubes de puntos mediante fusión de múltiples fotogramas. También incorpora optimizaciones de rendimiento para la intersección sobre unión 3D acelerada por GPU y la supresión de no máximos rotada.
Supports the integration and training of custom point cloud datasets with specific annotations.
MuseTalk is a deep learning lip synchronization system designed to align video facial movements with audio tracks for high-fidelity video dubbing. It functions as an engine that matches facial expressions to audio input in real-time, enabling the modification of a speaker's lip movements to match new audio sources across different languages. The project features a distributed GPU training pipeline and a multi-stage processing workflow for refining the visual accuracy of synthetic speech. It distinguishes itself through the use of region-specific face masking and mouth openness control, which
Implements a multi-stage pipeline for extracting and aligning video frames to create structured audio-visual training datasets.
OpenVLA is a vision-language-action model and framework designed for general-purpose robotic manipulation. It provides a robotic policy training framework and a control inference engine that map visual and textual inputs to robotic control actions, enabling zero-shot instruction following on hardware. The project includes a robotics dataset pipeline for standardizing diverse trajectory data and managing dataset mixtures. It supports large-scale model training through distributed GPU compute and sharded data parallelism, alongside parameter-efficient adaptation for fine-tuning models to new ta
Implements weighted sampling from multiple robotics datasets to control training influence.
xtuner es un motor de entrenamiento integral para modelos de lenguaje grandes, que ofrece un toolkit para pre-entrenamiento, ajuste fino supervisado (fine-tuning) y la optimización de modelos multimodales de visión-lenguaje. Sirve como un acelerador de entrenamiento distribuido y un framework especializado para escalar modelos de Mezcla de Expertos (MoE) y alinear el comportamiento del modelo mediante aprendizaje por refuerzo a partir de retroalimentación humana (RLHF). El proyecto se distingue por optimizaciones avanzadas de memoria y cómputo, como el paralelismo de secuencia para ventanas de contexto ultra largas y el paralelismo de pipeline entrelazado para reducir el tiempo de inactividad de la GPU. Proporciona una suite dedicada para la optimización de preferencias, implementando técnicas como Group Relative Policy Optimization y Direct Preference Optimization para refinar las políticas del modelo y los sistemas de recompensa. Las áreas de capacidad cubren el entrenamiento distribuido de modelos a través de múltiples nodos, la preparación de datasets multimodales y la gestión del ajuste fino basado en adaptadores. El motor también incluye herramientas para la evaluación de modelos, fusión de pesos y exportación de parámetros entrenados a motores de inferencia. El entrenamiento se gestiona mediante archivos de configuración estandarizados y lanzadores distribuidos para asegurar resultados consistentes a través de clusters de computación.
Supports pre-processing large datasets and saving them locally to eliminate repeated computation and timeouts.
Este proyecto es un framework de transferencia de estilo neuronal que proporciona un conjunto de herramientas de visión artificial para aplicar estilos artísticos a imágenes y videos. Funciona como un sistema para entrenar redes neuronales feedforward, un optimizador de estilo iterativo y un estilizador de video en tiempo real. El framework admite dos métodos principales de estilización: un modelo feedforward que aplica estilos en una sola pasada y un método de optimización iterativo que genera imágenes estilizadas minimizando la pérdida de contenido y estilo sin necesidad de un modelo preentrenado. También permite el procesamiento en tiempo real de transmisiones de cámaras web utilizando modelos entrenados. El proyecto cubre varias áreas de capacidad, incluyendo el procesamiento artístico de imágenes, el entrenamiento de modelos de transferencia de estilo mediante la minimización de la pérdida perceptual y utilidades de preparación de conjuntos de datos para formatear carpetas de imágenes en sets de entrenamiento compatibles.
Provides pipelines for batching and processing image directories into formats suitable for neural network training.
Este proyecto es un tutorial de aprendizaje profundo (deep learning) en PyTorch y un recurso educativo. Proporciona un plan de estudios estructurado y guías paso a paso para diseñar, entrenar y validar redes neuronales desde cero. El recurso incluye guías específicas sobre la implementación de visión artificial, centrándose en la detección de objetos y la clasificación de imágenes mediante redes neuronales convolucionales. También proporciona instrucciones para optimizar el rendimiento del modelo mediante aceleración por hardware para reducir el tiempo de entrenamiento. Los materiales cubren el ciclo de vida completo del desarrollo de modelos, incluyendo operaciones con tensores, preparación de conjuntos de datos de imágenes y el uso de funciones de pérdida y optimizadores. También aborda la gestión del ciclo de vida del modelo mediante el guardado y recarga de pesos entrenados.
Implements pipelines for batching and processing large-scale datasets for efficient model training.
Este proyecto proporciona una colección de conjuntos de datos conversacionales en chino procesados y flujos de trabajo de preprocesamiento diseñados para el entrenamiento y ajuste de instrucciones de modelos de lenguaje grandes (LLM). Funciona como un corpus de entrenamiento de texto en chino limpio y estandarizado, formateado como pares de consulta-respuesta. El repositorio incluye un pipeline de preprocesamiento y un agregador de conjuntos de datos que combinan múltiples fuentes de chat públicas en archivos unificados. Estas herramientas normalizan el texto convirtiendo caracteres chinos tradicionales a simplificados y transformando hilos de diálogo complejos en una secuencia estandarizada de turnos individuales. Los datos resultantes se exportan como archivos independientes separados por tabulaciones, asegurando un esquema consistente en fuentes dispares. Este flujo de trabajo de ingeniería se centra en eliminar inconsistencias de formato para preparar datos conversacionales sin procesar para tareas de aprendizaje automático.
Processes large-scale conversational datasets into structured formats specifically for machine learning training.
Este proyecto es un curso educativo de aprendizaje profundo y una guía de implementación diseñada para construir y entrenar redes neuronales. Proporciona un plan de estudios para desarrollar modelos que resuelvan tareas de reconocimiento de patrones y generación. El material incluye módulos especializados para entrenamiento en visión artificial, procesamiento de lenguaje natural e IA generativa. Cubre la aplicación práctica del aprendizaje por transferencia (transfer learning) para clasificar nuevos datos y la creación de medios sintéticos. El proyecto abarca el diseño de arquitecturas de red, la construcción de pipelines de datos de aprendizaje automático y el uso de diagnósticos de rendimiento del modelo para identificar subajuste (underfitting) o sobreajuste (overfitting). El contenido se entrega a través de Jupyter Notebooks.
Implements techniques for processing data in small groups to optimize memory and training speed.