awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

22 repositorios

Awesome GitHub RepositoriesTraining Dataset Processing

Pipelines for batching and processing large-scale datasets specifically for model training.

Distinct from Cloud Batch Processing: The candidates are focused on audio, images, or generic cloud batching; this is specific to ML training data like JSONL

Explore 22 awesome GitHub repositories matching artificial intelligence & ml · Training Dataset Processing. Refine with filters or upvote what's useful.

Awesome Training Dataset Processing GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • aws/amazon-sagemaker-examplesAvatar de aws

    aws/amazon-sagemaker-examples

    10,958Ver en GitHub↗

    This repository is a collection of Jupyter notebooks providing reference implementations and templates for building, training, and deploying machine learning models using Amazon SageMaker. It serves as an example library for implementing model architectures and automating the machine learning lifecycle. The library provides practical patterns for machine learning training, data engineering, and model deployment. It includes implementation guides for MLOps, including workflows for model monitoring, lineage tracking, and hyperparameter tuning. The examples cover a broad range of capabilities i

    Transforms and cleans large datasets using distributed computing tools to prepare high-quality features for training.

    Jupyter Notebookawsdata-sciencedeep-learning
    Ver en GitHub↗10,958
  • lyhue1991/eat_tensorflow2_in_30_daysAvatar de lyhue1991

    lyhue1991/eat_tensorflow2_in_30_days

    9,933Ver en GitHub↗

    This project is a structured learning curriculum and technical reference for mastering deep learning with TensorFlow. It provides a comprehensive guide for building, training, and deploying neural networks, combining theoretical fundamentals with practical implementation examples. The repository distinguishes itself by covering the end-to-end machine learning workflow, from low-level tensor mathematics and linear algebra to the creation of complex model architectures. It includes specific guidance on developing data pipelines for diverse data types, such as images, text, and time-series seque

    Provides pipelines for batching and processing large-scale datasets specifically for model training.

    Pythontensorflowtensorflow-examplestensorflow-tutorial
    Ver en GitHub↗9,933
  • openpipe/artAvatar de OpenPipe

    OpenPipe/ART

    8,630Ver en GitHub↗

    ART is a platform for agentic training, providing a reinforcement learning framework, training environment, and compute orchestrator. It enables the improvement of multi-step agent reasoning and tool usage through group relative policy optimization and a judge-based reward modeling system. The project features tools for model distillation to transfer capabilities from large teacher models to smaller architectures, as well as a system for capturing execution trajectories to generate synthetic training data. It supports specialized training workflows including supervised fine-tuning for baselin

    Processes high-volume training data from JSONL files using automated batching and learning rate schedules.

    Pythonagentagentic-aigrpo
    Ver en GitHub↗8,630
  • kulbear/deep-learning-courseraAvatar de Kulbear

    Kulbear/deep-learning-coursera

    7,729Ver en GitHub↗

    This repository contains programming assignments and lecture notes from Andrew Ng's foundational deep learning course specialization on Coursera. The materials cover core neural network training techniques including optimization algorithms, normalization methods, regularization approaches, parameter initialization strategies, and learning rate scheduling to improve model convergence and generalization. The coursework explores design principles where successive neural network layers learn progressively more abstract feature representations from input data. It provides guidance on selecting ope

    Covers mini-batch gradient descent optimization for processing training data in small groups to speed up iterations.

    Jupyter Notebookcourseradeep-learning
    Ver en GitHub↗7,729
  • eleutherai/gpt-neoxAvatar de EleutherAI

    EleutherAI/gpt-neox

    7,392Ver en GitHub↗

    gpt-neox is a distributed training system and framework for building large-scale autoregressive language models. It implements the transformer architecture and provides a toolkit for training models with billions of parameters by distributing weights across compute clusters. The framework distinguishes itself through extensive support for distributed model parallelism, including pipeline and sequence parallelism, to overcome single-device memory limits. It further supports sparse model architectures using a mixture of experts system with Sinkhorn-based routing. The project covers a broad ran

    Handles training, validation, and test data paths with support for weighted sampling from multiple sources.

    Pythondeepspeed-librarygpt-3language-model
    Ver en GitHub↗7,392
  • rasbt/python-machine-learning-book-2nd-editionAvatar de rasbt

    rasbt/python-machine-learning-book-2nd-edition

    7,194Ver en GitHub↗

    This project is a machine learning educational resource and implementation guide for Python. It provides a collection of executable code and notebooks that demonstrate predictive modeling, data analysis workflows, and the implementation of various machine learning algorithms. The repository features practical examples of classification, regression, and clustering tasks using Scikit-Learn, alongside tutorials for building and training deep learning architectures with TensorFlow. These include implementations of convolutional and recurrent networks. The content covers a broad range of capabili

    Executes cleaning and dimensionality reduction workflows to prepare raw datasets for model training.

    Jupyter Notebookdata-sciencedeep-learningmachine-learning
    Ver en GitHub↗7,194
  • gojek/feastAvatar de gojek

    gojek/feast

    7,095Ver en GitHub↗

    Feast is a machine learning feature store and MLOps data infrastructure layer. It provides a centralized system for managing and serving features across offline training and online production environments, utilizing an online feature serving layer for low-latency retrieval. The project centers on a feature registry that acts as a central catalog for defining, governing, and discovering feature services. It employs a unified data access layer to decouple feature retrieval from physical storage and includes a point-in-time data generator to create historically accurate training datasets that pr

    Generates point-in-time correct historical datasets for machine learning training while preventing data leakage.

    Python
    Ver en GitHub↗7,095
  • open-mmlab/mmdetection3dAvatar de open-mmlab

    open-mmlab/mmdetection3d

    6,273Ver en GitHub↗

    MMDetection3D is an open-source toolbox for 3D perception, providing a unified framework for detecting and segmenting objects in three-dimensional environments. It supports a range of core tasks including monocular 3D object detection from single camera images, LiDAR-based 3D object detection from raw point clouds, and multi-modal fusion that combines camera images with LiDAR data. The toolbox also covers point cloud semantic segmentation, assigning class labels to every point in a scan for scene understanding. The project distinguishes itself through a config-driven pipeline that orchestrate

    Provides a pipeline for training 3D detection models on custom point cloud datasets with user-provided annotations.

    Python3d-object-detectionobject-detectionpoint-cloud
    Ver en GitHub↗6,273
  • lyhue1991/eat_pytorch_in_20_daysAvatar de lyhue1991

    lyhue1991/eat_pytorch_in_20_days

    6,157Ver en GitHub↗

    Este proyecto es una serie de tutoriales de aprendizaje profundo y un currículo educativo diseñado para enseñar los fundamentos de PyTorch. Sirve como una guía de entrenamiento estructurada para dominar la arquitectura de redes neuronales, la diferenciación automática y el uso de tensores y grafos de computación dinámica. El currículo se centra en implementaciones prácticas, guiando específicamente el desarrollo de sistemas de recomendación, modelos de publicidad y redes de interés para predecir las preferencias del usuario. También proporciona contenido instructivo para el pronóstico de series temporales y el procesamiento de datos secuenciales. El material cubre una amplia gama de capacidades de aprendizaje profundo, incluyendo la construcción de modelos para clasificación de imágenes y texto, así como datos estructurados. Incorpora flujos de trabajo para aceleración por GPU, visualización de métricas de entrenamiento y la creación de interfaces basadas en web para probar las predicciones del modelo. El proyecto se entrega como una colección de Jupyter Notebooks.

    Teaches how to organize raw datasets into shuffled mini-batches for efficient training.

    Jupyter Notebookdeep-learningpytorch
    Ver en GitHub↗6,157
  • online-ml/riverAvatar de online-ml

    online-ml/river

    5,853Ver en GitHub↗

    River es un framework de Python para machine learning online, diseñado para entrenar y evaluar modelos en datos de streaming. Permite el aprendizaje incremental actualizando los parámetros del modelo una observación a la vez, eliminando la necesidad de almacenar datasets de entrenamiento completos en memoria. La librería se distingue por un sistema dedicado de detección de concept drift que monitorea cambios en las distribuciones de datos para disparar la adaptación del modelo. También proporciona un framework de validación progresiva que simula el despliegue en tiempo real probando modelos en muestras antes de usarlos para el entrenamiento. El sistema cubre un amplio rango de capacidades de streaming, incluyendo ingeniería de características en tiempo real, pronóstico de series temporales y detección de anomalías online. Soporta aprendizaje no supervisado mediante clustering incremental y árboles de decisión, así como agregación de ensamblajes y políticas de bandidos para la selección de modelos. El proyecto incluye utilidades para la ingesta de datos de streaming desde fuentes como archivos CSV y APIs, así como herramientas para calcular estadísticas en ejecución y sketches de datos eficientes en memoria.

    Handles small groups of observations using data frames to balance batch efficiency with online learning requirements.

    Python
    Ver en GitHub↗5,853
  • meta-pytorch/torchtuneAvatar de meta-pytorch

    meta-pytorch/torchtune

    5,774Ver en GitHub↗

    Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a config-driven system for instantiating components, orchestrating distributed training, and managing parameter-efficient fine-tuning with quantization support, all through YAML-based configurations and command-line overrides. The library distinguishes itself through its comprehensive post-training workflow orchestration, combining supervised fine-tuning, preference optimization (DPO, PPO, GRPO), knowledge distillation, and quantization-aware training in a single configurable pip

    Supports fine-tuning on custom instruct, chat, and preference datasets with full-parameter or LoRA methods.

    Python
    Ver en GitHub↗5,774
  • huggingface/alignment-handbookAvatar de huggingface

    huggingface/alignment-handbook

    5,621Ver en GitHub↗

    Este proyecto es un framework de alineación y un conjunto de pipelines para entrenar modelos de lenguaje mediante fine-tuning supervisado y optimización de preferencias. Proporciona herramientas para ejecutar entrenamiento distribuido a gran escala a través de múltiples GPU y nodos de cómputo, junto con un sistema para medir la utilidad del modelo y la calidad del diálogo mediante benchmarks de turno único y turnos múltiples. El framework incluye herramientas especializadas para la optimización directa de preferencias (DPO) con el fin de refinar el comportamiento del modelo utilizando datos emparejados sin necesidad de un modelo de recompensa independiente. También admite la alineación mediante IA constitucional y el entrenamiento de modelos de recompensa para clasificar y puntuar respuestas basadas en criterios de preferencia. El proyecto cubre capacidades más amplias para la mezcla y combinación de datasets, fine-tuning eficiente en parámetros mediante adaptación de bajo rango (LoRA) y optimización mediante muestreo de rechazo. Gestiona el ciclo de vida del entrenamiento a través de recetas basadas en configuración y proporciona sistemas para transmitir métricas de rendimiento en tiempo real a paneles de control externos.

    Combines multiple datasets with weighted sampling and formats them into chat templates for training.

    Python
    Ver en GitHub↗5,621
  • sshaoshuai/pcdetAvatar de sshaoshuai

    sshaoshuai/PCDet

    5,621Ver en GitHub↗

    PCDet es una caja de herramientas para la detección de objetos 3D mediante LiDAR y una librería de procesamiento de nubes de puntos construida sobre el framework de deep learning PyTorch. Proporciona un sistema para identificar y localizar objetos tridimensionales dentro de datos de nubes de puntos. El proyecto utiliza un patrón de separación de datos y modelo para desacoplar la lógica de carga del dataset del pipeline de detección principal. Cuenta con un pipeline de fusión multisensor que combina datos de múltiples sensores en una vista espacial compartida y un sistema de entrenamiento distribuido en GPU para escalar las cargas de trabajo a través de múltiples procesadores gráficos. El toolkit cubre varias áreas de capacidad, incluyendo la extracción de características basada en vóxeles y el análisis temporal de nubes de puntos mediante fusión de múltiples fotogramas. También incorpora optimizaciones de rendimiento para la intersección sobre unión 3D acelerada por GPU y la supresión de no máximos rotada.

    Supports the integration and training of custom point cloud datasets with specific annotations.

    Python
    Ver en GitHub↗5,621
  • tmelyralab/musetalkAvatar de TMElyralab

    TMElyralab/MuseTalk

    5,327Ver en GitHub↗

    MuseTalk is a deep learning lip synchronization system designed to align video facial movements with audio tracks for high-fidelity video dubbing. It functions as an engine that matches facial expressions to audio input in real-time, enabling the modification of a speaker's lip movements to match new audio sources across different languages. The project features a distributed GPU training pipeline and a multi-stage processing workflow for refining the visual accuracy of synthetic speech. It distinguishes itself through the use of region-specific face masking and mouth openness control, which

    Implements a multi-stage pipeline for extracting and aligning video frames to create structured audio-visual training datasets.

    Pythonlip-syncvirtualhumans
    Ver en GitHub↗5,327
  • openvla/openvlaAvatar de openvla

    openvla/openvla

    5,305Ver en GitHub↗

    OpenVLA is a vision-language-action model and framework designed for general-purpose robotic manipulation. It provides a robotic policy training framework and a control inference engine that map visual and textual inputs to robotic control actions, enabling zero-shot instruction following on hardware. The project includes a robotics dataset pipeline for standardizing diverse trajectory data and managing dataset mixtures. It supports large-scale model training through distributed GPU compute and sharded data parallelism, alongside parameter-efficient adaptation for fine-tuning models to new ta

    Implements weighted sampling from multiple robotics datasets to control training influence.

    Python
    Ver en GitHub↗5,305
  • internlm/xtunerAvatar de InternLM

    InternLM/xtuner

    5,150Ver en GitHub↗

    xtuner es un motor de entrenamiento integral para modelos de lenguaje grandes, que ofrece un toolkit para pre-entrenamiento, ajuste fino supervisado (fine-tuning) y la optimización de modelos multimodales de visión-lenguaje. Sirve como un acelerador de entrenamiento distribuido y un framework especializado para escalar modelos de Mezcla de Expertos (MoE) y alinear el comportamiento del modelo mediante aprendizaje por refuerzo a partir de retroalimentación humana (RLHF). El proyecto se distingue por optimizaciones avanzadas de memoria y cómputo, como el paralelismo de secuencia para ventanas de contexto ultra largas y el paralelismo de pipeline entrelazado para reducir el tiempo de inactividad de la GPU. Proporciona una suite dedicada para la optimización de preferencias, implementando técnicas como Group Relative Policy Optimization y Direct Preference Optimization para refinar las políticas del modelo y los sistemas de recompensa. Las áreas de capacidad cubren el entrenamiento distribuido de modelos a través de múltiples nodos, la preparación de datasets multimodales y la gestión del ajuste fino basado en adaptadores. El motor también incluye herramientas para la evaluación de modelos, fusión de pesos y exportación de parámetros entrenados a motores de inferencia. El entrenamiento se gestiona mediante archivos de configuración estandarizados y lanzadores distribuidos para asegurar resultados consistentes a través de clusters de computación.

    Supports pre-processing large datasets and saving them locally to eliminate repeated computation and timeouts.

    Pythonagentdeepseek-v3gpt-oss
    Ver en GitHub↗5,150
  • jcjohnson/fast-neural-styleAvatar de jcjohnson

    jcjohnson/fast-neural-style

    4,354Ver en GitHub↗

    Este proyecto es un framework de transferencia de estilo neuronal que proporciona un conjunto de herramientas de visión artificial para aplicar estilos artísticos a imágenes y videos. Funciona como un sistema para entrenar redes neuronales feedforward, un optimizador de estilo iterativo y un estilizador de video en tiempo real. El framework admite dos métodos principales de estilización: un modelo feedforward que aplica estilos en una sola pasada y un método de optimización iterativo que genera imágenes estilizadas minimizando la pérdida de contenido y estilo sin necesidad de un modelo preentrenado. También permite el procesamiento en tiempo real de transmisiones de cámaras web utilizando modelos entrenados. El proyecto cubre varias áreas de capacidad, incluyendo el procesamiento artístico de imágenes, el entrenamiento de modelos de transferencia de estilo mediante la minimización de la pérdida perceptual y utilidades de preparación de conjuntos de datos para formatear carpetas de imágenes en sets de entrenamiento compatibles.

    Provides pipelines for batching and processing image directories into formats suitable for neural network training.

    Lua
    Ver en GitHub↗4,354
  • xiaotudui/pytorch-tutorialAvatar de xiaotudui

    xiaotudui/pytorch-tutorial

    4,195Ver en GitHub↗

    Este proyecto es un tutorial de aprendizaje profundo (deep learning) en PyTorch y un recurso educativo. Proporciona un plan de estudios estructurado y guías paso a paso para diseñar, entrenar y validar redes neuronales desde cero. El recurso incluye guías específicas sobre la implementación de visión artificial, centrándose en la detección de objetos y la clasificación de imágenes mediante redes neuronales convolucionales. También proporciona instrucciones para optimizar el rendimiento del modelo mediante aceleración por hardware para reducir el tiempo de entrenamiento. Los materiales cubren el ciclo de vida completo del desarrollo de modelos, incluyendo operaciones con tensores, preparación de conjuntos de datos de imágenes y el uso de funciones de pérdida y optimizadores. También aborda la gestión del ciclo de vida del modelo mediante el guardado y recarga de pesos entrenados.

    Implements pipelines for batching and processing large-scale datasets for efficient model training.

    Pythonpytorchpytorch-tutorial
    Ver en GitHub↗4,195
  • codemayq/chinese-chatbot-corpusAvatar de codemayq

    codemayq/chinese-chatbot-corpus

    4,193Ver en GitHub↗

    Este proyecto proporciona una colección de conjuntos de datos conversacionales en chino procesados y flujos de trabajo de preprocesamiento diseñados para el entrenamiento y ajuste de instrucciones de modelos de lenguaje grandes (LLM). Funciona como un corpus de entrenamiento de texto en chino limpio y estandarizado, formateado como pares de consulta-respuesta. El repositorio incluye un pipeline de preprocesamiento y un agregador de conjuntos de datos que combinan múltiples fuentes de chat públicas en archivos unificados. Estas herramientas normalizan el texto convirtiendo caracteres chinos tradicionales a simplificados y transformando hilos de diálogo complejos en una secuencia estandarizada de turnos individuales. Los datos resultantes se exportan como archivos independientes separados por tabulaciones, asegurando un esquema consistente en fuentes dispares. Este flujo de trabajo de ingeniería se centra en eliminar inconsistencias de formato para preparar datos conversacionales sin procesar para tareas de aprendizaje automático.

    Processes large-scale conversational datasets into structured formats specifically for machine learning training.

    Python
    Ver en GitHub↗4,193
  • udacity/deep-learningAvatar de udacity

    udacity/deep-learning

    4,058Ver en GitHub↗

    Este proyecto es un curso educativo de aprendizaje profundo y una guía de implementación diseñada para construir y entrenar redes neuronales. Proporciona un plan de estudios para desarrollar modelos que resuelvan tareas de reconocimiento de patrones y generación. El material incluye módulos especializados para entrenamiento en visión artificial, procesamiento de lenguaje natural e IA generativa. Cubre la aplicación práctica del aprendizaje por transferencia (transfer learning) para clasificar nuevos datos y la creación de medios sintéticos. El proyecto abarca el diseño de arquitecturas de red, la construcción de pipelines de datos de aprendizaje automático y el uso de diagnósticos de rendimiento del modelo para identificar subajuste (underfitting) o sobreajuste (overfitting). El contenido se entrega a través de Jupyter Notebooks.

    Implements techniques for processing data in small groups to optimize memory and training speed.

    Jupyter Notebook
    Ver en GitHub↗4,058
Ant.12Siguiente
  1. Home
  2. Artificial Intelligence & ML
  3. Training Dataset Processing

Explorar subetiquetas

  • Custom Point Cloud Dataset TrainingTrain and evaluate 3D detection models on user-provided point cloud datasets with custom annotations. **Distinct from Training Dataset Processing:** Distinct from Training Dataset Processing: focuses on supporting custom point cloud datasets specifically, not general dataset batching.
  • Dataset BlendingTechniques for combining multiple data sources using weighted sampling for training and evaluation. **Distinct from Training Dataset Processing:** Specifically addresses the blending and weighted sampling of multiple datasets, not just general processing
  • Mini-Batch Processing1 sub-etiquetaTechniques for processing data in small groups to optimize memory and training speed. **Distinct from Training Dataset Processing:** Specific to the mini-batch gradient descent training process rather than general data pipelines
  • Waymo 3D Perception Dataset ProcessorsPreprocess, train, test, and evaluate models on the Waymo dataset with accelerated data handling and a mini version for quick iteration. **Distinct from Training Dataset Processing:** Distinct from Training Dataset Processing: specifically handles Waymo 3D perception dataset processing with accelerated handling.