awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

22 dépôts

Awesome GitHub RepositoriesTraining Dataset Processing

Pipelines for batching and processing large-scale datasets specifically for model training.

Distinct from Cloud Batch Processing: The candidates are focused on audio, images, or generic cloud batching; this is specific to ML training data like JSONL

Explore 22 awesome GitHub repositories matching artificial intelligence & ml · Training Dataset Processing. Refine with filters or upvote what's useful.

Awesome Training Dataset Processing GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • aws/amazon-sagemaker-examplesAvatar de aws

    aws/amazon-sagemaker-examples

    10,958Voir sur GitHub↗

    This repository is a collection of Jupyter notebooks providing reference implementations and templates for building, training, and deploying machine learning models using Amazon SageMaker. It serves as an example library for implementing model architectures and automating the machine learning lifecycle. The library provides practical patterns for machine learning training, data engineering, and model deployment. It includes implementation guides for MLOps, including workflows for model monitoring, lineage tracking, and hyperparameter tuning. The examples cover a broad range of capabilities i

    Transforms and cleans large datasets using distributed computing tools to prepare high-quality features for training.

    Jupyter Notebookawsdata-sciencedeep-learning
    Voir sur GitHub↗10,958
  • lyhue1991/eat_tensorflow2_in_30_daysAvatar de lyhue1991

    lyhue1991/eat_tensorflow2_in_30_days

    9,933Voir sur GitHub↗

    This project is a structured learning curriculum and technical reference for mastering deep learning with TensorFlow. It provides a comprehensive guide for building, training, and deploying neural networks, combining theoretical fundamentals with practical implementation examples. The repository distinguishes itself by covering the end-to-end machine learning workflow, from low-level tensor mathematics and linear algebra to the creation of complex model architectures. It includes specific guidance on developing data pipelines for diverse data types, such as images, text, and time-series seque

    Provides pipelines for batching and processing large-scale datasets specifically for model training.

    Pythontensorflowtensorflow-examplestensorflow-tutorial
    Voir sur GitHub↗9,933
  • openpipe/artAvatar de OpenPipe

    OpenPipe/ART

    8,630Voir sur GitHub↗

    ART is a platform for agentic training, providing a reinforcement learning framework, training environment, and compute orchestrator. It enables the improvement of multi-step agent reasoning and tool usage through group relative policy optimization and a judge-based reward modeling system. The project features tools for model distillation to transfer capabilities from large teacher models to smaller architectures, as well as a system for capturing execution trajectories to generate synthetic training data. It supports specialized training workflows including supervised fine-tuning for baselin

    Processes high-volume training data from JSONL files using automated batching and learning rate schedules.

    Pythonagentagentic-aigrpo
    Voir sur GitHub↗8,630
  • kulbear/deep-learning-courseraAvatar de Kulbear

    Kulbear/deep-learning-coursera

    7,729Voir sur GitHub↗

    This repository contains programming assignments and lecture notes from Andrew Ng's foundational deep learning course specialization on Coursera. The materials cover core neural network training techniques including optimization algorithms, normalization methods, regularization approaches, parameter initialization strategies, and learning rate scheduling to improve model convergence and generalization. The coursework explores design principles where successive neural network layers learn progressively more abstract feature representations from input data. It provides guidance on selecting ope

    Covers mini-batch gradient descent optimization for processing training data in small groups to speed up iterations.

    Jupyter Notebookcourseradeep-learning
    Voir sur GitHub↗7,729
  • eleutherai/gpt-neoxAvatar de EleutherAI

    EleutherAI/gpt-neox

    7,392Voir sur GitHub↗

    gpt-neox is a distributed training system and framework for building large-scale autoregressive language models. It implements the transformer architecture and provides a toolkit for training models with billions of parameters by distributing weights across compute clusters. The framework distinguishes itself through extensive support for distributed model parallelism, including pipeline and sequence parallelism, to overcome single-device memory limits. It further supports sparse model architectures using a mixture of experts system with Sinkhorn-based routing. The project covers a broad ran

    Handles training, validation, and test data paths with support for weighted sampling from multiple sources.

    Pythondeepspeed-librarygpt-3language-model
    Voir sur GitHub↗7,392
  • rasbt/python-machine-learning-book-2nd-editionAvatar de rasbt

    rasbt/python-machine-learning-book-2nd-edition

    7,194Voir sur GitHub↗

    This project is a machine learning educational resource and implementation guide for Python. It provides a collection of executable code and notebooks that demonstrate predictive modeling, data analysis workflows, and the implementation of various machine learning algorithms. The repository features practical examples of classification, regression, and clustering tasks using Scikit-Learn, alongside tutorials for building and training deep learning architectures with TensorFlow. These include implementations of convolutional and recurrent networks. The content covers a broad range of capabili

    Executes cleaning and dimensionality reduction workflows to prepare raw datasets for model training.

    Jupyter Notebookdata-sciencedeep-learningmachine-learning
    Voir sur GitHub↗7,194
  • gojek/feastAvatar de gojek

    gojek/feast

    7,095Voir sur GitHub↗

    Feast is a machine learning feature store and MLOps data infrastructure layer. It provides a centralized system for managing and serving features across offline training and online production environments, utilizing an online feature serving layer for low-latency retrieval. The project centers on a feature registry that acts as a central catalog for defining, governing, and discovering feature services. It employs a unified data access layer to decouple feature retrieval from physical storage and includes a point-in-time data generator to create historically accurate training datasets that pr

    Generates point-in-time correct historical datasets for machine learning training while preventing data leakage.

    Python
    Voir sur GitHub↗7,095
  • open-mmlab/mmdetection3dAvatar de open-mmlab

    open-mmlab/mmdetection3d

    6,273Voir sur GitHub↗

    MMDetection3D is an open-source toolbox for 3D perception, providing a unified framework for detecting and segmenting objects in three-dimensional environments. It supports a range of core tasks including monocular 3D object detection from single camera images, LiDAR-based 3D object detection from raw point clouds, and multi-modal fusion that combines camera images with LiDAR data. The toolbox also covers point cloud semantic segmentation, assigning class labels to every point in a scan for scene understanding. The project distinguishes itself through a config-driven pipeline that orchestrate

    Provides a pipeline for training 3D detection models on custom point cloud datasets with user-provided annotations.

    Python3d-object-detectionobject-detectionpoint-cloud
    Voir sur GitHub↗6,273
  • lyhue1991/eat_pytorch_in_20_daysAvatar de lyhue1991

    lyhue1991/eat_pytorch_in_20_days

    6,157Voir sur GitHub↗

    Ce projet est une série de tutoriels de deep learning et un programme éducatif conçu pour enseigner les fondamentaux de PyTorch. Il sert de guide de formation structuré pour maîtriser l'architecture des réseaux de neurones, la différenciation automatique et l'utilisation des tenseurs et des graphes de calcul dynamiques. Le programme se concentre sur des implémentations pratiques, guidant spécifiquement le développement de systèmes de recommandation, de modèles publicitaires et de réseaux d'intérêt pour prédire les préférences des utilisateurs. Il fournit également un contenu pédagogique pour la prévision de séries temporelles et le traitement de données séquentielles. Le matériel couvre un large éventail de capacités de deep learning, incluant la construction de modèles pour la classification d'images et de texte ainsi que pour les données structurées. Il intègre des workflows pour l'accélération GPU, la visualisation des métriques d'entraînement et la création d'interfaces web pour tester les prédictions des modèles. Le projet est livré sous forme de collection de Jupyter Notebooks.

    Teaches how to organize raw datasets into shuffled mini-batches for efficient training.

    Jupyter Notebookdeep-learningpytorch
    Voir sur GitHub↗6,157
  • online-ml/riverAvatar de online-ml

    online-ml/river

    5,853Voir sur GitHub↗

    River est un framework Python pour le machine learning en ligne (online machine learning), conçu pour entraîner et évaluer des modèles sur des données en streaming. Il permet un apprentissage incrémental en mettant à jour les paramètres du modèle une observation à la fois, éliminant le besoin de stocker des jeux de données d'entraînement complets en mémoire. La bibliothèque se distingue par un système dédié de détection de dérive de concept (concept drift) qui surveille les changements dans les distributions de données pour déclencher l'adaptation du modèle. Elle fournit également un framework de validation progressive qui simule un déploiement en temps réel en testant les modèles sur des échantillons avant de les utiliser pour l'entraînement. Le système couvre un large éventail de capacités de streaming, incluant l'ingénierie de caractéristiques (feature engineering) en temps réel, la prévision de séries temporelles et la détection d'anomalies en ligne. Il prend en charge l'apprentissage non supervisé via le clustering incrémental et les arbres de décision, ainsi que l'agrégation ensembliste et les politiques de bandit pour la sélection de modèles. Le projet inclut des utilitaires pour l'ingestion de données en streaming à partir de sources telles que des fichiers CSV et des API, ainsi que des outils pour calculer des statistiques courantes et des esquisses de données (data sketches) économes en mémoire.

    Handles small groups of observations using data frames to balance batch efficiency with online learning requirements.

    Python
    Voir sur GitHub↗5,853
  • meta-pytorch/torchtuneAvatar de meta-pytorch

    meta-pytorch/torchtune

    5,774Voir sur GitHub↗

    Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a config-driven system for instantiating components, orchestrating distributed training, and managing parameter-efficient fine-tuning with quantization support, all through YAML-based configurations and command-line overrides. The library distinguishes itself through its comprehensive post-training workflow orchestration, combining supervised fine-tuning, preference optimization (DPO, PPO, GRPO), knowledge distillation, and quantization-aware training in a single configurable pip

    Supports fine-tuning on custom instruct, chat, and preference datasets with full-parameter or LoRA methods.

    Python
    Voir sur GitHub↗5,774
  • huggingface/alignment-handbookAvatar de huggingface

    huggingface/alignment-handbook

    5,621Voir sur GitHub↗

    Ce projet est un framework d'alignement et une suite de pipelines pour l'entraînement de modèles de langage via le fine-tuning supervisé et l'optimisation par préférence. Il fournit des outils pour exécuter un entraînement distribué à grande échelle sur plusieurs GPU et nœuds de calcul, ainsi qu'un système pour mesurer l'utilité du modèle et la qualité des dialogues via des benchmarks mono-tour et multi-tours. Le framework inclut des outils spécialisés pour l'optimisation directe par préférence (DPO) afin d'affiner le comportement du modèle en utilisant des données appariées sans nécessiter de modèle de récompense séparé. Il prend également en charge l'alignement par IA constitutionnelle et l'entraînement de modèles de récompense pour classer et noter les réponses selon des critères de préférence. Le projet couvre des capacités plus larges pour le mélange de jeux de données, le fine-tuning efficace en paramètres via l'adaptation de bas rang (LoRA), et l'optimisation par échantillonnage par rejet. Il gère le cycle de vie de l'entraînement via des recettes basées sur la configuration et fournit des systèmes pour diffuser des métriques de performance en temps réel vers des tableaux de bord externes.

    Combines multiple datasets with weighted sampling and formats them into chat templates for training.

    Python
    Voir sur GitHub↗5,621
  • sshaoshuai/pcdetAvatar de sshaoshuai

    sshaoshuai/PCDet

    5,621Voir sur GitHub↗

    PCDet est une boîte à outils de détection d'objets 3D par LiDAR et une bibliothèque de traitement de nuages de points construite sur le framework de deep learning PyTorch. Il fournit un système pour identifier et localiser des objets tridimensionnels au sein de données de nuages de points. Le projet utilise un modèle de séparation données-modèle pour découpler la logique de chargement des jeux de données du pipeline de détection principal. Il dispose d'un pipeline de fusion multi-capteurs qui combine les données de plusieurs capteurs dans une vue spatiale partagée, ainsi qu'un système d'entraînement GPU distribué pour mettre à l'échelle les charges de travail sur plusieurs processeurs graphiques. La boîte à outils couvre plusieurs domaines de capacités, notamment l'extraction de caractéristiques basée sur les voxels et l'analyse temporelle de nuages de points via la fusion multi-images. Elle intègre également des optimisations de performance pour l'intersection sur union 3D accélérée par GPU et la suppression des non-maxima orientée.

    Supports the integration and training of custom point cloud datasets with specific annotations.

    Python
    Voir sur GitHub↗5,621
  • tmelyralab/musetalkAvatar de TMElyralab

    TMElyralab/MuseTalk

    5,327Voir sur GitHub↗

    MuseTalk is a deep learning lip synchronization system designed to align video facial movements with audio tracks for high-fidelity video dubbing. It functions as an engine that matches facial expressions to audio input in real-time, enabling the modification of a speaker's lip movements to match new audio sources across different languages. The project features a distributed GPU training pipeline and a multi-stage processing workflow for refining the visual accuracy of synthetic speech. It distinguishes itself through the use of region-specific face masking and mouth openness control, which

    Implements a multi-stage pipeline for extracting and aligning video frames to create structured audio-visual training datasets.

    Pythonlip-syncvirtualhumans
    Voir sur GitHub↗5,327
  • openvla/openvlaAvatar de openvla

    openvla/openvla

    5,305Voir sur GitHub↗

    OpenVLA is a vision-language-action model and framework designed for general-purpose robotic manipulation. It provides a robotic policy training framework and a control inference engine that map visual and textual inputs to robotic control actions, enabling zero-shot instruction following on hardware. The project includes a robotics dataset pipeline for standardizing diverse trajectory data and managing dataset mixtures. It supports large-scale model training through distributed GPU compute and sharded data parallelism, alongside parameter-efficient adaptation for fine-tuning models to new ta

    Implements weighted sampling from multiple robotics datasets to control training influence.

    Python
    Voir sur GitHub↗5,305
  • internlm/xtunerAvatar de InternLM

    InternLM/xtuner

    5,150Voir sur GitHub↗

    xtuner est un moteur d'entraînement complet pour les grands modèles de langage, offrant une boîte à outils pour le pré-entraînement, le fine-tuning supervisé et l'optimisation de modèles multimodaux vision-langage. Il sert d'accélérateur d'entraînement distribué et de framework spécialisé pour mettre à l'échelle des modèles Mixture-of-Experts et aligner le comportement du modèle via l'apprentissage par renforcement à partir de feedback humain (RLHF). Le projet se distingue par des optimisations avancées de mémoire et de calcul, telles que le parallélisme de séquence pour des fenêtres de contexte ultra-longues et le parallélisme de pipeline entrelacé pour réduire le temps d'inactivité du GPU. Il fournit une suite dédiée pour l'optimisation des préférences, implémentant des techniques comme Group Relative Policy Optimization et Direct Preference Optimization pour affiner les politiques du modèle et les systèmes de récompense. Les domaines de capacités étendus couvrent l'entraînement de modèle distribué sur plusieurs nœuds, la préparation de jeux de données multimodaux et la gestion du fine-tuning basé sur des adaptateurs. Le moteur inclut également des outils pour l'évaluation de modèle, la fusion de poids et l'exportation des paramètres entraînés vers des moteurs d'inférence. L'entraînement est géré via des fichiers de configuration standardisés et des lanceurs distribués pour assurer des résultats cohérents à travers les clusters de calcul.

    Supports pre-processing large datasets and saving them locally to eliminate repeated computation and timeouts.

    Pythonagentdeepseek-v3gpt-oss
    Voir sur GitHub↗5,150
  • jcjohnson/fast-neural-styleAvatar de jcjohnson

    jcjohnson/fast-neural-style

    4,354Voir sur GitHub↗

    Ce projet est un framework de transfert de style neuronal qui fournit une suite d'outils de vision par ordinateur pour appliquer des styles artistiques à des images et des vidéos. Il fonctionne comme un système d'entraînement de réseaux de neurones feedforward, un optimiseur de style itératif et un styliseur vidéo en temps réel. Le framework prend en charge deux méthodes principales de stylisation : un modèle feedforward qui applique les styles en un seul passage et une méthode d'optimisation itérative qui génère des images stylisées en minimisant la perte de contenu et de style sans modèle pré-entraîné. Il permet également le traitement en temps réel de flux de webcam en direct à l'aide de modèles entraînés. Le projet couvre plusieurs domaines de capacités, notamment le traitement d'images artistiques, l'entraînement de modèles de transfert de style par minimisation de perte perceptuelle, et des utilitaires de préparation de jeux de données pour formater des dossiers d'images en ensembles d'entraînement compatibles.

    Provides pipelines for batching and processing image directories into formats suitable for neural network training.

    Lua
    Voir sur GitHub↗4,354
  • xiaotudui/pytorch-tutorialAvatar de xiaotudui

    xiaotudui/pytorch-tutorial

    4,195Voir sur GitHub↗

    Ce projet est un tutoriel de deep learning PyTorch et une ressource pédagogique. Il fournit un programme structuré et des guides étape par étape pour concevoir, entraîner et valider des réseaux de neurones à partir de zéro. La ressource inclut des guides spécifiques sur l'implémentation de la vision par ordinateur, se concentrant sur la détection d'objets et la classification d'images à l'aide de réseaux de neurones convolutifs. Elle fournit également des instructions pour optimiser les performances des modèles via l'accélération matérielle afin de réduire le temps d'entraînement. Les supports couvrent l'intégralité du cycle de vie de développement des modèles, incluant les opérations sur tenseurs, la préparation des jeux de données d'images, ainsi que l'utilisation de fonctions de perte et d'optimiseurs. Il aborde également la gestion du cycle de vie des modèles via la sauvegarde et le rechargement des poids entraînés.

    Implements pipelines for batching and processing large-scale datasets for efficient model training.

    Pythonpytorchpytorch-tutorial
    Voir sur GitHub↗4,195
  • codemayq/chinese-chatbot-corpusAvatar de codemayq

    codemayq/chinese-chatbot-corpus

    4,193Voir sur GitHub↗

    Ce projet fournit une collection de jeux de données conversationnels chinois traités et des flux de travail de prétraitement conçus pour l'entraînement et le réglage d'instructions de grands modèles de langage. Il fonctionne comme un corpus d'entraînement de texte chinois nettoyé et standardisé, formaté sous forme de paires requête-réponse. Le dépôt inclut un pipeline de prétraitement et un agrégateur de jeux de données qui combinent plusieurs sources de chat publiques en fichiers unifiés. Ces outils normalisent le texte en convertissant les caractères chinois traditionnels en caractères simplifiés et en transformant les fils de discussion complexes en une séquence standardisée de tours uniques. Les données résultantes sont exportées sous forme de fichiers séparés par des tabulations, assurant un schéma cohérent à travers des sources disparates. Ce flux de travail d'ingénierie se concentre sur la suppression des incohérences de formatage pour préparer les données conversationnelles brutes aux tâches de machine learning.

    Processes large-scale conversational datasets into structured formats specifically for machine learning training.

    Python
    Voir sur GitHub↗4,193
  • udacity/deep-learningAvatar de udacity

    udacity/deep-learning

    4,058Voir sur GitHub↗

    Ce projet est un cours éducatif sur le deep learning et un guide d'implémentation conçu pour construire et entraîner des réseaux de neurones. Il fournit un programme pour développer des modèles qui résolvent des tâches de reconnaissance de formes et de génération. Le matériel inclut des modules spécialisés pour l'entraînement en vision par ordinateur, le traitement du langage naturel et l'IA générative. Il couvre l'application pratique du transfer learning pour classer de nouvelles données et la création de médias synthétiques. Le projet englobe la conception d'architectures de réseaux, la construction de pipelines de données pour le machine learning et l'utilisation de diagnostics de performance des modèles pour identifier le sous-apprentissage ou le sur-apprentissage. Le contenu est délivré via des Jupyter Notebooks.

    Implements techniques for processing data in small groups to optimize memory and training speed.

    Jupyter Notebook
    Voir sur GitHub↗4,058
Préc.12Suivant
  1. Home
  2. Artificial Intelligence & ML
  3. Training Dataset Processing

Explorer les sous-tags

  • Custom Point Cloud Dataset TrainingTrain and evaluate 3D detection models on user-provided point cloud datasets with custom annotations. **Distinct from Training Dataset Processing:** Distinct from Training Dataset Processing: focuses on supporting custom point cloud datasets specifically, not general dataset batching.
  • Dataset BlendingTechniques for combining multiple data sources using weighted sampling for training and evaluation. **Distinct from Training Dataset Processing:** Specifically addresses the blending and weighted sampling of multiple datasets, not just general processing
  • Mini-Batch Processing1 sous-tagTechniques for processing data in small groups to optimize memory and training speed. **Distinct from Training Dataset Processing:** Specific to the mini-batch gradient descent training process rather than general data pipelines
  • Waymo 3D Perception Dataset ProcessorsPreprocess, train, test, and evaluate models on the Waymo dataset with accelerated data handling and a mini version for quick iteration. **Distinct from Training Dataset Processing:** Distinct from Training Dataset Processing: specifically handles Waymo 3D perception dataset processing with accelerated handling.