awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

22 repository-uri

Awesome GitHub RepositoriesTraining Dataset Processing

Pipelines for batching and processing large-scale datasets specifically for model training.

Distinct from Cloud Batch Processing: The candidates are focused on audio, images, or generic cloud batching; this is specific to ML training data like JSONL

Explore 22 awesome GitHub repositories matching artificial intelligence & ml · Training Dataset Processing. Refine with filters or upvote what's useful.

Awesome Training Dataset Processing GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • aws/amazon-sagemaker-examplesAvatar aws

    aws/amazon-sagemaker-examples

    10,958Vezi pe GitHub↗

    This repository is a collection of Jupyter notebooks providing reference implementations and templates for building, training, and deploying machine learning models using Amazon SageMaker. It serves as an example library for implementing model architectures and automating the machine learning lifecycle. The library provides practical patterns for machine learning training, data engineering, and model deployment. It includes implementation guides for MLOps, including workflows for model monitoring, lineage tracking, and hyperparameter tuning. The examples cover a broad range of capabilities i

    Transforms and cleans large datasets using distributed computing tools to prepare high-quality features for training.

    Jupyter Notebookawsdata-sciencedeep-learning
    Vezi pe GitHub↗10,958
  • lyhue1991/eat_tensorflow2_in_30_daysAvatar lyhue1991

    lyhue1991/eat_tensorflow2_in_30_days

    9,933Vezi pe GitHub↗

    This project is a structured learning curriculum and technical reference for mastering deep learning with TensorFlow. It provides a comprehensive guide for building, training, and deploying neural networks, combining theoretical fundamentals with practical implementation examples. The repository distinguishes itself by covering the end-to-end machine learning workflow, from low-level tensor mathematics and linear algebra to the creation of complex model architectures. It includes specific guidance on developing data pipelines for diverse data types, such as images, text, and time-series seque

    Provides pipelines for batching and processing large-scale datasets specifically for model training.

    Pythontensorflowtensorflow-examplestensorflow-tutorial
    Vezi pe GitHub↗9,933
  • openpipe/artAvatar OpenPipe

    OpenPipe/ART

    8,630Vezi pe GitHub↗

    ART is a platform for agentic training, providing a reinforcement learning framework, training environment, and compute orchestrator. It enables the improvement of multi-step agent reasoning and tool usage through group relative policy optimization and a judge-based reward modeling system. The project features tools for model distillation to transfer capabilities from large teacher models to smaller architectures, as well as a system for capturing execution trajectories to generate synthetic training data. It supports specialized training workflows including supervised fine-tuning for baselin

    Processes high-volume training data from JSONL files using automated batching and learning rate schedules.

    Pythonagentagentic-aigrpo
    Vezi pe GitHub↗8,630
  • kulbear/deep-learning-courseraAvatar Kulbear

    Kulbear/deep-learning-coursera

    7,729Vezi pe GitHub↗

    This repository contains programming assignments and lecture notes from Andrew Ng's foundational deep learning course specialization on Coursera. The materials cover core neural network training techniques including optimization algorithms, normalization methods, regularization approaches, parameter initialization strategies, and learning rate scheduling to improve model convergence and generalization. The coursework explores design principles where successive neural network layers learn progressively more abstract feature representations from input data. It provides guidance on selecting ope

    Covers mini-batch gradient descent optimization for processing training data in small groups to speed up iterations.

    Jupyter Notebookcourseradeep-learning
    Vezi pe GitHub↗7,729
  • eleutherai/gpt-neoxAvatar EleutherAI

    EleutherAI/gpt-neox

    7,392Vezi pe GitHub↗

    gpt-neox is a distributed training system and framework for building large-scale autoregressive language models. It implements the transformer architecture and provides a toolkit for training models with billions of parameters by distributing weights across compute clusters. The framework distinguishes itself through extensive support for distributed model parallelism, including pipeline and sequence parallelism, to overcome single-device memory limits. It further supports sparse model architectures using a mixture of experts system with Sinkhorn-based routing. The project covers a broad ran

    Handles training, validation, and test data paths with support for weighted sampling from multiple sources.

    Pythondeepspeed-librarygpt-3language-model
    Vezi pe GitHub↗7,392
  • rasbt/python-machine-learning-book-2nd-editionAvatar rasbt

    rasbt/python-machine-learning-book-2nd-edition

    7,194Vezi pe GitHub↗

    This project is a machine learning educational resource and implementation guide for Python. It provides a collection of executable code and notebooks that demonstrate predictive modeling, data analysis workflows, and the implementation of various machine learning algorithms. The repository features practical examples of classification, regression, and clustering tasks using Scikit-Learn, alongside tutorials for building and training deep learning architectures with TensorFlow. These include implementations of convolutional and recurrent networks. The content covers a broad range of capabili

    Executes cleaning and dimensionality reduction workflows to prepare raw datasets for model training.

    Jupyter Notebookdata-sciencedeep-learningmachine-learning
    Vezi pe GitHub↗7,194
  • gojek/feastAvatar gojek

    gojek/feast

    7,095Vezi pe GitHub↗

    Feast is a machine learning feature store and MLOps data infrastructure layer. It provides a centralized system for managing and serving features across offline training and online production environments, utilizing an online feature serving layer for low-latency retrieval. The project centers on a feature registry that acts as a central catalog for defining, governing, and discovering feature services. It employs a unified data access layer to decouple feature retrieval from physical storage and includes a point-in-time data generator to create historically accurate training datasets that pr

    Generates point-in-time correct historical datasets for machine learning training while preventing data leakage.

    Python
    Vezi pe GitHub↗7,095
  • open-mmlab/mmdetection3dAvatar open-mmlab

    open-mmlab/mmdetection3d

    6,273Vezi pe GitHub↗

    MMDetection3D is an open-source toolbox for 3D perception, providing a unified framework for detecting and segmenting objects in three-dimensional environments. It supports a range of core tasks including monocular 3D object detection from single camera images, LiDAR-based 3D object detection from raw point clouds, and multi-modal fusion that combines camera images with LiDAR data. The toolbox also covers point cloud semantic segmentation, assigning class labels to every point in a scan for scene understanding. The project distinguishes itself through a config-driven pipeline that orchestrate

    Provides a pipeline for training 3D detection models on custom point cloud datasets with user-provided annotations.

    Python3d-object-detectionobject-detectionpoint-cloud
    Vezi pe GitHub↗6,273
  • lyhue1991/eat_pytorch_in_20_daysAvatar lyhue1991

    lyhue1991/eat_pytorch_in_20_days

    6,157Vezi pe GitHub↗

    Acest proiect este o serie de tutoriale de deep learning și un curriculum educațional conceput pentru a preda fundamentele PyTorch. Servește ca ghid de antrenament structurat pentru stăpânirea arhitecturii rețelelor neuronale, diferențierea automată și utilizarea tensorilor și a grafurilor de calcul dinamice. Curriculum-ul se concentrează pe implementări practice, ghidând în mod specific dezvoltarea sistemelor de recomandare, a modelelor de publicitate și a rețelelor de interese pentru a prezice preferințele utilizatorilor. Oferă, de asemenea, conținut instrucțional pentru prognoza seriilor temporale și procesarea datelor secvențiale. Materialul acoperă o gamă largă de capabilități de deep learning, inclusiv construcția modelelor pentru clasificarea imaginilor și a textului, precum și a datelor structurate. Încorporează fluxuri de lucru pentru accelerarea GPU, vizualizarea metricilor de antrenament și crearea de interfețe bazate pe web pentru a testa predicțiile modelului. Proiectul este livrat sub formă de colecție de Jupyter Notebooks.

    Teaches how to organize raw datasets into shuffled mini-batches for efficient training.

    Jupyter Notebookdeep-learningpytorch
    Vezi pe GitHub↗6,157
  • online-ml/riverAvatar online-ml

    online-ml/river

    5,853Vezi pe GitHub↗

    River este un framework Python pentru online machine learning, conceput pentru a antrena și evalua modele pe date de tip streaming. Permite învățarea incrementală prin actualizarea parametrilor modelului la fiecare observație, eliminând nevoia de a stoca seturi de date complete de antrenament în memorie. Biblioteca se distinge printr-un sistem dedicat de detectare a concept drift-ului, care monitorizează schimbările în distribuțiile datelor pentru a declanșa adaptarea modelului. De asemenea, oferă un framework de validare progresivă care simulează deployment-ul în timp real prin testarea modelelor pe eșantioane înainte de a le utiliza pentru antrenament. Sistemul acoperă o gamă largă de capabilități de streaming, inclusiv feature engineering în timp real, prognoza seriilor temporale și detectarea anomaliilor online. Suportă învățarea nesupervizată prin clustering incremental și arbori de decizie, precum și agregarea de tip ensemble și politici de tip bandit pentru selecția modelelor. Proiectul include utilitare pentru ingestia de date de streaming din surse precum fișiere CSV și API-uri, precum și instrumente pentru calcularea statisticilor în mișcare și a schițelor de date eficiente din punct de vedere al memoriei.

    Handles small groups of observations using data frames to balance batch efficiency with online learning requirements.

    Python
    Vezi pe GitHub↗5,853
  • meta-pytorch/torchtuneAvatar meta-pytorch

    meta-pytorch/torchtune

    5,774Vezi pe GitHub↗

    Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a config-driven system for instantiating components, orchestrating distributed training, and managing parameter-efficient fine-tuning with quantization support, all through YAML-based configurations and command-line overrides. The library distinguishes itself through its comprehensive post-training workflow orchestration, combining supervised fine-tuning, preference optimization (DPO, PPO, GRPO), knowledge distillation, and quantization-aware training in a single configurable pip

    Supports fine-tuning on custom instruct, chat, and preference datasets with full-parameter or LoRA methods.

    Python
    Vezi pe GitHub↗5,774
  • huggingface/alignment-handbookAvatar huggingface

    huggingface/alignment-handbook

    5,621Vezi pe GitHub↗

    Acest proiect este un framework de aliniere și o suită de pipeline-uri pentru antrenarea modelelor de limbaj folosind fine-tuning supervizat și optimizarea preferințelor. Oferă instrumente pentru executarea antrenării distribuite la scară largă pe mai multe GPU-uri și noduri de calcul, alături de un sistem pentru măsurarea utilității modelului și a calității dialogului prin benchmark-uri single-turn și multi-turn. Framework-ul include instrumente specializate pentru optimizarea directă a preferințelor (DPO) pentru a rafina comportamentul modelului folosind date pereche, fără a fi nevoie de un model de recompensă separat. De asemenea, suportă alinierea prin AI constituțional și antrenarea modelelor de recompensă pentru a clasifica și puncta răspunsurile pe baza criteriilor de preferință. Proiectul acoperă capabilități mai largi pentru amestecarea seturilor de date, fine-tuning eficient din punct de vedere al parametrilor prin adaptare low-rank (LoRA) și optimizarea prin eșantionare de respingere. Gestionează ciclul de viață al antrenării prin rețete bazate pe configurație și oferă sisteme pentru streaming-ul metricilor de performanță în timp real către dashboard-uri externe.

    Combines multiple datasets with weighted sampling and formats them into chat templates for training.

    Python
    Vezi pe GitHub↗5,621
  • sshaoshuai/pcdetAvatar sshaoshuai

    sshaoshuai/PCDet

    5,621Vezi pe GitHub↗

    PCDet este un set de instrumente pentru detecția obiectelor 3D din date LiDAR și o bibliotecă de procesare a norilor de puncte construită pe framework-ul de deep learning PyTorch. Oferă un sistem pentru identificarea și localizarea obiectelor tridimensionale în datele de tip nor de puncte. Proiectul utilizează un model de separare date-model pentru a decupla logica de încărcare a seturilor de date de pipeline-ul principal de detecție. Dispune de un pipeline de fuziune multi-senzor care combină datele de la mai mulți senzori într-o vedere spațială comună și un sistem de antrenare distribuită pe GPU pentru a scala sarcinile de lucru pe mai multe procesoare grafice. Toolkit-ul acoperă mai multe domenii de capabilități, inclusiv extracția de caracteristici bazată pe voxeli și analiza temporală a norilor de puncte prin fuziunea multi-cadru. De asemenea, încorporează optimizări de performanță pentru intersecția peste reuniune (IoU) 3D accelerată pe GPU și suprimarea non-maxime rotite.

    Supports the integration and training of custom point cloud datasets with specific annotations.

    Python
    Vezi pe GitHub↗5,621
  • tmelyralab/musetalkAvatar TMElyralab

    TMElyralab/MuseTalk

    5,327Vezi pe GitHub↗

    MuseTalk is a deep learning lip synchronization system designed to align video facial movements with audio tracks for high-fidelity video dubbing. It functions as an engine that matches facial expressions to audio input in real-time, enabling the modification of a speaker's lip movements to match new audio sources across different languages. The project features a distributed GPU training pipeline and a multi-stage processing workflow for refining the visual accuracy of synthetic speech. It distinguishes itself through the use of region-specific face masking and mouth openness control, which

    Implements a multi-stage pipeline for extracting and aligning video frames to create structured audio-visual training datasets.

    Pythonlip-syncvirtualhumans
    Vezi pe GitHub↗5,327
  • openvla/openvlaAvatar openvla

    openvla/openvla

    5,305Vezi pe GitHub↗

    OpenVLA is a vision-language-action model and framework designed for general-purpose robotic manipulation. It provides a robotic policy training framework and a control inference engine that map visual and textual inputs to robotic control actions, enabling zero-shot instruction following on hardware. The project includes a robotics dataset pipeline for standardizing diverse trajectory data and managing dataset mixtures. It supports large-scale model training through distributed GPU compute and sharded data parallelism, alongside parameter-efficient adaptation for fine-tuning models to new ta

    Implements weighted sampling from multiple robotics datasets to control training influence.

    Python
    Vezi pe GitHub↗5,305
  • internlm/xtunerAvatar InternLM

    InternLM/xtuner

    5,150Vezi pe GitHub↗

    xtuner este un motor de antrenare cuprinzător pentru modele de limbaj mari (LLM), oferind un toolkit pentru pre-antrenare, fine-tuning supervizat și optimizarea modelelor multimodale vision-language. Servește ca un accelerator de antrenare distribuită și un framework specializat pentru scalarea modelelor Mixture-of-Experts și alinierea comportamentului modelului prin învățare prin consolidare din feedback uman (RLHF). Proiectul se distinge prin optimizări avansate de memorie și calcul, cum ar fi paralelismul de secvență pentru ferestre de context ultra-lungi și paralelismul de pipeline intercalat pentru a reduce timpul de inactivitate al GPU-ului. Oferă o suită dedicată pentru optimizarea preferințelor, implementând tehnici precum Group Relative Policy Optimization și Direct Preference Optimization pentru a rafina politicile modelului și sistemele de recompensă. Zonele largi de capabilități acoperă antrenarea distribuită a modelelor pe mai multe noduri, pregătirea seturilor de date multimodale și gestionarea fine-tuning-ului bazat pe adaptoare. Motorul include, de asemenea, instrumente pentru evaluarea modelului, fuziunea ponderilor (weight merging) și exportul parametrilor antrenați către motoarele de inferență. Antrenarea este gestionată prin fișiere de configurare standardizate și launchere distribuite pentru a asigura rezultate consistente pe clusterele de calcul.

    Supports pre-processing large datasets and saving them locally to eliminate repeated computation and timeouts.

    Pythonagentdeepseek-v3gpt-oss
    Vezi pe GitHub↗5,150
  • jcjohnson/fast-neural-styleAvatar jcjohnson

    jcjohnson/fast-neural-style

    4,354Vezi pe GitHub↗

    Acest proiect este un framework de transfer de stil neuronal care oferă o suită de instrumente de computer vision pentru aplicarea stilurilor artistice pe imagini și video. Funcționează ca un sistem pentru antrenarea rețelelor neuronale feedforward, un optimizator de stil iterativ și un stilizator video în timp real. Framework-ul suportă două metode principale de stilizare: un model feedforward care aplică stiluri într-o singură trecere și o metodă de optimizare iterativă care generează imagini stilizate prin minimizarea pierderii de conținut și stil fără un model pre-antrenat. De asemenea, permite procesarea în timp real a fluxurilor live de la webcam folosind modele antrenate. Proiectul acoperă mai multe arii de capabilități, inclusiv procesarea artistică a imaginilor, antrenarea modelelor de transfer de stil prin minimizarea pierderii perceptuale și utilitare de pregătire a seturilor de date pentru a formata folderele de imagini în seturi de antrenament compatibile.

    Provides pipelines for batching and processing image directories into formats suitable for neural network training.

    Lua
    Vezi pe GitHub↗4,354
  • xiaotudui/pytorch-tutorialAvatar xiaotudui

    xiaotudui/pytorch-tutorial

    4,195Vezi pe GitHub↗

    Acest proiect este un tutorial de deep learning în PyTorch și o resursă educațională. Oferă un curriculum structurat și ghiduri pas cu pas pentru proiectarea, antrenarea și validarea rețelelor neuronale de la zero. Resursa include ghiduri specifice privind implementarea viziunii computerizate, concentrându-se pe detectarea obiectelor și clasificarea imaginilor folosind rețele neuronale convoluționale. De asemenea, oferă instrucțiuni pentru optimizarea performanței modelului prin accelerare hardware pentru a reduce timpul de antrenare. Materialele acoperă întregul ciclu de viață al dezvoltării modelului, inclusiv operațiunile cu tensori, pregătirea seturilor de date de imagini și utilizarea funcțiilor de pierdere (loss functions) și a optimizatoarelor. De asemenea, abordează gestionarea ciclului de viață al modelului prin salvarea și reîncărcarea ponderilor antrenate.

    Implements pipelines for batching and processing large-scale datasets for efficient model training.

    Pythonpytorchpytorch-tutorial
    Vezi pe GitHub↗4,195
  • codemayq/chinese-chatbot-corpusAvatar codemayq

    codemayq/chinese-chatbot-corpus

    4,193Vezi pe GitHub↗

    Acest proiect oferă o colecție de seturi de date conversaționale în limba chineză procesate și fluxuri de lucru de preprocesare concepute pentru antrenarea și reglarea instrucțiunilor (instruction tuning) a modelelor de limbaj mari (LLM). Funcționează ca un corpus de antrenament de text chinezesc curățat și standardizat, formatat ca perechi interogare-răspuns. Repository-ul include un pipeline de preprocesare și un agregator de seturi de date care combină mai multe surse de chat publice în fișiere unificate. Aceste instrumente normalizează textul prin convertirea caracterelor chinezești tradiționale în caractere simplificate și transformarea firelor de dialog complexe într-o secvență standardizată de schimburi unice. Datele rezultate sunt exportate ca fișiere independente separate prin tab-uri, asigurând o schemă consistentă între surse disparate. Acest flux de lucru de inginerie se concentrează pe eliminarea inconsecvențelor de formatare pentru a pregăti datele conversaționale brute pentru sarcinile de machine learning.

    Processes large-scale conversational datasets into structured formats specifically for machine learning training.

    Python
    Vezi pe GitHub↗4,193
  • udacity/deep-learningAvatar udacity

    udacity/deep-learning

    4,058Vezi pe GitHub↗

    Acest proiect este un curs educațional de deep learning și un ghid de implementare conceput pentru construirea și antrenarea rețelelor neuronale. Oferă un curriculum pentru dezvoltarea modelelor care rezolvă sarcini de recunoaștere a modelelor și sarcini generative. Materialul include module specializate pentru antrenarea în computer vision, procesarea limbajului natural și AI generativ. Acoperă aplicarea practică a transfer learning-ului pentru clasificarea datelor noi și crearea de conținut media sintetic. Proiectul cuprinde designul arhitecturilor de rețea, construcția pipeline-urilor de date pentru machine learning și utilizarea diagnosticelor de performanță a modelelor pentru a identifica sub-ajustarea (underfitting) sau supra-ajustarea (overfitting). Conținutul este livrat prin Jupyter Notebooks.

    Implements techniques for processing data in small groups to optimize memory and training speed.

    Jupyter Notebook
    Vezi pe GitHub↗4,058
Înapoi12Înainte
  1. Home
  2. Artificial Intelligence & ML
  3. Training Dataset Processing

Explorează sub-etichetele

  • Custom Point Cloud Dataset TrainingTrain and evaluate 3D detection models on user-provided point cloud datasets with custom annotations. **Distinct from Training Dataset Processing:** Distinct from Training Dataset Processing: focuses on supporting custom point cloud datasets specifically, not general dataset batching.
  • Dataset BlendingTechniques for combining multiple data sources using weighted sampling for training and evaluation. **Distinct from Training Dataset Processing:** Specifically addresses the blending and weighted sampling of multiple datasets, not just general processing
  • Mini-Batch Processing1 sub-tagTechniques for processing data in small groups to optimize memory and training speed. **Distinct from Training Dataset Processing:** Specific to the mini-batch gradient descent training process rather than general data pipelines
  • Waymo 3D Perception Dataset ProcessorsPreprocess, train, test, and evaluate models on the Waymo dataset with accelerated data handling and a mini version for quick iteration. **Distinct from Training Dataset Processing:** Distinct from Training Dataset Processing: specifically handles Waymo 3D perception dataset processing with accelerated handling.