4 dépôts
Techniques that increase training throughput through packing, compilation, and memory reduction strategies.
Distinct from Training Memory Optimizers: Distinct from Training Memory Optimizers: focuses on throughput improvements (packing, compilation) in addition to memory reduction, not just memory alone.
Explore 4 awesome GitHub repositories matching data & databases · Training Speed Optimizations. Refine with filters or upvote what's useful.
Ce projet est un framework de détection d'objets PyTorch qui implémente l'architecture Faster R-CNN. Il sert de modèle de vision pour prédire des boîtes englobantes précises autour de multiples objets dans des images et des flux vidéo en direct. Le système est optimisé pour l'entraînement multi-GPU afin de réduire le temps requis pour la convergence du modèle. Il utilise une conception accélérée par GPU pour gérer l'entraînement et l'inférence de réseaux de détection complexes. Le framework couvre le cycle de vie complet de la détection d'objets, y compris l'entraînement de réseaux personnalisés et l'inférence pour les images statiques et les flux vidéo en temps réel. Il inclut des capacités pour la validation des performances du modèle en utilisant des jeux de données standardisés, ainsi que des optimisations d'entraînement telles que le regroupement basé sur le rapport d'aspect et les charges de travail distribuées.
Implements throughput improvements through aspect-ratio-based grouping and multi-image batching to optimize training speed.
Tensorpack est un framework d'entraînement TensorFlow haute performance et un toolkit de deep learning distribué. Il fournit une suite d'outils pour construire et entraîner des réseaux de neurones avec un accent sur la vitesse d'exécution et la flexibilité architecturale. Le projet sert de suite d'optimisation de réseaux de neurones, implémentant des modèles d'exécution à haute efficacité pour réduire la surcharge d'entraînement. Il fonctionne comme un pipeline de chargement de données parallèle, utilisant la parallélisation automatisée pour maximiser le débit lors du traitement de grands jeux de données. Le toolkit couvre l'entraînement distribué sur plusieurs GPU et clusters de calcul en utilisant des stratégies de parallélisme de données. Ses capacités incluent le traitement de jeux de données à grande échelle et l'optimisation des performances pour augmenter le débit d'entraînement.
Reduces training overhead and increases throughput using high-efficiency execution patterns.
Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a configurable training pipeline orchestrated through YAML recipes, with CLI overrides and component swapping, distributed training via FSDP2, memory optimizations, and parameter-efficient fine-tuning methods like LoRA, DoRA, and QLoRA. The library distinguishes itself through its YAML-driven configuration system that defines all training parameters and instantiates components from config files, with full CLI override capability for any field or component at launch time. It suppo
Combines packing, compilation, and activation checkpointing to reduce memory and increase training throughput.
FlagAI is a distributed deep learning framework and platform designed for the end-to-end lifecycle of large-scale foundation models. It provides a toolkit for training, fine-tuning, and deploying large language models and multi-modal systems across multi-node computing clusters. The project features hardware-agnostic compute abstractions to ensure consistent execution across different accelerators. It includes a dedicated library for parameter-efficient fine-tuning, allowing large neural networks to be adapted to specific tasks with minimal parameter updates and reduced computational overhead
Decreases total training time for large-scale architectures through specialized attention and parallel processing.