3 dépôts
Persistence of the internal state of a deep learning training engine.
Distinct from Execution State Persistence: Focuses on the state of the training engine controller and metadata rather than general script variable states.
Explore 3 awesome GitHub repositories matching development tools & productivity · Training Engine State Persistence. Refine with filters or upvote what's useful.
Ignite est un framework d'entraînement de haut niveau pour les réseaux de neurones PyTorch, servant de moteur d'entraînement et de gestionnaire de cycle de vie pour le deep learning. Il fournit un système structuré pour organiser et automatiser les boucles d'entraînement et d'évaluation, gérer les itérateurs de données et déclencher des gestionnaires d'événements à des étapes spécifiques du processus d'entraînement du modèle. Le projet se distingue par une suite complète d'outils pour l'entraînement distribué et l'évaluation de modèles. Il inclut des utilitaires pour synchroniser les gradients et coordonner la communication collective entre plusieurs GPU ou nœuds, ainsi qu'une suite d'évaluation pour calculer des métriques de performance et effectuer une validation croisée k-fold. Ses capacités plus larges couvrent l'automatisation du workflow d'entraînement, incluant la planification du taux d'apprentissage, l'arrêt précoce (early stopping) et l'optimisation des hyperparamètres. Le framework fournit également des outils d'observabilité pour le suivi des expériences, le profilage du temps d'exécution et l'entraînement en précision mixte pour optimiser l'utilisation de la mémoire. Des mécanismes de persistance d'état sont inclus pour gérer les checkpoints des modèles et restaurer les sessions d'entraînement. Des environnements conteneurisés sont disponibles pour simplifier le déploiement et la configuration de l'environnement.
Stores and retrieves internal execution data and metadata to maintain continuity across training sessions.
Ce projet est une collection de ressources éducatives et d'implémentations de référence pour le développement de réseaux de neurones utilisant TensorFlow. Il sert de cours d'apprentissage complet, de programme d'apprentissage automatique et de guide d'implémentation pratique pour construire des architectures de deep learning. La base de code fournit des supports pédagogiques et des exemples couvrant un large éventail de types de modèles, y compris les réseaux de neurones convolutifs pour la classification d'images, les réseaux récurrents et les cellules LSTM pour les données séquentielles, et les auto-encodeurs pour la modélisation générative. Il inclut également des implémentations pour des agents d'apprentissage par renforcement profond et des techniques de transfert d'apprentissage pour adapter des modèles pré-entraînés à de nouvelles tâches. Le projet couvre le cycle de vie complet du développement, y compris le prétraitement des données, la définition du graphe de calcul et l'optimisation des poids. Il fournit des utilitaires pour l'évaluation des modèles et l'optimisation de l'entraînement, tels que le dropout et la régularisation, ainsi que des outils pour visualiser l'architecture du réseau et surveiller les métriques d'entraînement.
Provides mechanisms to save and restore the internal state of the training engine to disk.
LoRA Easy Training Scripts est une interface graphique de bureau conçue pour gérer le flux de travail de bout en bout de l'entraînement de modèles de machine learning personnalisés. L'application sert de tableau de bord centralisé pour préparer les jeux de données, configurer les paramètres du réseau de neurones et orchestrer l'exécution de tâches d'entraînement complexes. L'outil se distingue en fournissant un environnement visuel qui abstrait les exigences de ligne de commande du fine-tuning de modèles. Il permet aux utilisateurs de gérer des files d'attente d'entraînement, permettant le séquençage automatisé de multiples tâches pour maximiser l'utilisation du matériel. En maintenant un état interne persistant, le logiciel mappe les entrées d'interface définies par l'utilisateur directement aux arguments nécessaires pour les scripts d'entraînement externes, garantissant que les configurations complexes restent reproductibles via des fichiers texte sérialisés. La plateforme couvre un large éventail d'exigences opérationnelles, incluant la gestion des actifs, la planification personnalisée du taux d'apprentissage et l'ajustement des poids de blocs de modèles spécifiques. Elle fournit une approche structurée pour organiser les données d'entraînement et gérer le cycle de vie de la génération de poids de modèles, spécifiquement adaptée au fine-tuning des modèles Stable Diffusion.
Maintains persistent internal state to map user-defined interface inputs directly to training engine arguments.