3 repositorios
Persistence of the internal state of a deep learning training engine.
Distinct from Execution State Persistence: Focuses on the state of the training engine controller and metadata rather than general script variable states.
Explore 3 awesome GitHub repositories matching development tools & productivity · Training Engine State Persistence. Refine with filters or upvote what's useful.
Ignite es un framework de entrenamiento de alto nivel para redes neuronales en PyTorch que sirve como motor de entrenamiento y gestor del ciclo de vida del aprendizaje profundo. Proporciona un sistema estructurado para organizar y automatizar bucles de entrenamiento y evaluación, gestionando iteradores de datos y activando manejadores de eventos en hitos específicos durante el proceso de entrenamiento del modelo. El proyecto se distingue por una suite integral de herramientas para el entrenamiento distribuido y la evaluación de modelos. Incluye utilidades para sincronizar gradientes y coordinar la comunicación colectiva a través de múltiples GPUs o nodos, así como una suite de evaluación para calcular métricas de rendimiento y realizar validación cruzada k-fold. Sus capacidades más amplias cubren la automatización del flujo de trabajo de entrenamiento, incluyendo la programación de la tasa de aprendizaje, parada temprana y optimización de hiperparámetros. El framework también proporciona herramientas de observabilidad para el seguimiento de experimentos, perfilado de tiempo de ejecución y entrenamiento de precisión mixta para optimizar el uso de memoria. Se incluyen mecanismos de persistencia de estado para gestionar checkpoints del modelo y recuperar sesiones de entrenamiento. Hay entornos contenedorizados disponibles para simplificar el despliegue y la configuración del entorno.
Stores and retrieves internal execution data and metadata to maintain continuity across training sessions.
This project is a collection of educational resources and reference implementations for neural network development using TensorFlow. It serves as a comprehensive learning course, machine learning curriculum, and practical implementation guide for building deep learning architectures. The codebase provides instructional materials and examples covering a wide range of model types, including convolutional neural networks for image classification, recurrent networks and long short-term memory cells for sequential data, and autoencoders for generative modeling. It also includes implementations for
Provides mechanisms to save and restore the internal state of the training engine to disk.
LoRA Easy Training Scripts es una interfaz gráfica basada en escritorio diseñada para gestionar el flujo de trabajo de extremo a extremo del entrenamiento de modelos de machine learning personalizados. La aplicación sirve como un dashboard centralizado para preparar datasets, configurar parámetros de redes neuronales y orquestar la ejecución de trabajos de entrenamiento complejos. La herramienta se distingue por proporcionar un entorno visual que abstrae los requisitos de línea de comandos del ajuste fino (fine-tuning) de modelos. Permite a los usuarios gestionar colas de entrenamiento, permitiendo la secuenciación automatizada de múltiples tareas para maximizar la utilización del hardware. Al mantener un estado interno persistente, el software mapea las entradas de la interfaz definidas por el usuario directamente a los argumentos necesarios para los scripts de entrenamiento externos, asegurando que configuraciones complejas permanezcan reproducibles mediante archivos de texto serializados. La plataforma cubre un amplio rango de requisitos operativos, incluyendo gestión de activos, programación de tasas de aprendizaje personalizadas y el ajuste de pesos de bloques específicos del modelo. Proporciona un enfoque estructurado para organizar datos de entrenamiento y gestionar el ciclo de vida de la generación de pesos del modelo, específicamente adaptado para el ajuste fino de modelos Stable Diffusion.
Maintains persistent internal state to map user-defined interface inputs directly to training engine arguments.