3 repository-uri
Persistence of the internal state of a deep learning training engine.
Distinct from Execution State Persistence: Focuses on the state of the training engine controller and metadata rather than general script variable states.
Explore 3 awesome GitHub repositories matching development tools & productivity · Training Engine State Persistence. Refine with filters or upvote what's useful.
Ignite este un framework de antrenament de nivel înalt pentru rețele neuronale PyTorch, care servește drept motor de antrenament și manager al ciclului de viață al deep learning-ului. Oferă un sistem structurat pentru organizarea și automatizarea buclelor de antrenament și evaluare, gestionând iteratoarele de date și declanșând handler-e de evenimente la etape specifice în timpul procesului de antrenare a modelului. Proiectul se distinge printr-o suită cuprinzătoare de instrumente pentru antrenament distribuit și evaluarea modelelor. Include utilitare pentru sincronizarea gradienților și coordonarea comunicării colective între mai multe GPU-uri sau noduri, precum și o suită de evaluare pentru calcularea metricilor de performanță și efectuarea validării încrucișate (k-fold cross-validation). Capabilitățile sale mai largi acoperă automatizarea fluxului de lucru de antrenament, inclusiv programarea ratei de învățare, oprirea timpurie (early stopping) și optimizarea hiperparametrilor. Framework-ul oferă, de asemenea, instrumente de observabilitate pentru urmărirea experimentelor, profilarea timpului de execuție și antrenamentul cu precizie mixtă pentru a optimiza utilizarea memoriei. Sunt incluse mecanisme de persistență a stării pentru a gestiona checkpoint-urile modelelor și a recupera sesiunile de antrenament. Sunt disponibile medii containerizate pentru a simplifica implementarea și configurarea mediului.
Stores and retrieves internal execution data and metadata to maintain continuity across training sessions.
Acest proiect este o colecție de resurse educaționale și implementări de referință pentru dezvoltarea rețelelor neuronale folosind TensorFlow. Servește drept curs cuprinzător de învățare, curriculum de machine learning și ghid practic de implementare pentru construirea arhitecturilor de deep learning. Codul sursă oferă materiale instrucționale și exemple care acoperă o gamă largă de tipuri de modele, inclusiv rețele neuronale convoluționale pentru clasificarea imaginilor, rețele recurente și celule long short-term memory pentru date secvențiale, și autoencodere pentru modelare generativă. Include, de asemenea, implementări pentru agenți de deep reinforcement learning și tehnici de transfer learning pentru adaptarea modelelor pre-antrenate la sarcini noi. Proiectul acoperă întregul ciclu de viață al dezvoltării, inclusiv preprocesarea datelor, definirea grafului computațional și optimizarea ponderilor. Oferă utilitare pentru evaluarea modelelor și optimizarea antrenamentului, cum ar fi dropout și regularizare, alături de instrumente pentru vizualizarea arhitecturii rețelei și monitorizarea metricilor de antrenament.
Provides mechanisms to save and restore the internal state of the training engine to disk.
LoRA Easy Training Scripts este o interfață grafică bazată pe desktop concepută pentru a gestiona fluxul de lucru end-to-end de antrenare a modelelor personalizate de machine learning. Aplicația servește drept dashboard centralizat pentru pregătirea seturilor de date, configurarea parametrilor rețelei neuronale și orchestrarea execuției sarcinilor complexe de antrenare. Instrumentul se distinge prin furnizarea unui mediu vizual care abstractizează cerințele de linie de comandă ale fine-tuning-ului modelelor. Permite utilizatorilor să gestioneze cozile de antrenare, permițând secvențierea automată a mai multor sarcini pentru a maximiza utilizarea hardware-ului. Prin menținerea unei stări interne persistente, software-ul mapează input-urile interfeței definite de utilizator direct la argumentele necesare pentru scripturile de antrenare externe, asigurându-se că configurațiile complexe rămân reproductibile prin fișiere text serializate. Platforma acoperă o gamă largă de cerințe operaționale, inclusiv gestionarea activelor, programarea personalizată a ratei de învățare și ajustarea ponderilor specifice ale blocurilor modelului. Oferă o abordare structurată pentru organizarea datelor de antrenare și gestionarea ciclului de viață al generării ponderilor modelului, adaptată special pentru fine-tuning-ul modelelor Stable Diffusion.
Maintains persistent internal state to map user-defined interface inputs directly to training engine arguments.