3 Repos
Normalization techniques specifically for convolutional weights to improve training stability.
Distinct from Supervised Model Weight Optimization: Distinct from Supervised Model Weight Optimization: specifically addresses the standardization of weights within convolutional layers.
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Convolutional Weight Standardization. Refine with filters or upvote what's useful.
Composer ist ein Framework für verteiltes Training mit PyTorch, das für die Skalierung großer Modelle über Multi-Node-GPU-Cluster hinweg entwickelt wurde. Es fungiert als Trainer für Large Language Models, als verteilter Modelloptimierer und als Manager für den Trainingslebenszyklus. Das Projekt hebt sich als Bibliothek für Deep-Learning-Regularisierung hervor und bietet spezialisierte Optimierungstechniken wie Sharpness Aware Minimization, MixUp und CutMix, um die Generalisierung von Modellen zu verbessern. Es differenziert seinen Trainingsablauf zudem durch den Einsatz von Sequence Length Warmup, progressivem Layer-Freezing und Sharded-State-Checkpointing für die Wiederherstellung großer Modelle. Das Framework deckt ein breites Spektrum an Funktionen ab, darunter die Orchestrierung von verteiltem Training, das Management von Mixed-Precision-Hardware und Cloud-natives Daten-Streaming. Es bietet zudem umfangreiche Monitoring- und Observability-Tools für die Diagnose von GPU-Speicher, die Erkennung von Trainingsdivergenz und die Verfolgung des Durchsatzes. Das Projekt enthält einen CLI-Launcher zur Automatisierung der Ausführung von Multi-GPU-Trainingsjobs über mehrere Nodes hinweg.
Normalizes convolutional weights in a model to improve training stability and convergence.
Flashlight ist eine eigenständige C++-Bibliothek für maschinelles Lernen und Tensor-Berechnungen, die zum Erstellen und Trainieren neuronaler Netze verwendet wird. Sie fungiert als umfassendes Framework für neuronale Netze und Engine für automatische Differenzierung und bietet Werkzeuge zur Konstruktion von Berechnungsgraphen und zur Berechnung von Gradienten via Backpropagation. Das Projekt dient als Framework für verteiltes Training und nutzt All-Reduce-Operationen zur Synchronisation von Gradienten und Parametern über mehrere Rechenknoten und Geräte hinweg. Es zeichnet sich durch eine tiefe Integration von leistungsstarker Tensor-Manipulation, nativer Interoperabilität mit Gerätespeichern und einem System zur Synchronisation von Gewichten über verteilte Worker aus, um das Training großskaliger Modelle zu beschleunigen. Das Framework deckt eine breite Palette an Deep-Learning-Funktionen ab, einschließlich modularer Schichtkomposition für den Entwurf komplexer Architekturen wie Residual-Blöcke und rekurrente Zellen. Es bietet umfangreiche Datenmanagement-Utilities für Ingestion und Prefetching sowie Serialisierungssysteme zur Persistierung von Modellzuständen. Zusätzlich enthält es eine Suite an Überwachungs- und Observability-Tools zur Verfolgung von Trainingsmetriken und zur Messung von Sequenzfehlern. Die Bibliothek ist in C++ implementiert.
Provides weight normalization wrappers for linear and convolutional modules to accelerate model convergence.
This repository is an educational collection of implementations and research notes focused on deep learning architectures and optimization techniques. It provides modular code examples designed to demonstrate foundational and advanced concepts in machine learning, ranging from basic neural network structures to complex training strategies. The project distinguishes itself by offering practical implementations of specialized research methods, including capsule-based feature aggregation, gradient direction decoupling, and self-normalizing weight regularization. These materials allow for the stu
Implements weight normalization techniques to maintain statistical distributions and prevent vanishing gradients.