1 Repo
Instructional guides for cleaning data and training models on unlabeled corpora.
Distinct from Pre-training Processing: Focuses on the educational tutorial aspect of pre-training rather than just the technical processing pipeline.
Explore 1 awesome GitHub repository matching data & databases · Pre-training Tutorials. Refine with filters or upvote what's useful.
Dieses Projekt ist ein Bildungskurs mit Lehrmaterialien, um Large Language Models von Grund auf mit Python zu entwickeln. Es bietet eine Schritt-für-Schritt-Anleitung und praktische Tutorials, die sich auf die internen Mechanismen von Transformer-Architekturen und Pre-Training-Workflows konzentrieren. Das Repository enthält ein Framework zur Implementierung und zum Vergleich verschiedener Modellfamilien, darunter Llama, GLM und RWKV. Es nutzt einen konfigurationsgesteuerten Ansatz, um die strukturellen Unterschiede und internen Mechanismen dieser Architekturen zu analysieren. Die Codebasis deckt die komplette Entwicklungspipeline ab, einschließlich Text-Preprocessing, Byte-Pair-Encoding und der Implementierung von Multi-Head-Attention mit kausaler Maskierung. Zudem sind Trainings-Utilities wie Gradient Clipping, Learning Rate Scheduling und Hyperparameter-Optimierung für das Pre-Training auf ungelabelten Korpora enthalten. Das Projekt ist in Jupyter Notebooks umgesetzt.
Provides practical instructions for cleaning text and training models on unlabeled corpora.