1 مستودع
Instructional guides for cleaning data and training models on unlabeled corpora.
Distinct from Pre-training Processing: Focuses on the educational tutorial aspect of pre-training rather than just the technical processing pipeline.
Explore 1 awesome GitHub repository matching data & databases · Pre-training Tutorials. Refine with filters or upvote what's useful.
هذا المشروع عبارة عن دورة تعليمية ومجموعة من المواد الإرشادية لبناء نماذج لغوية كبيرة (LLMs) من الصفر باستخدام Python. يقدم دليلاً خطوة بخطوة ودروساً عملية تركز على الآليات الداخلية لهياكل المحولات (Transformers) وسير عمل التدريب المسبق. يتميز المستودع بإطار عمل لتنفيذ ومقارنة عائلات نماذج متنوعة، بما في ذلك Llama و GLM و RWKV. يستخدم نهج التجميع القائم على التكوين لتحليل الاختلافات الهيكلية والآليات الداخلية لهذه البنى المختلفة. يغطي الكود المصدري خط أنابيب التطوير الكامل، بما في ذلك معالجة النصوص مسبقاً، وترميز أزواج البايتات (BPE)، وتنفيذ الانتباه متعدد الرؤوس (Multi-head attention) مع القناع السببي (Causal masking). كما يتضمن أدوات تدريب مثل قص التدرج (Gradient clipping)، وجدولة معدل التعلم، وتحسين المعلمات الفائقة للتدريب المسبق على مجموعات بيانات غير مصنفة. تم تنفيذ المشروع باستخدام Jupyter Notebooks.
Provides practical instructions for cleaning text and training models on unlabeled corpora.