awesome-repositories.com
المدونة
MCP
awesome-repositories.com

اكتشف أفضل مستودعات المصادر المفتوحة باستخدام بحث مدعوم بالذكاء الاصطناعي.

استكشفعمليات بحث منسقةبدائل مفتوحة المصدربرمجيات ذاتية الاستضافةالمدونةخريطة الموقع
المشروعخادم MCPحولكيفية ترتيب النتائجالصحافة
قانونيالخصوصيةالشروط
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

1 مستودع

Awesome GitHub RepositoriesPre-training Tutorials

Instructional guides for cleaning data and training models on unlabeled corpora.

Distinct from Pre-training Processing: Focuses on the educational tutorial aspect of pre-training rather than just the technical processing pipeline.

Explore 1 awesome GitHub repository matching data & databases · Pre-training Tutorials. Refine with filters or upvote what's useful.

Awesome Pre-training Tutorials GitHub Repositories

اعثر على أفضل المستودعات باستخدام الذكاء الاصطناعي.سنبحث عن أفضل المستودعات المطابقة باستخدام الذكاء الاصطناعي.
  • datawhalechina/llms-from-scratch-cnالصورة الرمزية لـ datawhalechina

    datawhalechina/llms-from-scratch-cn

    4,211عرض على GitHub↗

    هذا المشروع عبارة عن دورة تعليمية ومجموعة من المواد الإرشادية لبناء نماذج لغوية كبيرة (LLMs) من الصفر باستخدام Python. يقدم دليلاً خطوة بخطوة ودروساً عملية تركز على الآليات الداخلية لهياكل المحولات (Transformers) وسير عمل التدريب المسبق. يتميز المستودع بإطار عمل لتنفيذ ومقارنة عائلات نماذج متنوعة، بما في ذلك Llama و GLM و RWKV. يستخدم نهج التجميع القائم على التكوين لتحليل الاختلافات الهيكلية والآليات الداخلية لهذه البنى المختلفة. يغطي الكود المصدري خط أنابيب التطوير الكامل، بما في ذلك معالجة النصوص مسبقاً، وترميز أزواج البايتات (BPE)، وتنفيذ الانتباه متعدد الرؤوس (Multi-head attention) مع القناع السببي (Causal masking). كما يتضمن أدوات تدريب مثل قص التدرج (Gradient clipping)، وجدولة معدل التعلم، وتحسين المعلمات الفائقة للتدريب المسبق على مجموعات بيانات غير مصنفة. تم تنفيذ المشروع باستخدام Jupyter Notebooks.

    Provides practical instructions for cleaning text and training models on unlabeled corpora.

    Jupyter Notebookglmllamallm
    عرض على GitHub↗4,211
  1. Home
  2. Data & Databases
  3. Text Processing Pipelines
  4. Pre-training Processing
  5. Pre-training Tutorials