2 रिपॉजिटरी
Specialized constructions for building models that predict subsequent tokens in a sequence.
Distinct from Model Construction: Specifically targets the structural construction of language models rather than general model construction.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Language Model Architectures. Refine with filters or upvote what's useful.
यह रिपॉजिटरी एक व्यापक शैक्षिक कार्यक्रम और डीप लर्निंग फ्रेमवर्क है, जिसे नोटबुक और कोड उदाहरणों के माध्यम से PyTorch का उपयोग करके व्यावहारिक डीप लर्निंग सिखाने के लिए डिज़ाइन किया गया है। यह न्यूरल नेटवर्क बनाने, प्रशिक्षित करने और डिप्लॉय करने के लिए एक हाई-लेवल लाइब्रेरी के रूप में कार्य करता है। यह प्रोजेक्ट कंप्यूटर विज़न, नेचुरल लैंग्वेज प्रोसेसिंग और टैबुलर डेटा प्रीप्रोसेसिंग के लिए विशेष टूलकिट प्रदान करता है। यह डिस्क्रिमिनेटिव लर्निंग रेट्स, ट्रेनिंग लॉजिक को कस्टमाइज़ करने के लिए टू-वे कॉलबैक सिस्टम और हाई-लेवल लर्नर एब्स्ट्रैक्शन जैसे उन्नत ट्रेनिंग कंट्रोल्स के माध्यम से खुद को अलग करता है। यह प्रोजेक्ट Jupyter Notebooks की एक श्रृंखला के रूप में उपलब्ध है।
fastai constructs a model for predicting subsequent tokens in a sequence using specified architectures.
यह प्रोजेक्ट एक छोटे पैमाने के जनरेटिव प्री-ट्रेंड ट्रांसफार्मर का शैक्षिक कार्यान्वयन है जिसे न्यूरल नेटवर्क आर्किटेक्चर और ट्रेनिंग के मूल सिद्धांतों को सिखाने के लिए डिज़ाइन किया गया है। यह स्क्रैच से टेक्स्ट-जनरेटिंग न्यूरल नेटवर्क बनाने के लिए एक संदर्भ कार्यान्वयन और ट्यूटोरियल के रूप में कार्य करता है। कोडबेस टोकनाइज़ेशन, सेल्फ-अटेंशन और एक हल्के भाषा मॉडल के निर्माण के यांत्रिकी को प्रदर्शित करता है। यह यह समझाने के लिए कि लार्ज लैंग्वेज मॉडल्स कैसे बनाए जाते हैं, जनरेटिव मॉडल बनाने की चरण-दर-चरण प्रक्रिया पर केंद्रित है। यह कार्यान्वयन ट्रांसफार्मर-आधारित आर्किटेक्चर को कवर करता है, जिसमें मल्टी-हेड अटेंशन, फीड-फॉरवर्ड नेटवर्क्स और कॉज़ल मास्किंग शामिल हैं। यह टेंसर कंप्यूटेशन के लिए PyTorch का उपयोग करता है और अनुक्रमिक टेक्स्ट डेटा पर मॉडल को ट्रेन करने के लिए बैकप्रोपैगेशन-आधारित लर्निंग को नियोजित करता है।
Provides a framework for constructing language model architectures that predict subsequent tokens.