3 रिपॉजिटरी
Layers that perform affine transformations via matrix multiplication and bias addition.
Distinct from Linear Mixing Layers: Distinct from Linear Mixing Layers by focusing on general size transformation (input to output) rather than mixing dimensions
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Linear Transformation Layers. Refine with filters or upvote what's useful.
Flashlight एक स्टैंडअलोन C++ मशीन लर्निंग लाइब्रेरी और टेंसर लाइब्रेरी है जिसका उपयोग न्यूरल नेटवर्क बनाने और ट्रेन करने के लिए किया जाता है। यह एक व्यापक न्यूरल नेटवर्क फ्रेमवर्क और ऑटोमैटिक डिफरेंशिएशन इंजन के रूप में कार्य करता है, जो कम्प्यूटेशन ग्राफ बनाने और बैकप्रोपैगेशन के माध्यम से ग्रेडिएंट्स की गणना करने के लिए उपकरण प्रदान करता है। यह प्रोजेक्ट एक वितरित ट्रेनिंग फ्रेमवर्क के रूप में कार्य करता है, जो कई कंप्यूट नोड्स और डिवाइसेस पर ग्रेडिएंट्स और पैरामीटर्स को सिंक्रोनाइज़ करने के लिए ऑल-रिड्यूस ऑपरेशन्स का उपयोग करता है। यह उच्च-प्रदर्शन टेंसर मैनिपुलेशन, नेटिव डिवाइस मेमोरी इंटरऑपरेबिलिटी और बड़े पैमाने पर मॉडल ट्रेनिंग को गति देने के लिए वितरित वर्कर्स में वेट्स को सिंक्रोनाइज़ करने के सिस्टम के गहरे एकीकरण के माध्यम से खुद को अलग करता है। यह फ्रेमवर्क रेजिडुअल ब्लॉक्स और रिकरेंट सेल्स जैसे जटिल आर्किटेक्चर को डिज़ाइन करने के लिए मॉड्यूलर लेयर कंपोज़िशन सहित डीप लर्निंग क्षमताओं की एक विस्तृत श्रृंखला को कवर करता है। यह मॉडल स्टेट्स को बनाए रखने के लिए सीरियलाइजेशन सिस्टम के साथ-साथ इनजेशन और प्रीफेचिंग के लिए व्यापक डेटा प्रबंधन यूटिलिटीज प्रदान करता है। इसके अतिरिक्त, इसमें ट्रेनिंग मेट्रिक्स को ट्रैक करने और सीक्वेंस एरर्स को मापने के लिए मॉनिटरिंग और ऑब्जर्वेबिलिटी टूल्स का एक सूट शामिल है। यह लाइब्रेरी C++ में इम्प्लीमेंट की गई है।
Implements linear transformation layers that use matrix multiplication and optional bias to transform input tensor sizes.
PerceptualSimilarity is a deep learning framework designed to quantify and evaluate the perceptual distance between images. It provides a system for measuring how similar two images or image patches appear to human vision by using deep feature representations instead of pixel-wise differences. The project implements a differentiable distance metric that functions as a loss function, allowing image pixels to be optimized via backpropagation to reach a target visual appearance. It includes a trainable linear layer that can be applied to frozen deep features to learn weighted distance metrics al
Uses a trainable linear layer on top of frozen features to learn weighted human-perceptual distances.
DeepSeek-VL एक मल्टीमॉडल बड़ा भाषा मॉडल और इमेज-टू-टेक्स्ट रीजनिंग इंजन है। यह एक विज़न-भाषा मॉडल और विज़ुअल प्रश्न उत्तर प्रणाली के रूप में कार्य करता है जो छवियों को समझने और उनका वर्णन करने के लिए भाषाई तर्क के साथ विज़ुअल धारणा को एकीकृत करता है। प्रोजेक्ट मल्टीमॉडल इमेज समझ और दस्तावेज़ इमेज विश्लेषण को सक्षम बनाता है, विशेष रूप से वेब पेजों और तकनीकी आरेखों के स्क्रीनशॉट को प्रोसेस करता है। यह विज़ुअल संवादात्मक AI के लिए क्षमताएं प्रदान करता है, जिससे उपयोगकर्ता अंतर्दृष्टि निकालने और विभिन्न प्रकार की विज़ुअल जानकारी में जटिल तर्क करने के लिए विज़ुअल डेटा के साथ बातचीत कर सकते हैं। सिस्टम एक विज़न-भाषा ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है जो विज़ुअल एन्कोडिंग के लिए एक विज़न ट्रांसफॉर्मर को एक बड़े भाषा मॉडल के साथ जोड़ता है। यह ऑटोरिग्र्रेसिव टेक्स्ट जनरेशन के लिए भाषा मॉडल के एम्बेडिंग स्पेस के साथ विज़ुअल फ़ीचर वैक्टर को संरेखित करने के लिए मल्टीमॉडल इंस्ट्रक्शन ट्यूनिंग और एक प्रोजेक्शन लेयर का उपयोग करता है।
Employs a learnable projection layer to align visual feature vectors with the language model's embedding space.