awesome-repositories.com
ब्लॉग
MCP
awesome-repositories.com

AI-संचालित खोज के साथ बेहतरीन ओपन-सोर्स रिपॉजिटरी खोजें।

एक्सप्लोर करेंक्यूरेटेड खोजेंओपन-सोर्स विकल्पसेल्फ-होस्टेड सॉफ्टवेयरब्लॉगसाइटमैप
प्रोजेक्टMCP सर्वरहमारे बारे मेंहम रैंकिंग कैसे करते हैंप्रेस
कानूनीगोपनीयताशर्तें
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 रिपॉजिटरी

Awesome GitHub RepositoriesMultimodal Pre-Processing

Pipelines that convert various data types like text, images, and audio into tensors.

Distinct from Text Processing Pipelines: Expands beyond text-only processing to include image and audio feature extraction pipelines.

Explore 3 awesome GitHub repositories matching data & databases · Multimodal Pre-Processing. Refine with filters or upvote what's useful.

Awesome Multimodal Pre-Processing GitHub Repositories

AI के साथ बेहतरीन रिपॉजिटरी खोजें।हम AI का उपयोग करके सबसे सटीक रिपॉजिटरी खोजेंगे।
  • xenova/transformers.jsxenova का अवतार

    xenova/transformers.js

    16,141GitHub पर देखें↗

    Transformers.js is a JavaScript library and web machine learning framework designed to run pretrained transformer models directly in the browser. It serves as a client-side inference engine and a wrapper for the ONNX Runtime, enabling the execution of multimodal AI tasks on user devices without the need for a backend server. The library distinguishes itself by providing a unified toolkit for processing text, image, and audio data locally. This architecture supports privacy-preserving model inference and reduces latency by performing all computations on the client's hardware. Its capabilities

    Implements structured tokenizers and feature extractors to convert raw multimodal input into numerical tensors.

    JavaScript
    GitHub पर देखें↗16,141
  • karpathy/neuraltalk2karpathy का अवतार

    karpathy/neuraltalk2

    5,588GitHub पर देखें↗

    Neuraltalk2 एक डीप लर्निंग विज़न सिस्टम है जिसे स्वचालित इमेज कैप्शनिंग के लिए डिज़ाइन किया गया है। PyTorch के साथ निर्मित, यह विज़ुअल इनपुट से टेक्स्ट विवरण उत्पन्न करने के लिए एक रिकरेंट न्यूरल नेटवर्क डिकोडर के साथ एक कन्वेन्शनल न्यूरल नेटवर्क एनकोडर को जोड़ता है। प्रोजेक्ट में एक GPU-एक्सेलेरेटेड ट्रेनिंग पाइपलाइन है जो मल्टी-प्रोसेस डिस्ट्रीब्यूशन के माध्यम से कई ग्राफ़िक्स प्रोसेसिंग यूनिट्स में वर्कलोड को वितरित करने में सक्षम है। यह स्थिर इमेज फ़ाइलों और रीयल-टाइम वीडियो स्ट्रीम दोनों के लिए विवरण उत्पन्न करने का सपोर्ट करता है। फ्रेमवर्क में एनकोडर फ़ाइन-ट्यूनिंग, तापमान नियंत्रण के साथ बीम सर्च टेक्स्ट सैंपलिंग, और कैप्शन सटीकता व प्रवाह का मूल्यांकन करने के लिए उद्योग-मानक भाषा मेट्रिक्स का उपयोग करने की क्षमताएं शामिल हैं। यह डेटासेट प्रीप्रोसेसिंग, मॉडल चेकपॉइंट पर्सिस्टेंस, और संरचित JSON फ़ाइलों में भविष्यवाणियों के निर्यात के लिए यूटिलिटीज़ भी प्रदान करता है। कार्यान्वयन एक Jupyter Notebook के रूप में प्रदान किया गया है।

    Implements a pipeline to convert raw image and text pairs into tensors for optimized model training.

    Jupyter Notebook
    GitHub पर देखें↗5,588
  • open-mmlab/mmaction2open-mmlab का अवतार

    open-mmlab/mmaction2

    5,066GitHub पर देखें↗

    mmaction2 एक PyTorch वीडियो अंडरस्टैंडिंग टूलबॉक्स है जिसे डीप लर्निंग मॉडल्स को प्रशिक्षित और मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह एक्शन रिकग्निशन, टेम्पोरल लोकलाइजेशन और स्पैटियो-टेम्पोरल एक्शन डिटेक्शन के लिए एक फ्रेमवर्क के रूप में कार्य करता है, जो पिक्सेल-आधारित वीडियो विश्लेषण और कंकाल-आधारित एक्शन रिकग्निशन दोनों के लिए विशेष टूल्स प्रदान करता है। यह प्रोजेक्ट रजिस्ट्री-आधारित घटक खोज और पदानुक्रमित, कॉन्फ़िगरेशन-संचालित मॉडल असेंबली की विशेषता वाले मॉड्यूलर आर्किटेक्चर के माध्यम से खुद को अलग करता है। यह मल्टी-मोडल फीचर फ्यूजन का समर्थन करता है, RGB फ्रेम्स, ऑप्टिकल फ्लो और ऑडियो को एकीकृत करता है, और टेक्स्ट-टू-वीडियो क्लिप रिट्रीवल और ज़ीरो-शॉट वीडियो भविष्यवाणी के लिए क्षमताएं शामिल करता है। व्यापक रूप से, यह फ्रेमवर्क वीडियो डेटासेट इंजीनियरिंग को कवर करता है, जिसमें एनोटेशन मानकीकरण और फ्रेम सैंपलिंग, साथ ही व्यापक मॉडल प्रशिक्षण और मूल्यांकन शामिल है। यह डिस्ट्रीब्यूटेड प्रशिक्षण, नॉलेज डिस्टिलेशन और मॉडल रिपैरामीट्राइजेशन के माध्यम से इन्फरेंस ऑप्टिमाइज़ेशन के लिए यूटिलिटीज प्रदान करता है। कोडबेस विभिन्न कंप्यूट नोड्स में डिप्लॉयमेंट के लिए ONNX मॉडल एक्सपोर्ट और एनवायरनमेंट कंटेनरीकरण का समर्थन करता है।

    Extracts and processes 3D and 2D skeletal pose information from video for pose-based recognition.

    Python
    GitHub पर देखें↗5,066
  1. Home
  2. Data & Databases
  3. Text Processing Pipelines
  4. Multimodal Pre-Processing

सब-टैग एक्सप्लोर करें

  • Skeletal Pose Pre-processingPreprocessing pipelines specifically for extracting 2D and 3D skeletal joint information from video. **Distinct from Multimodal Pre-Processing:** Focuses on skeletal keypoints and pose data rather than general multimodal tensor conversion