awesome-repositories.com
المدونة
MCP
awesome-repositories.com

اكتشف أفضل مستودعات المصادر المفتوحة باستخدام بحث مدعوم بالذكاء الاصطناعي.

استكشفعمليات بحث منسقةبدائل مفتوحة المصدربرمجيات ذاتية الاستضافةالمدونةخريطة الموقع
المشروعخادم MCPحولكيفية ترتيب النتائجالصحافة
قانونيالخصوصيةالشروط
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 مستودعات

Awesome GitHub RepositoriesMultimodal Pre-Processing

Pipelines that convert various data types like text, images, and audio into tensors.

Distinct from Text Processing Pipelines: Expands beyond text-only processing to include image and audio feature extraction pipelines.

Explore 3 awesome GitHub repositories matching data & databases · Multimodal Pre-Processing. Refine with filters or upvote what's useful.

Awesome Multimodal Pre-Processing GitHub Repositories

اعثر على أفضل المستودعات باستخدام الذكاء الاصطناعي.سنبحث عن أفضل المستودعات المطابقة باستخدام الذكاء الاصطناعي.
  • xenova/transformers.jsالصورة الرمزية لـ xenova

    xenova/transformers.js

    16,141عرض على GitHub↗

    Transformers.js is a JavaScript library and web machine learning framework designed to run pretrained transformer models directly in the browser. It serves as a client-side inference engine and a wrapper for the ONNX Runtime, enabling the execution of multimodal AI tasks on user devices without the need for a backend server. The library distinguishes itself by providing a unified toolkit for processing text, image, and audio data locally. This architecture supports privacy-preserving model inference and reduces latency by performing all computations on the client's hardware. Its capabilities

    Implements structured tokenizers and feature extractors to convert raw multimodal input into numerical tensors.

    JavaScript
    عرض على GitHub↗16,141
  • karpathy/neuraltalk2الصورة الرمزية لـ karpathy

    karpathy/neuraltalk2

    5,588عرض على GitHub↗

    Neuraltalk2 هو نظام رؤية للتعلم العميق مصمم للتعليق التلقائي على الصور. مبني باستخدام PyTorch، ويستخدم بنية هجينة تجمع بين مشفر شبكة عصبية تلافيفية (CNN) وفك تشفير شبكة عصبية متكررة (RNN) لتوليد أوصاف نصية من المدخلات المرئية. يتميز المشروع بخط تدريب مسرع بواسطة GPU قادر على توزيع أعباء العمل عبر وحدات معالجة رسومات متعددة من خلال التوزيع متعدد العمليات. يدعم توليد أوصاف لكل من ملفات الصور الثابتة وتيارات الفيديو في الوقت الفعلي. يتضمن إطار العمل قدرات لضبط المشفر، وأخذ عينات نصية عبر البحث الشعاعي (Beam search) مع التحكم في درجة الحرارة، واستخدام مقاييس اللغة القياسية في الصناعة لتقييم دقة وطلاقة التعليق. كما يوفر أدوات لمعالجة البيانات مسبقًا، واستمرارية نقاط فحص النموذج، وتصدير التنبؤات إلى ملفات JSON مهيكلة. يتم توفير التنفيذ كدفتر ملاحظات Jupyter.

    Implements a pipeline to convert raw image and text pairs into tensors for optimized model training.

    Jupyter Notebook
    عرض على GitHub↗5,588
  • open-mmlab/mmaction2الصورة الرمزية لـ open-mmlab

    open-mmlab/mmaction2

    5,066عرض على GitHub↗

    mmaction2 هو صندوق أدوات لفهم الفيديو لـ PyTorch مصمم لتدريب وتقييم نماذج التعلم العميق. يعمل كإطار عمل للتعرف على الإجراءات، والتوطين الزمني، واكتشاف الإجراءات الزمانية المكانية، ويوفر أدوات متخصصة لكل من تحليل الفيديو القائم على البكسل والتعرف على الإجراءات القائم على الهيكل العظمي. يتميز المشروع ببنية معيارية تتميز باكتشاف المكونات القائم على السجل وتجميع النماذج الهرمي القائم على التكوين. يدعم دمج الميزات متعدد الوسائط، ودمج إطارات RGB، والتدفق البصري، والصوت، ويتضمن إمكانيات لاسترجاع مقاطع الفيديو من النص وتنبؤ الفيديو بدون تدريب مسبق (Zero-shot). بشكل عام، يغطي إطار العمل هندسة مجموعات بيانات الفيديو، بما في ذلك توحيد التعليقات التوضيحية وأخذ عينات الإطارات، بالإضافة إلى تدريب وتقييم النماذج الشامل. يوفر أدوات للتدريب الموزع، وتقطير المعرفة، وتحسين الاستنتاج عبر إعادة معلمات النموذج. يدعم الكود المصدري تصدير نموذج ONNX وحاويات البيئة للنشر عبر عقد حوسبة مختلفة.

    Extracts and processes 3D and 2D skeletal pose information from video for pose-based recognition.

    Python
    عرض على GitHub↗5,066
  1. Home
  2. Data & Databases
  3. Text Processing Pipelines
  4. Multimodal Pre-Processing

استكشف الوسوم الفرعية

  • Skeletal Pose Pre-processingPreprocessing pipelines specifically for extracting 2D and 3D skeletal joint information from video. **Distinct from Multimodal Pre-Processing:** Focuses on skeletal keypoints and pose data rather than general multimodal tensor conversion