3 مستودعات
Pipelines that convert various data types like text, images, and audio into tensors.
Distinct from Text Processing Pipelines: Expands beyond text-only processing to include image and audio feature extraction pipelines.
Explore 3 awesome GitHub repositories matching data & databases · Multimodal Pre-Processing. Refine with filters or upvote what's useful.
Transformers.js is a JavaScript library and web machine learning framework designed to run pretrained transformer models directly in the browser. It serves as a client-side inference engine and a wrapper for the ONNX Runtime, enabling the execution of multimodal AI tasks on user devices without the need for a backend server. The library distinguishes itself by providing a unified toolkit for processing text, image, and audio data locally. This architecture supports privacy-preserving model inference and reduces latency by performing all computations on the client's hardware. Its capabilities
Implements structured tokenizers and feature extractors to convert raw multimodal input into numerical tensors.
Neuraltalk2 هو نظام رؤية للتعلم العميق مصمم للتعليق التلقائي على الصور. مبني باستخدام PyTorch، ويستخدم بنية هجينة تجمع بين مشفر شبكة عصبية تلافيفية (CNN) وفك تشفير شبكة عصبية متكررة (RNN) لتوليد أوصاف نصية من المدخلات المرئية. يتميز المشروع بخط تدريب مسرع بواسطة GPU قادر على توزيع أعباء العمل عبر وحدات معالجة رسومات متعددة من خلال التوزيع متعدد العمليات. يدعم توليد أوصاف لكل من ملفات الصور الثابتة وتيارات الفيديو في الوقت الفعلي. يتضمن إطار العمل قدرات لضبط المشفر، وأخذ عينات نصية عبر البحث الشعاعي (Beam search) مع التحكم في درجة الحرارة، واستخدام مقاييس اللغة القياسية في الصناعة لتقييم دقة وطلاقة التعليق. كما يوفر أدوات لمعالجة البيانات مسبقًا، واستمرارية نقاط فحص النموذج، وتصدير التنبؤات إلى ملفات JSON مهيكلة. يتم توفير التنفيذ كدفتر ملاحظات Jupyter.
Implements a pipeline to convert raw image and text pairs into tensors for optimized model training.
mmaction2 هو صندوق أدوات لفهم الفيديو لـ PyTorch مصمم لتدريب وتقييم نماذج التعلم العميق. يعمل كإطار عمل للتعرف على الإجراءات، والتوطين الزمني، واكتشاف الإجراءات الزمانية المكانية، ويوفر أدوات متخصصة لكل من تحليل الفيديو القائم على البكسل والتعرف على الإجراءات القائم على الهيكل العظمي. يتميز المشروع ببنية معيارية تتميز باكتشاف المكونات القائم على السجل وتجميع النماذج الهرمي القائم على التكوين. يدعم دمج الميزات متعدد الوسائط، ودمج إطارات RGB، والتدفق البصري، والصوت، ويتضمن إمكانيات لاسترجاع مقاطع الفيديو من النص وتنبؤ الفيديو بدون تدريب مسبق (Zero-shot). بشكل عام، يغطي إطار العمل هندسة مجموعات بيانات الفيديو، بما في ذلك توحيد التعليقات التوضيحية وأخذ عينات الإطارات، بالإضافة إلى تدريب وتقييم النماذج الشامل. يوفر أدوات للتدريب الموزع، وتقطير المعرفة، وتحسين الاستنتاج عبر إعادة معلمات النموذج. يدعم الكود المصدري تصدير نموذج ONNX وحاويات البيئة للنشر عبر عقد حوسبة مختلفة.
Extracts and processes 3D and 2D skeletal pose information from video for pose-based recognition.