3 repository-uri
Pipelines that convert various data types like text, images, and audio into tensors.
Distinct from Text Processing Pipelines: Expands beyond text-only processing to include image and audio feature extraction pipelines.
Explore 3 awesome GitHub repositories matching data & databases · Multimodal Pre-Processing. Refine with filters or upvote what's useful.
Transformers.js is a JavaScript library and web machine learning framework designed to run pretrained transformer models directly in the browser. It serves as a client-side inference engine and a wrapper for the ONNX Runtime, enabling the execution of multimodal AI tasks on user devices without the need for a backend server. The library distinguishes itself by providing a unified toolkit for processing text, image, and audio data locally. This architecture supports privacy-preserving model inference and reduces latency by performing all computations on the client's hardware. Its capabilities
Implements structured tokenizers and feature extractors to convert raw multimodal input into numerical tensors.
Neuraltalk2 este un sistem de viziune deep learning conceput pentru generarea automată de descrieri pentru imagini (captioning). Construit cu PyTorch, utilizează o arhitectură hibridă care combină un encoder de rețea neuronală convoluțională cu un decoder de rețea neuronală recurentă pentru a genera descrieri textuale din input vizual. Proiectul include un pipeline de antrenare accelerat pe GPU, capabil să distribuie sarcinile de lucru pe mai multe unități de procesare grafică prin distribuție multi-proces. Suportă generarea de descrieri atât pentru fișiere imagine statice, cât și pentru fluxuri video în timp real. Framework-ul include capabilități pentru fine-tuning-ul encoder-ului, eșantionarea textului prin beam search cu controlul temperaturii și utilizarea metricilor lingvistice standard din industrie pentru a evalua acuratețea și fluența descrierilor. De asemenea, oferă utilitare pentru preprocesarea seturilor de date, persistența checkpoint-urilor modelului și exportul predicțiilor în fișiere JSON structurate. Implementarea este furnizată sub formă de Jupyter Notebook.
Implements a pipeline to convert raw image and text pairs into tensors for optimized model training.
mmaction2 este un set de instrumente PyTorch pentru înțelegerea video, conceput pentru antrenarea și evaluarea modelelor de deep learning. Servește ca un framework pentru recunoașterea acțiunilor, localizarea temporală și detectarea acțiunilor spatio-temporale, oferind instrumente specializate atât pentru analiza video bazată pe pixeli, cât și pentru recunoașterea acțiunilor bazată pe schelet. Proiectul se distinge printr-o arhitectură modulară care dispune de descoperirea componentelor bazată pe registru și asamblarea ierarhică a modelelor bazată pe configurație. Suportă fuziunea caracteristicilor multi-modale, integrând cadre RGB, flux optic și audio, și include capabilități pentru recuperarea clipurilor video din text și predicția video zero-shot. În linii mari, framework-ul acoperă ingineria seturilor de date video, inclusiv standardizarea adnotărilor și eșantionarea cadrelor, precum și antrenarea și evaluarea cuprinzătoare a modelelor. Oferă utilitare pentru antrenarea distribuită, distilarea cunoștințelor și optimizarea inferenței prin reparametrizarea modelului. Codul sursă suportă exportul modelelor ONNX și containerizarea mediului pentru implementarea pe diferite noduri de calcul.
Extracts and processes 3D and 2D skeletal pose information from video for pose-based recognition.