awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 repository-uri

Awesome GitHub RepositoriesMultimodal Pre-Processing

Pipelines that convert various data types like text, images, and audio into tensors.

Distinct from Text Processing Pipelines: Expands beyond text-only processing to include image and audio feature extraction pipelines.

Explore 3 awesome GitHub repositories matching data & databases · Multimodal Pre-Processing. Refine with filters or upvote what's useful.

Awesome Multimodal Pre-Processing GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • xenova/transformers.jsAvatar xenova

    xenova/transformers.js

    16,141Vezi pe GitHub↗

    Transformers.js is a JavaScript library and web machine learning framework designed to run pretrained transformer models directly in the browser. It serves as a client-side inference engine and a wrapper for the ONNX Runtime, enabling the execution of multimodal AI tasks on user devices without the need for a backend server. The library distinguishes itself by providing a unified toolkit for processing text, image, and audio data locally. This architecture supports privacy-preserving model inference and reduces latency by performing all computations on the client's hardware. Its capabilities

    Implements structured tokenizers and feature extractors to convert raw multimodal input into numerical tensors.

    JavaScript
    Vezi pe GitHub↗16,141
  • karpathy/neuraltalk2Avatar karpathy

    karpathy/neuraltalk2

    5,588Vezi pe GitHub↗

    Neuraltalk2 este un sistem de viziune deep learning conceput pentru generarea automată de descrieri pentru imagini (captioning). Construit cu PyTorch, utilizează o arhitectură hibridă care combină un encoder de rețea neuronală convoluțională cu un decoder de rețea neuronală recurentă pentru a genera descrieri textuale din input vizual. Proiectul include un pipeline de antrenare accelerat pe GPU, capabil să distribuie sarcinile de lucru pe mai multe unități de procesare grafică prin distribuție multi-proces. Suportă generarea de descrieri atât pentru fișiere imagine statice, cât și pentru fluxuri video în timp real. Framework-ul include capabilități pentru fine-tuning-ul encoder-ului, eșantionarea textului prin beam search cu controlul temperaturii și utilizarea metricilor lingvistice standard din industrie pentru a evalua acuratețea și fluența descrierilor. De asemenea, oferă utilitare pentru preprocesarea seturilor de date, persistența checkpoint-urilor modelului și exportul predicțiilor în fișiere JSON structurate. Implementarea este furnizată sub formă de Jupyter Notebook.

    Implements a pipeline to convert raw image and text pairs into tensors for optimized model training.

    Jupyter Notebook
    Vezi pe GitHub↗5,588
  • open-mmlab/mmaction2Avatar open-mmlab

    open-mmlab/mmaction2

    5,066Vezi pe GitHub↗

    mmaction2 este un set de instrumente PyTorch pentru înțelegerea video, conceput pentru antrenarea și evaluarea modelelor de deep learning. Servește ca un framework pentru recunoașterea acțiunilor, localizarea temporală și detectarea acțiunilor spatio-temporale, oferind instrumente specializate atât pentru analiza video bazată pe pixeli, cât și pentru recunoașterea acțiunilor bazată pe schelet. Proiectul se distinge printr-o arhitectură modulară care dispune de descoperirea componentelor bazată pe registru și asamblarea ierarhică a modelelor bazată pe configurație. Suportă fuziunea caracteristicilor multi-modale, integrând cadre RGB, flux optic și audio, și include capabilități pentru recuperarea clipurilor video din text și predicția video zero-shot. În linii mari, framework-ul acoperă ingineria seturilor de date video, inclusiv standardizarea adnotărilor și eșantionarea cadrelor, precum și antrenarea și evaluarea cuprinzătoare a modelelor. Oferă utilitare pentru antrenarea distribuită, distilarea cunoștințelor și optimizarea inferenței prin reparametrizarea modelului. Codul sursă suportă exportul modelelor ONNX și containerizarea mediului pentru implementarea pe diferite noduri de calcul.

    Extracts and processes 3D and 2D skeletal pose information from video for pose-based recognition.

    Python
    Vezi pe GitHub↗5,066
  1. Home
  2. Data & Databases
  3. Text Processing Pipelines
  4. Multimodal Pre-Processing

Explorează sub-etichetele

  • Skeletal Pose Pre-processingPreprocessing pipelines specifically for extracting 2D and 3D skeletal joint information from video. **Distinct from Multimodal Pre-Processing:** Focuses on skeletal keypoints and pose data rather than general multimodal tensor conversion