awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 dépôts

Awesome GitHub RepositoriesMultimodal Pre-Processing

Pipelines that convert various data types like text, images, and audio into tensors.

Distinct from Text Processing Pipelines: Expands beyond text-only processing to include image and audio feature extraction pipelines.

Explore 3 awesome GitHub repositories matching data & databases · Multimodal Pre-Processing. Refine with filters or upvote what's useful.

Awesome Multimodal Pre-Processing GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • xenova/transformers.jsAvatar de xenova

    xenova/transformers.js

    16,141Voir sur GitHub↗

    Transformers.js is a JavaScript library and web machine learning framework designed to run pretrained transformer models directly in the browser. It serves as a client-side inference engine and a wrapper for the ONNX Runtime, enabling the execution of multimodal AI tasks on user devices without the need for a backend server. The library distinguishes itself by providing a unified toolkit for processing text, image, and audio data locally. This architecture supports privacy-preserving model inference and reduces latency by performing all computations on the client's hardware. Its capabilities

    Implements structured tokenizers and feature extractors to convert raw multimodal input into numerical tensors.

    JavaScript
    Voir sur GitHub↗16,141
  • karpathy/neuraltalk2Avatar de karpathy

    karpathy/neuraltalk2

    5,588Voir sur GitHub↗

    Neuraltalk2 est un système de vision par apprentissage profond conçu pour la génération automatique de légendes d'images. Construit avec PyTorch, il utilise une architecture hybride qui combine un encodeur de réseau neuronal convolutif avec un décodeur de réseau neuronal récurrent pour générer des descriptions textuelles à partir d'entrées visuelles. Le projet propose un pipeline d'entraînement accéléré par GPU capable de distribuer les charges de travail sur plusieurs unités de traitement graphique via une distribution multi-processus. Il prend en charge la génération de descriptions pour des fichiers d'images statiques et des flux vidéo en temps réel. Le framework inclut des capacités pour le réglage fin de l'encodeur, l'échantillonnage de texte par recherche en faisceau (beam search) avec contrôle de température, et l'utilisation de métriques linguistiques standard de l'industrie pour évaluer la précision et la fluidité des légendes. Il fournit également des utilitaires pour le prétraitement des jeux de données, la persistance des points de contrôle du modèle et l'exportation des prédictions dans des fichiers JSON structurés. L'implémentation est fournie sous forme de Jupyter Notebook.

    Implements a pipeline to convert raw image and text pairs into tensors for optimized model training.

    Jupyter Notebook
    Voir sur GitHub↗5,588
  • open-mmlab/mmaction2Avatar de open-mmlab

    open-mmlab/mmaction2

    5,066Voir sur GitHub↗

    mmaction2 est un toolkit de compréhension vidéo PyTorch conçu pour entraîner et évaluer des modèles de deep learning. Il sert de framework pour la reconnaissance d'action, la localisation temporelle et la détection d'action spatio-temporelle, fournissant des outils spécialisés pour l'analyse vidéo basée sur les pixels et la reconnaissance d'action basée sur le squelette. Le projet se distingue par une architecture modulaire présentant une découverte de composants basée sur un registre et un assemblage de modèles hiérarchique piloté par configuration. Il supporte la fusion de caractéristiques multi-modales, intégrant des frames RGB, le flux optique et l'audio, et inclut des capacités pour la récupération de clips vidéo par texte et la prédiction vidéo zero-shot. Globalement, le framework couvre l'ingénierie de jeux de données vidéo, incluant la standardisation des annotations et l'échantillonnage de frames, ainsi que l'entraînement et l'évaluation complets des modèles. Il fournit des utilitaires pour l'entraînement distribué, la distillation de connaissances et l'optimisation de l'inférence via la reparamétrisation de modèles. La base de code supporte l'export de modèles ONNX et la conteneurisation de l'environnement pour le déploiement à travers différents nœuds de calcul.

    Extracts and processes 3D and 2D skeletal pose information from video for pose-based recognition.

    Python
    Voir sur GitHub↗5,066
  1. Home
  2. Data & Databases
  3. Text Processing Pipelines
  4. Multimodal Pre-Processing

Explorer les sous-tags

  • Skeletal Pose Pre-processingPreprocessing pipelines specifically for extracting 2D and 3D skeletal joint information from video. **Distinct from Multimodal Pre-Processing:** Focuses on skeletal keypoints and pose data rather than general multimodal tensor conversion