awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 dépôts

Awesome GitHub RepositoriesJoint Embedding Spaces

Mathematical spaces where different data modalities are mapped to a common coordinate system for direct comparison.

Distinguishing note: Existing candidates focus on object detection or UI coordinates, not general multi-modal alignment.

Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Joint Embedding Spaces. Refine with filters or upvote what's useful.

Awesome Joint Embedding Spaces GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • jina-ai/clip-as-serviceAvatar de jina-ai

    jina-ai/clip-as-service

    12,829Voir sur GitHub↗

    Clip-as-service is a deployable framework for generating multi-modal embeddings and executing neural searches. It provides a vector embedding server and a CLIP embedding API to convert images and text into shared vector representations via network interfaces. The system functions as a multi-modal ranking system and neural search engine, enabling the retrieval of images through text queries or the identification of matching text descriptions for images. It also includes a visual reasoning service used to analyze images and verify object presence, counts, and colors by comparing visual data aga

    Maps different data types to the same coordinate system for direct comparison across modalities.

    Python
    Voir sur GitHub↗12,829
  • hanxiao/bert-as-serviceAvatar de hanxiao

    hanxiao/bert-as-service

    12,831Voir sur GitHub↗

    Ce projet est un service d'intégration BERT haute performance et un serveur d'inférence conçu pour mapper des séquences de texte en vecteurs numériques de longueur fixe. Il fonctionne comme un microservice d'apprentissage automatique et un serveur de modèle distribué qui découple la gestion des requêtes du calcul lourd. Le système utilise une infrastructure de messagerie ZeroMQ pour fournir une communication à faible latence entre les clients distribués et le serveur d'inférence. Il incorpore le traitement par lots côté serveur et la mise à l'échelle de la charge de travail GPU pour maximiser l'utilisation du matériel et gérer des volumes de requêtes élevés. La plateforme prend en charge l'infrastructure de recherche sémantique en générant des intégrations transmodales pour le texte et les images au sein d'un espace vectoriel partagé. Cela permet la recherche transmodale, le classement de la pertinence du contenu et le reclassement des résultats basés sur l'alignement sémantique entre le contenu visuel et les descriptions textuelles. Le service peut être déployé en tant que microservice élastique accessible via les protocoles gRPC, HTTP ou WebSocket, avec un streaming duplex non bloquant pour gérer de grands ensembles de données.

    Implements a shared mathematical space where text and image modalities are mapped for direct semantic comparison.

    Python
    Voir sur GitHub↗12,831
  • facebookresearch/imagebindAvatar de facebookresearch

    facebookresearch/ImageBind

    9,036Voir sur GitHub↗

    ImageBind is a multi-modal embedding model and joint representation learner that maps images, text, audio, and other modalities into a single shared vector space. It functions as a cross-modal retrieval framework designed to bind multiple sensory inputs into one cohesive mathematical embedding. The system uses a contrastive learning architecture to align disparate data types by maximizing the similarity between related samples. This allows the model to perform zero-shot multimodal classification and execute cross-modal data retrieval, such as locating visual content via natural language descr

    Maps multiple data modalities into a joint embedding space for direct mathematical comparison.

    Python
    Voir sur GitHub↗9,036
  • meta-llama/llama-modelsAvatar de meta-llama

    meta-llama/llama-models

    7,643Voir sur GitHub↗

    Ce projet fournit un framework fondamental et une implémentation de référence pour exécuter la modélisation causale du langage et le raisonnement multimodal sur des systèmes locaux. Il inclut un ensemble de composants de base pour gérer les actifs de modèles, un framework de fine-tuning et les définitions structurelles nécessaires pour instancier des architectures basées sur des transformers. Le système se distingue par sa capacité à traiter des entrées combinées de texte et d'image via des modèles transformers multimodaux pour le raisonnement visuel et l'analyse de documents. Il prend également en charge le déploiement de modèles quantifiés, réduisant l'empreinte mémoire grâce à des techniques de basse précision pour permettre l'inférence sur des appareils en périphérie (edge devices). Le projet couvre de larges domaines de capacités, incluant le fine-tuning supervisé et l'adaptation de bas rang (LoRA) pour la personnalisation de domaine, ainsi qu'un gestionnaire d'actifs complet pour télécharger, vérifier et organiser les poids des modèles et les tokenizers. Des fonctionnalités supplémentaires englobent la génération de texte multilingue, le traitement de contexte long et l'ancrage visuel du langage.

    Maps text and images into a unified vector space to enable joint reasoning and analysis.

    Python
    Voir sur GitHub↗7,643
  • facebookresearch/vjepa2Avatar de facebookresearch

    facebookresearch/vjepa2

    3,021Voir sur GitHub↗

    vjepa2 is a joint-embedding predictive architecture and video self-supervised learning framework. It functions as a visual representation learner and a robotic manipulation model designed to learn representations by predicting future latent states without reconstructing pixels. The system enables the pretraining of video encoders that learn temporally consistent features through masked-token prediction and multi-modal tokenization. It further maps these latent embeddings to specific physical movements via action-conditioned post-training to plan and execute robot arm grasping and picking task

    Implements a joint-embedding architecture that maps different views of video data into a common coordinate system.

    Python
    Voir sur GitHub↗3,021
  1. Home
  2. Artificial Intelligence & ML
  3. Joint Embedding Spaces