awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 repositorios

Awesome GitHub RepositoriesJoint Embedding Spaces

Mathematical spaces where different data modalities are mapped to a common coordinate system for direct comparison.

Distinguishing note: Existing candidates focus on object detection or UI coordinates, not general multi-modal alignment.

Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Joint Embedding Spaces. Refine with filters or upvote what's useful.

Awesome Joint Embedding Spaces GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • jina-ai/clip-as-serviceAvatar de jina-ai

    jina-ai/clip-as-service

    12,829Ver en GitHub↗

    Clip-as-service is a deployable framework for generating multi-modal embeddings and executing neural searches. It provides a vector embedding server and a CLIP embedding API to convert images and text into shared vector representations via network interfaces. The system functions as a multi-modal ranking system and neural search engine, enabling the retrieval of images through text queries or the identification of matching text descriptions for images. It also includes a visual reasoning service used to analyze images and verify object presence, counts, and colors by comparing visual data aga

    Maps different data types to the same coordinate system for direct comparison across modalities.

    Python
    Ver en GitHub↗12,829
  • hanxiao/bert-as-serviceAvatar de hanxiao

    hanxiao/bert-as-service

    12,831Ver en GitHub↗

    Este proyecto es un servicio de incrustación BERT de alto rendimiento y servidor de inferencia diseñado para mapear secuencias de texto en vectores numéricos de longitud fija. Funciona como un microservicio de aprendizaje automático y servidor de modelos distribuido que desacopla el manejo de solicitudes de la computación pesada. El sistema utiliza una infraestructura de mensajería ZeroMQ para proporcionar comunicación de baja latencia entre clientes distribuidos y el servidor de inferencia. Incorpora procesamiento por lotes del lado del servidor y escalado de carga de trabajo de GPU para maximizar la utilización del hardware y gestionar grandes volúmenes de solicitudes. La plataforma admite infraestructura de búsqueda semántica generando incrustaciones intermodales tanto para texto como para imágenes dentro de un espacio vectorial compartido. Esto permite la búsqueda intermodal, la clasificación de relevancia de contenido y la re-clasificación de resultados basada en la alineación semántica entre el contenido visual y las descripciones de texto. El servicio se puede implementar como un microservicio elástico accesible a través de protocolos gRPC, HTTP o WebSocket, con streaming dúplex sin bloqueo para manejar grandes conjuntos de datos.

    Implements a shared mathematical space where text and image modalities are mapped for direct semantic comparison.

    Python
    Ver en GitHub↗12,831
  • facebookresearch/imagebindAvatar de facebookresearch

    facebookresearch/ImageBind

    9,036Ver en GitHub↗

    ImageBind is a multi-modal embedding model and joint representation learner that maps images, text, audio, and other modalities into a single shared vector space. It functions as a cross-modal retrieval framework designed to bind multiple sensory inputs into one cohesive mathematical embedding. The system uses a contrastive learning architecture to align disparate data types by maximizing the similarity between related samples. This allows the model to perform zero-shot multimodal classification and execute cross-modal data retrieval, such as locating visual content via natural language descr

    Maps multiple data modalities into a joint embedding space for direct mathematical comparison.

    Python
    Ver en GitHub↗9,036
  • meta-llama/llama-modelsAvatar de meta-llama

    meta-llama/llama-models

    7,643Ver en GitHub↗

    Este proyecto proporciona un framework fundamental y una implementación de referencia para ejecutar modelos de lenguaje causales y razonamiento multimodal en sistemas locales. Incluye un conjunto de componentes básicos para gestionar activos de modelos, un framework de ajuste fino (fine-tuning) y las definiciones estructurales necesarias para instanciar arquitecturas basadas en transformers. El sistema se distingue por su capacidad para procesar entradas combinadas de texto e imagen a través de modelos transformer multimodales para el razonamiento visual y el análisis de documentos. También admite el despliegue de modelos cuantizados, reduciendo el uso de memoria mediante técnicas de baja precisión para permitir la inferencia en dispositivos de borde (edge devices). El proyecto cubre áreas de capacidad amplias, incluyendo el ajuste fino supervisado y la adaptación de bajo rango (LoRA) para la personalización de dominios, así como un gestor de activos integral para descargar, verificar y organizar pesos de modelos y tokenizadores. La funcionalidad adicional abarca la generación de texto multilingüe, el procesamiento de contextos largos y el grounding de lenguaje visual.

    Maps text and images into a unified vector space to enable joint reasoning and analysis.

    Python
    Ver en GitHub↗7,643
  • facebookresearch/vjepa2Avatar de facebookresearch

    facebookresearch/vjepa2

    3,021Ver en GitHub↗

    vjepa2 is a joint-embedding predictive architecture and video self-supervised learning framework. It functions as a visual representation learner and a robotic manipulation model designed to learn representations by predicting future latent states without reconstructing pixels. The system enables the pretraining of video encoders that learn temporally consistent features through masked-token prediction and multi-modal tokenization. It further maps these latent embeddings to specific physical movements via action-conditioned post-training to plan and execute robot arm grasping and picking task

    Implements a joint-embedding architecture that maps different views of video data into a common coordinate system.

    Python
    Ver en GitHub↗3,021
  1. Home
  2. Artificial Intelligence & ML
  3. Joint Embedding Spaces