5 repositorios
Mathematical spaces where different data modalities are mapped to a common coordinate system for direct comparison.
Distinguishing note: Existing candidates focus on object detection or UI coordinates, not general multi-modal alignment.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Joint Embedding Spaces. Refine with filters or upvote what's useful.
Clip-as-service is a deployable framework for generating multi-modal embeddings and executing neural searches. It provides a vector embedding server and a CLIP embedding API to convert images and text into shared vector representations via network interfaces. The system functions as a multi-modal ranking system and neural search engine, enabling the retrieval of images through text queries or the identification of matching text descriptions for images. It also includes a visual reasoning service used to analyze images and verify object presence, counts, and colors by comparing visual data aga
Maps different data types to the same coordinate system for direct comparison across modalities.
Este proyecto es un servicio de incrustación BERT de alto rendimiento y servidor de inferencia diseñado para mapear secuencias de texto en vectores numéricos de longitud fija. Funciona como un microservicio de aprendizaje automático y servidor de modelos distribuido que desacopla el manejo de solicitudes de la computación pesada. El sistema utiliza una infraestructura de mensajería ZeroMQ para proporcionar comunicación de baja latencia entre clientes distribuidos y el servidor de inferencia. Incorpora procesamiento por lotes del lado del servidor y escalado de carga de trabajo de GPU para maximizar la utilización del hardware y gestionar grandes volúmenes de solicitudes. La plataforma admite infraestructura de búsqueda semántica generando incrustaciones intermodales tanto para texto como para imágenes dentro de un espacio vectorial compartido. Esto permite la búsqueda intermodal, la clasificación de relevancia de contenido y la re-clasificación de resultados basada en la alineación semántica entre el contenido visual y las descripciones de texto. El servicio se puede implementar como un microservicio elástico accesible a través de protocolos gRPC, HTTP o WebSocket, con streaming dúplex sin bloqueo para manejar grandes conjuntos de datos.
Implements a shared mathematical space where text and image modalities are mapped for direct semantic comparison.
ImageBind is a multi-modal embedding model and joint representation learner that maps images, text, audio, and other modalities into a single shared vector space. It functions as a cross-modal retrieval framework designed to bind multiple sensory inputs into one cohesive mathematical embedding. The system uses a contrastive learning architecture to align disparate data types by maximizing the similarity between related samples. This allows the model to perform zero-shot multimodal classification and execute cross-modal data retrieval, such as locating visual content via natural language descr
Maps multiple data modalities into a joint embedding space for direct mathematical comparison.
Este proyecto proporciona un framework fundamental y una implementación de referencia para ejecutar modelos de lenguaje causales y razonamiento multimodal en sistemas locales. Incluye un conjunto de componentes básicos para gestionar activos de modelos, un framework de ajuste fino (fine-tuning) y las definiciones estructurales necesarias para instanciar arquitecturas basadas en transformers. El sistema se distingue por su capacidad para procesar entradas combinadas de texto e imagen a través de modelos transformer multimodales para el razonamiento visual y el análisis de documentos. También admite el despliegue de modelos cuantizados, reduciendo el uso de memoria mediante técnicas de baja precisión para permitir la inferencia en dispositivos de borde (edge devices). El proyecto cubre áreas de capacidad amplias, incluyendo el ajuste fino supervisado y la adaptación de bajo rango (LoRA) para la personalización de dominios, así como un gestor de activos integral para descargar, verificar y organizar pesos de modelos y tokenizadores. La funcionalidad adicional abarca la generación de texto multilingüe, el procesamiento de contextos largos y el grounding de lenguaje visual.
Maps text and images into a unified vector space to enable joint reasoning and analysis.
vjepa2 is a joint-embedding predictive architecture and video self-supervised learning framework. It functions as a visual representation learner and a robotic manipulation model designed to learn representations by predicting future latent states without reconstructing pixels. The system enables the pretraining of video encoders that learn temporally consistent features through masked-token prediction and multi-modal tokenization. It further maps these latent embeddings to specific physical movements via action-conditioned post-training to plan and execute robot arm grasping and picking task
Implements a joint-embedding architecture that maps different views of video data into a common coordinate system.