10 repository-uri
Neural networks that map multiple data modalities into a single shared vector space.
Distinct from Multi-Modal Tokenizers: Focuses on the complete embedding model rather than just the tokenization process
Explore 10 awesome GitHub repositories matching artificial intelligence & ml · Multi-Modal Embedding Models. Refine with filters or upvote what's useful.
ImageBind is a multi-modal embedding model and joint representation learner that maps images, text, audio, and other modalities into a single shared vector space. It functions as a cross-modal retrieval framework designed to bind multiple sensory inputs into one cohesive mathematical embedding. The system uses a contrastive learning architecture to align disparate data types by maximizing the similarity between related samples. This allows the model to perform zero-shot multimodal classification and execute cross-modal data retrieval, such as locating visual content via natural language descr
Maps images, text, audio, and other modalities into a single shared vector space using a neural network.
This repository provides a collection of reference implementations and code examples for training and deploying machine learning models using the MLX framework. It serves as a practical guide for executing distributed training, fine-tuning large language models, converting model weights, and implementing multimodal generative workflows. The project distinguishes itself through specialized examples for local hardware execution, featuring weight quantization to reduce memory usage and low-rank adaptation for parameter-efficient fine-tuning. It also includes scripts for transforming external mod
Implements neural networks that map images and text into a shared vector space for joint retrieval.
lmdeploy is a high-performance inference engine and deployment framework for large language models and vision models. It functions as a multi-modal model server and compression toolkit designed to serve models with high throughput and low latency. The system enables the distribution of model services across multiple machines using request-based load balancing and tensor parallelism. It includes specialized tools for model quantization and compression to reduce the memory footprint of weights and caches. The framework covers broad capability areas including production deployment, distributed
Coordinates the flow of image and text data through distinct encoders before processing them in a unified transformer.
GLM-4 is a large language model and fine-tuning framework designed for human-like text production, complex reasoning, and multilingual conversation. It functions as a multimodal system capable of processing high-resolution visual content and as a long-context model designed to analyze documents with a context window of up to one million tokens. The project differentiates itself through a function calling interface that enables AI agent development by connecting the model to external APIs and real-time web browsing. It includes specialized capabilities for generating functional programming cod
Integrates high-resolution visual features into a shared vector space for joint visual and linguistic reasoning.
Gemma este o familie de modele lingvistice mari cu open-weights, bazate pe o arhitectură transformer decoder-only. Aceste modele sunt concepute pentru generarea de text și conversații multimodale, capabile să proceseze și să genereze răspunsuri bazate atât pe secvențe de input textuale, cât și vizuale. Proiectul oferă un model AI fine-tunable care suportă ajustarea ponderilor și adaptarea low-rank pentru a specializa performanța pentru sarcini particulare. Include suport pentru ponderi cuantizate pentru a reduce utilizarea memoriei și a crește viteza de inferență pe hardware limitat. Suprafața de capabilități acoperă integrarea AI multimodală, optimizarea memoriei prin sharding-ul parametrilor și integrarea instrumentelor și API-urilor externe pentru a prelua date în timp real. De asemenea, permite generarea de imagini din text și eșantionarea output-urilor de text structurat.
Integrates visual and textual data by mapping different input modalities into a shared latent space for joint processing.
DeepSeek-VL2 este un model de limbaj mare multimodal și un sistem vision-language conceput pentru a analiza scene vizuale și a genera text descriptiv. Funcționează ca un model de visual question answering și visual grounding, capabil să extragă informații din documente și să localizeze obiecte sau regiuni specifice în imagini pe baza descrierilor textuale. Proiectul utilizează o arhitectură mixture-of-experts pentru a procesa intrări combinate de imagine și text. Este optimizat pentru inferență prin prefilling incremental, ceea ce reduce cerințele de memorie GPU pe hardware. Modelul acoperă analiza datelor multimodale și înțelegerea documentelor vizuale, inclusiv interpretarea graficelor și a layout-urilor. Efectuează inferență vizuală și grounding pentru a potrivi interogările textuale cu conținutul vizual corespondent.
Implements cross-attention mechanisms to align visual regions with specific text tokens.
LightGlue is a deep learning framework designed for local feature matching and high-speed correspondence estimation between pairs of images. It functions as a computer vision matching model that identifies corresponding keypoints across different viewpoints. The system utilizes an adaptive neural network architecture that dynamically optimizes inference speed by pruning its own depth and width based on the input image pairs. This approach employs a transformer-style attention mechanism and cross-image attention to compute correlations between feature descriptors. The matching process include
Employs cross-attention mechanisms to compute correlations between feature descriptors of two different images.
sam-hq este o colecție de modele fundamentale de viziune pre-antrenate și adaptoare concepute pentru segmentarea imaginilor de înaltă calitate, extracția de caracteristici multimodale și estimarea adâncimii. Oferă un model de viziune zero-shot capabil să efectueze segmentare și clasificare în domenii diverse fără a necesita antrenament specific sarcinii. Proiectul include un instrument de segmentare a imaginilor de înaltă calitate bazat pe Segment Anything Model care generează măști precise din prompt-uri spațiale. Include un extractor de caracteristici multimodale pentru a genera embedding-uri vectoriale de înaltă dimensiune atât din input-uri de imagine, cât și de text, precum și un instrument convoluțional pentru prezicerea distanței sau a înălțimii coronamentului din date vizuale. Framework-ul acoperă o gamă largă de capabilități de computer vision, inclusiv clasificarea imaginilor, extracția de caracteristici multi-rezoluție și preprocesarea imaginilor. Suportă adaptarea la domeniu prin fine-tuning pe seturi de date personalizate pentru aplicații specializate precum imagistica medicală și teledetecția. Decoderul de măști poate fi convertit într-un format deschis pentru execuție în medii cu un runtime standard.
Provides a multimodal embedding model that maps image and text data into a shared vector space.
VisualGLM-6B este un model de limbaj multimodal bilingv și model viziune-limbaj conceput pentru sarcini conversaționale și înțelegere vizuală. Funcționează ca un model AI bilingv capabil să proceseze și să genereze răspunsuri atât în chineză, cât și în engleză. Sistemul este un model de limbaj mare cuantizat care suportă precizie pe 4 și 8 biți pentru a reduce utilizarea memoriei și cerințele hardware în timpul implementării locale. Este, de asemenea, un model de fine-tuning eficient din punct de vedere al parametrilor, permițând ajustări ale ponderilor pentru a adapta sistemul la sarcini specifice fără a fi nevoie de o reantrenare completă. Proiectul acoperă AI conversațional multimodal și dialog bazat pe imagini, permițând analiza conținutului vizual pentru a efectua sarcini de înțelegere vizuală în mai multe limbi. Capabilitățile sale includ cuantizarea preciziei modelului și fine-tuning specific domeniului pentru aplicații specializate.
Provides a mechanism to transform visual tokens into a sequence the language model can process as words.
Multimodal is a machine learning library built on PyTorch for training large-scale models that combine text, image, audio, and video data streams. It functions as a deep learning framework dedicated to generative diffusion models, multi-task training, and vision-language tasks. The library supplies modular building blocks, discrete latent codebook quantization, shared-space embeddings, and stackable adapter layers to handle diverse conditional inputs during training and inference. The framework supports specific architectures for diffusion models, text-to-video generation, image-text retrieva
Projects different data modalities into a joint vector space to compute similarity scores for cross-modal retrieval tasks.