6 repository-uri
Combining visual and textual data into a shared embedding space for multimodal reasoning.
Distinguishing note: The candidates focus on visualizers or QA benchmarks, not the core architectural integration of vision and language modalities.
Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Visual-Language Multimodal Integration. Refine with filters or upvote what's useful.
Acest proiect oferă un framework fundamental și o implementare de referință pentru executarea modelării limbajului cauzal și a raționamentului multimodal pe sisteme locale. Include un set de componente de bază pentru gestionarea activelor modelului, un framework de fine-tuning și definițiile structurale necesare pentru a instanția arhitecturi bazate pe transformatoare. Sistemul se distinge prin capacitatea de a procesa intrări combinate de text și imagine prin modele transformatoare multimodale pentru raționament vizual și analiză de documente. De asemenea, suportă implementarea modelelor cuantizate, reducând amprenta de memorie prin tehnici de precizie scăzută pentru a permite inferența pe dispozitive edge. Proiectul acoperă domenii largi de capabilități, inclusiv fine-tuning supervizat și adaptare low-rank pentru personalizarea pe domeniu, precum și un manager de active cuprinzător pentru descărcarea, verificarea și organizarea ponderilor modelelor și a tokenizerelor. Funcționalitățile suplimentare includ generarea de text multilingv, procesarea contextului lung și ancorarea limbajului vizual (visual language grounding).
Integrates visual and textual data streams into a shared embedding space to enable cross-modal reasoning.
CogVLM is a multimodal large language model designed to integrate visual and textual data for reasoning about images and generating natural language. It functions as a visual question answering system that analyzes image content to provide detailed descriptions or answer specific questions. The project includes a visual grounding model capable of mapping text descriptions to precise bounding box coordinates within an image. It also features a vision-based automation agent that analyzes screen captures to generate execution plans and interaction coordinates for software interfaces. The system
Integrates visual features and text embeddings into a shared space for reasoning across image and language inputs.
nanoVLM este un framework de antrenare și un set de instrumente pentru modele mici de tip vision-language. Oferă un mediu bazat pe PyTorch pentru antrenarea și fine-tuning-ul modelelor, pentru a asocia intrările de imagine cu descrieri textuale și a genera răspunsuri în limbaj natural. Proiectul include un instrument de versionare a modelelor în cloud pentru salvarea și încărcarea ponderilor modelelor în repository-uri centralizate, pentru a sincroniza activele între medii. De asemenea, dispune de o suită dedicată de evaluare pentru a măsura acuratețea și fiabilitatea modelelor vision-language față de seturi de date standard. Framework-ul acoperă planificarea resurselor GPU prin măsurarea consumului VRAM și gestionează stabilitatea antrenării cu persistența stării bazată pe checkpoint-uri și gestionarea memoriei bazată pe batch-uri.
Integrates visual feature extractors with language models in a shared embedding space for multimodal processing.
This project is a multi-label classification pipeline designed for genre prediction. It implements a machine learning workflow that assigns multiple category labels to a single item by processing both textual and visual input data. The system utilizes multimodal feature extraction to transform images and text descriptions into semantic vectors. This process includes using pre-trained networks for visual feature extraction and semantic word averaging for text analysis, allowing the model to integrate different data types into a unified input. The pipeline covers the full machine learning life
Combines visual features from images and semantic vectors from text into a unified input for genre prediction.
Spark NLP este un toolkit pentru analiza scalabilă a textului și machine learning, construit pe framework-ul de calcul distribuit Apache Spark. Oferă un framework de machine learning multimodal și un sistem de pipeline distribuit pentru secvențierea adnotatoarelor în vederea procesării datelor lingvistice la scară largă. Biblioteca include un procesor de text de tip transformer pentru generarea de embedding-uri vectoriale contextuale și un motor de inferență dedicat pentru gestionarea modelelor de limbaj mari (LLM). Proiectul se distinge prin capacitatea sa de a procesa tipuri de date eterogene, inclusiv text, audio și imagini, într-o arhitectură unificată vision-language. Suportă capabilități avansate de AI generativ, cum ar fi prompt engineering, extracția structurată a entităților cu output JSON constrâns și inferența locală pentru a elimina latența rețelei. În plus, oferă instrumente pentru traducerea între limbi și clasificare zero-shot pe modalități de text și imagine. Framework-ul acoperă o gamă largă de capabilități, inclusiv antrenarea modelelor supervizate pentru recunoașterea entităților și analiza sentimentelor, precum și răspunsul extractiv la întrebări și sumarizarea documentelor. Integrează suport pentru baze de date vectoriale pentru căutarea de similaritate și oferă infrastructură pentru accelerare GPU și gestionarea ciclului de viață al modelelor printr-un registru centralizat. Toolkit-ul permite distribuirea modelelor și pipeline-urilor personalizate printr-un repository public și suportă implementarea modelelor prin API-uri REST.
Combines visual and textual data into a shared embedding space for image captioning and document reasoning.
ml-mgie is a multimodal machine learning framework and image editor designed for instruction-based image manipulation. It utilizes multimodal large language models to translate natural language prompts into precise visual modifications, functioning as a text-to-image editing model. The system is a research implementation focused on aligning visual imagination with textual commands. It employs a training process based on image-pair datasets and descriptive instructions to learn how to execute complex visual edits. The framework covers capabilities in AI-powered visual content creation, includ
Integrates visual and textual encoders to interpret editing instructions and generate modification parameters.