12 repository-uri
Frameworks specifically designed to process and integrate multiple data modalities like text, image, and audio.
Distinct from AI Application Frameworks: Specializes AI application frameworks for multimodal data processing rather than general AI application development.
Explore 12 awesome GitHub repositories matching artificial intelligence & ml · Multimodal Frameworks. Refine with filters or upvote what's useful.
Jina is a cloud-native framework for building and deploying multimodal AI applications that process text, images, and audio across distributed microservices. It functions as an inference orchestrator and a distributed model gateway, providing a containerized stack to organize AI executors into operational pipelines. The system manages large language model workloads through token-streamed response delivery and dynamic batching to increase hardware throughput. It utilizes a protocol-agnostic communication layer to route data across different machine learning frameworks. The framework covers hi
Provides a cloud-native framework for building and deploying AI applications that integrate text, images, and audio across distributed microservices.
Janus is a multimodal large language model and unified framework that integrates visual understanding and image generation within a single neural network. It functions as both a visual understanding model for analyzing images and a text-to-image generator. The system uses a unified transformer backbone and a multimodal latent space to bridge the gap between text and visual data. This architecture employs decoupled visual encoding and cross-modal tokenization to separate the paths for discriminative understanding and generative tasks, representing images as grids of discrete codes. The projec
Provides a unified framework capable of both interpreting and synthesizing visual content.
NeMo is a multimodal AI framework and toolkit designed for the development, training, and scaling of large language models, generative AI systems, and speech-based models. It functions as an automatic speech recognition toolkit, a text-to-speech engine, and a framework for building models that process and generate combinations of text, image, and audio data. The project serves as a conversational AI orchestrator capable of managing real-time, interruptible voice interactions. It provides specialized workflows for speech translation, converting spoken audio from one language into text or speec
Provides a framework to build and manage models that process and generate combinations of text, image, and audio data.
LAVIS is a multimodal large language model framework and vision-language model library. It provides tools for training and evaluating models that integrate visual, textual, and audio data, serving as a cross-modal feature extractor and a zero-shot visual reasoning engine. The framework distinguishes itself by using frozen-backbone integration, where pretrained encoders remain non-trainable while lightweight adapter layers are updated. It employs cross-modal feature alignment to map different representations into a shared embedding space and utilizes a modular model wrapper to swap vision and
Provides a comprehensive framework for training and evaluating large language models that integrate visual, textual, and audio data.
Acest proiect este o bibliotecă și un framework de inferență pentru modele de limbaj mari, conceput pentru a rula modele pentru generarea de text, rezolvarea problemelor și asistența în programare. Include un framework multimodal pentru procesarea intrărilor combinate de imagine și text și o implementare de tip tool-use care permite execuția funcțiilor externe bazată pe raționamentul modelului. Sistemul dispune de un motor de inferență GPU distribuit care distribuie sarcinile de lucru ale modelelor mari pe mai multe procesoare grafice pentru a crește viteza de procesare și a îndeplini cerințele de memorie. De asemenea, oferă implementarea containerizată a modelelor prin imagini pre-pachetate și dependențe pentru servirea motoarelor de inferență în medii izolate. Biblioteca acoperă o gamă de capabilități, inclusiv analiza intrărilor multimodale, integrarea apelurilor de funcții și completarea codului (fill-in-the-middle) pentru prezicerea segmentelor de cod lipsă. De asemenea, suportă chat-ul interactiv cu modelul printr-o interfață în linie de comandă pentru menținerea sesiunilor conversaționale.
Ships a framework for processing combined image and text inputs to describe visual content and answer questions.
LMFlow is a comprehensive suite for large language model fine-tuning, context extension, multimodal processing, and inference execution. It provides a toolkit for updating model parameters through full tuning or memory-efficient adapter algorithms, alongside an inference engine for executing tuned models via command-line or web-based interfaces. The framework includes a dedicated alignment suite for supervised tuning and reward model training to refine model behavior. It features a context window extender to increase maximum input lengths and a multimodal framework for building chatbots that
Provides a framework for building chatbots that process combined image and text inputs.
MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a configuration-driven experiment system where model, dataset, and training parameters are defined through composable YAML files, alongside a curated model zoo of pretrained checkpoints for state-of-the-art multimodal architectures. The framework includes a multimodal dataset loader that downloads, processes, and batches vision-and-language data, and a vision-language model trainer supporting distributed training, mixed precision, and checkpoint-based resumption. The framework distinguish
Provides a modular framework for building and training vision-and-language models on multimodal datasets.
Nexent este un plan de control AI enterprise și o platformă de orchestrare a agenților LLM. Oferă un mediu zero-code pentru proiectarea, implementarea și gestionarea agenților AI de producție printr-un framework de colaborare multi-agent care coordonează agenți autonomi specializați folosind protocoale de mesagerie standardizate. Platforma integrează Model Context Protocol pentru a conecta agenții cu instrumente, plugin-uri și servicii externe printr-o interfață de comunicare universală. Se distinge în continuare printr-un manager dedicat de baze de cunoștințe RAG care importă documente nestructurate și utilizează căutarea hibridă pentru a oferi context fundamentat pentru răspunsurile modelului. Sistemul acoperă o gamă largă de capabilități, inclusiv controlul accesului multi-tenant bazat pe roluri, interacțiunea multimodală prin text, voce și imagini, și regăsirea vectorială hibridă. Include, de asemenea, o piață pentru distribuția și descoperirea agenților, alături de instrumente de observabilitate pentru capturarea urmelor de execuție. Platforma suportă deployment securizat prin împachetare offline containerizată pentru infrastructuri air-gapped.
Provides a framework for creating conversational interfaces that process and generate content across text, voice, and images.
LLaVA-NeXT este un framework de model de limbaj mare multimodal și un toolkit de antrenare conceput pentru a procesa imagini și secvențe video intercalate pentru a genera text. Funcționează ca un model de limbaj vizual care combină encoderele de viziune cu modelele de limbaj pentru a efectua raționamente complexe, răspunsuri la întrebări și înțelegerea video-ului. Sistemul este capabil să analizeze imagini de înaltă rezoluție și cadre video temporale pentru a descrie evenimente, a rezuma acțiuni și a raționa pe baza mai multor input-uri vizuale. Suportă interpretarea documentelor și a diagramelor, analiza spațială a mediului și generarea de subtitrări descriptive atât pentru imagini, cât și pentru video. Framework-ul include instrumente pentru ajustarea modelelor multimodale prin optimizarea preferințelor pentru a reduce halucinațiile și a îmbunătăți acuratețea. De asemenea, oferă un server de inferență pentru a implementa aceste capabilități ca serviciu API prin intermediul unui backend HTTP.
Provides a comprehensive framework for training and serving models that process interleaved image and video sequences.
Acest proiect este un framework de modele generative bazat pe PyTorch, conceput pentru a transforma zgomotul în distribuții complexe de date prin învățarea câmpurilor vectoriale și a căilor de probabilitate. Acesta servește drept toolkit multimodal pentru generarea de text și imagini sintetice prin fluxuri de probabilitate. Biblioteca se distinge prin suportul pentru integrări continue, discrete și pe varietăți Riemanniene. Acest lucru permite framework-ului să gestioneze o varietate de tipuri de date, inclusiv date categorice prin „discrete-state flow matching” și spații non-euclidiene prin integrare pe varietăți Riemanniene. Toolkit-ul acoperă întregul pipeline generativ, incluzând definirea căilor de probabilitate, regresia câmpurilor vectoriale și utilizarea solverelor de ecuații diferențiale pentru eșantionarea datelor. Aceste capabilități permit antrenarea și inferența modelelor generative capabile să creeze conținut sintetic pe mai multe modalități.
Supports the development of generative models that can process both text and image modalities.
Spark NLP este un toolkit pentru analiza scalabilă a textului și machine learning, construit pe framework-ul de calcul distribuit Apache Spark. Oferă un framework de machine learning multimodal și un sistem de pipeline distribuit pentru secvențierea adnotatoarelor în vederea procesării datelor lingvistice la scară largă. Biblioteca include un procesor de text de tip transformer pentru generarea de embedding-uri vectoriale contextuale și un motor de inferență dedicat pentru gestionarea modelelor de limbaj mari (LLM). Proiectul se distinge prin capacitatea sa de a procesa tipuri de date eterogene, inclusiv text, audio și imagini, într-o arhitectură unificată vision-language. Suportă capabilități avansate de AI generativ, cum ar fi prompt engineering, extracția structurată a entităților cu output JSON constrâns și inferența locală pentru a elimina latența rețelei. În plus, oferă instrumente pentru traducerea între limbi și clasificare zero-shot pe modalități de text și imagine. Framework-ul acoperă o gamă largă de capabilități, inclusiv antrenarea modelelor supervizate pentru recunoașterea entităților și analiza sentimentelor, precum și răspunsul extractiv la întrebări și sumarizarea documentelor. Integrează suport pentru baze de date vectoriale pentru căutarea de similaritate și oferă infrastructură pentru accelerare GPU și gestionarea ciclului de viață al modelelor printr-un registru centralizat. Toolkit-ul permite distribuirea modelelor și pipeline-urilor personalizate printr-un repository public și suportă implementarea modelelor prin API-uri REST.
Processes and classifies combined text, image, and audio data within a unified vision-language architecture.
LLamaSharp is a .NET LLM inference library and local runtime that enables the execution of large language models on CPU and GPU hardware. It serves as a multimodal AI library capable of processing both text and image inputs to generate analytical textual responses without relying on external APIs. The project distinguishes itself as a grammar-based text generator that enforces specific output formats, such as JSON, through constrained sampling pipelines. It also functions as a retrieval augmented generation framework integration, allowing the combination of local inference with external data
Provides a framework capable of processing both text and image inputs to generate analytical textual responses.