awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

12 repository-uri

Awesome GitHub RepositoriesMultimodal Frameworks

Frameworks specifically designed to process and integrate multiple data modalities like text, image, and audio.

Distinct from AI Application Frameworks: Specializes AI application frameworks for multimodal data processing rather than general AI application development.

Explore 12 awesome GitHub repositories matching artificial intelligence & ml · Multimodal Frameworks. Refine with filters or upvote what's useful.

Awesome Multimodal Frameworks GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • jina-ai/jinaAvatar jina-ai

    jina-ai/jina

    21,858Vezi pe GitHub↗

    Jina is a cloud-native framework for building and deploying multimodal AI applications that process text, images, and audio across distributed microservices. It functions as an inference orchestrator and a distributed model gateway, providing a containerized stack to organize AI executors into operational pipelines. The system manages large language model workloads through token-streamed response delivery and dynamic batching to increase hardware throughput. It utilizes a protocol-agnostic communication layer to route data across different machine learning frameworks. The framework covers hi

    Provides a cloud-native framework for building and deploying AI applications that integrate text, images, and audio across distributed microservices.

    Python
    Vezi pe GitHub↗21,858
  • deepseek-ai/janusAvatar deepseek-ai

    deepseek-ai/Janus

    17,746Vezi pe GitHub↗

    Janus is a multimodal large language model and unified framework that integrates visual understanding and image generation within a single neural network. It functions as both a visual understanding model for analyzing images and a text-to-image generator. The system uses a unified transformer backbone and a multimodal latent space to bridge the gap between text and visual data. This architecture employs decoupled visual encoding and cross-modal tokenization to separate the paths for discriminative understanding and generative tasks, representing images as grids of discrete codes. The projec

    Provides a unified framework capable of both interpreting and synthesizing visual content.

    Pythonany-to-anyfoundation-modelsllm
    Vezi pe GitHub↗17,746
  • nvidia/nemoAvatar NVIDIA

    NVIDIA/NeMo

    17,394Vezi pe GitHub↗

    NeMo is a multimodal AI framework and toolkit designed for the development, training, and scaling of large language models, generative AI systems, and speech-based models. It functions as an automatic speech recognition toolkit, a text-to-speech engine, and a framework for building models that process and generate combinations of text, image, and audio data. The project serves as a conversational AI orchestrator capable of managing real-time, interruptible voice interactions. It provides specialized workflows for speech translation, converting spoken audio from one language into text or speec

    Provides a framework to build and manage models that process and generate combinations of text, image, and audio data.

    Python
    Vezi pe GitHub↗17,394
  • salesforce/lavisAvatar salesforce

    salesforce/LAVIS

    11,236Vezi pe GitHub↗

    LAVIS is a multimodal large language model framework and vision-language model library. It provides tools for training and evaluating models that integrate visual, textual, and audio data, serving as a cross-modal feature extractor and a zero-shot visual reasoning engine. The framework distinguishes itself by using frozen-backbone integration, where pretrained encoders remain non-trainable while lightweight adapter layers are updated. It employs cross-modal feature alignment to map different representations into a shared embedding space and utilizes a modular model wrapper to swap vision and

    Provides a comprehensive framework for training and evaluating large language models that integrate visual, textual, and audio data.

    Jupyter Notebook
    Vezi pe GitHub↗11,236
  • mistralai/mistral-srcAvatar mistralai

    mistralai/mistral-src

    10,821Vezi pe GitHub↗

    Acest proiect este o bibliotecă și un framework de inferență pentru modele de limbaj mari, conceput pentru a rula modele pentru generarea de text, rezolvarea problemelor și asistența în programare. Include un framework multimodal pentru procesarea intrărilor combinate de imagine și text și o implementare de tip tool-use care permite execuția funcțiilor externe bazată pe raționamentul modelului. Sistemul dispune de un motor de inferență GPU distribuit care distribuie sarcinile de lucru ale modelelor mari pe mai multe procesoare grafice pentru a crește viteza de procesare și a îndeplini cerințele de memorie. De asemenea, oferă implementarea containerizată a modelelor prin imagini pre-pachetate și dependențe pentru servirea motoarelor de inferență în medii izolate. Biblioteca acoperă o gamă de capabilități, inclusiv analiza intrărilor multimodale, integrarea apelurilor de funcții și completarea codului (fill-in-the-middle) pentru prezicerea segmentelor de cod lipsă. De asemenea, suportă chat-ul interactiv cu modelul printr-o interfață în linie de comandă pentru menținerea sesiunilor conversaționale.

    Ships a framework for processing combined image and text inputs to describe visual content and answer questions.

    Jupyter Notebook
    Vezi pe GitHub↗10,821
  • optimalscale/lmflowAvatar OptimalScale

    OptimalScale/LMFlow

    8,488Vezi pe GitHub↗

    LMFlow is a comprehensive suite for large language model fine-tuning, context extension, multimodal processing, and inference execution. It provides a toolkit for updating model parameters through full tuning or memory-efficient adapter algorithms, alongside an inference engine for executing tuned models via command-line or web-based interfaces. The framework includes a dedicated alignment suite for supervised tuning and reward model training to refine model behavior. It features a context window extender to increase maximum input lengths and a multimodal framework for building chatbots that

    Provides a framework for building chatbots that process combined image and text inputs.

    Pythonchatgptdeep-learninginstruction-following
    Vezi pe GitHub↗8,488
  • facebookresearch/mmfAvatar facebookresearch

    facebookresearch/mmf

    5,635Vezi pe GitHub↗

    MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a configuration-driven experiment system where model, dataset, and training parameters are defined through composable YAML files, alongside a curated model zoo of pretrained checkpoints for state-of-the-art multimodal architectures. The framework includes a multimodal dataset loader that downloads, processes, and batches vision-and-language data, and a vision-language model trainer supporting distributed training, mixed precision, and checkpoint-based resumption. The framework distinguish

    Provides a modular framework for building and training vision-and-language models on multimodal datasets.

    Pythoncaptioningdeep-learningdialog
    Vezi pe GitHub↗5,635
  • modelengine-group/nexentAvatar ModelEngine-Group

    ModelEngine-Group/nexent

    5,265Vezi pe GitHub↗

    Nexent este un plan de control AI enterprise și o platformă de orchestrare a agenților LLM. Oferă un mediu zero-code pentru proiectarea, implementarea și gestionarea agenților AI de producție printr-un framework de colaborare multi-agent care coordonează agenți autonomi specializați folosind protocoale de mesagerie standardizate. Platforma integrează Model Context Protocol pentru a conecta agenții cu instrumente, plugin-uri și servicii externe printr-o interfață de comunicare universală. Se distinge în continuare printr-un manager dedicat de baze de cunoștințe RAG care importă documente nestructurate și utilizează căutarea hibridă pentru a oferi context fundamentat pentru răspunsurile modelului. Sistemul acoperă o gamă largă de capabilități, inclusiv controlul accesului multi-tenant bazat pe roluri, interacțiunea multimodală prin text, voce și imagini, și regăsirea vectorială hibridă. Include, de asemenea, o piață pentru distribuția și descoperirea agenților, alături de instrumente de observabilitate pentru capturarea urmelor de execuție. Platforma suportă deployment securizat prin împachetare offline containerizată pentru infrastructuri air-gapped.

    Provides a framework for creating conversational interfaces that process and generate content across text, voice, and images.

    Pythonagentagentic-aiagentic-framework
    Vezi pe GitHub↗5,265
  • llava-vl/llava-nextAvatar LLaVA-VL

    LLaVA-VL/LLaVA-NeXT

    4,695Vezi pe GitHub↗

    LLaVA-NeXT este un framework de model de limbaj mare multimodal și un toolkit de antrenare conceput pentru a procesa imagini și secvențe video intercalate pentru a genera text. Funcționează ca un model de limbaj vizual care combină encoderele de viziune cu modelele de limbaj pentru a efectua raționamente complexe, răspunsuri la întrebări și înțelegerea video-ului. Sistemul este capabil să analizeze imagini de înaltă rezoluție și cadre video temporale pentru a descrie evenimente, a rezuma acțiuni și a raționa pe baza mai multor input-uri vizuale. Suportă interpretarea documentelor și a diagramelor, analiza spațială a mediului și generarea de subtitrări descriptive atât pentru imagini, cât și pentru video. Framework-ul include instrumente pentru ajustarea modelelor multimodale prin optimizarea preferințelor pentru a reduce halucinațiile și a îmbunătăți acuratețea. De asemenea, oferă un server de inferență pentru a implementa aceste capabilități ca serviciu API prin intermediul unui backend HTTP.

    Provides a comprehensive framework for training and serving models that process interleaved image and video sequences.

    Python
    Vezi pe GitHub↗4,695
  • facebookresearch/flow_matchingAvatar facebookresearch

    facebookresearch/flow_matching

    4,562Vezi pe GitHub↗

    Acest proiect este un framework de modele generative bazat pe PyTorch, conceput pentru a transforma zgomotul în distribuții complexe de date prin învățarea câmpurilor vectoriale și a căilor de probabilitate. Acesta servește drept toolkit multimodal pentru generarea de text și imagini sintetice prin fluxuri de probabilitate. Biblioteca se distinge prin suportul pentru integrări continue, discrete și pe varietăți Riemanniene. Acest lucru permite framework-ului să gestioneze o varietate de tipuri de date, inclusiv date categorice prin „discrete-state flow matching” și spații non-euclidiene prin integrare pe varietăți Riemanniene. Toolkit-ul acoperă întregul pipeline generativ, incluzând definirea căilor de probabilitate, regresia câmpurilor vectoriale și utilizarea solverelor de ecuații diferențiale pentru eșantionarea datelor. Aceste capabilități permit antrenarea și inferența modelelor generative capabile să creeze conținut sintetic pe mai multe modalități.

    Supports the development of generative models that can process both text and image modalities.

    Python
    Vezi pe GitHub↗4,562
  • johnsnowlabs/spark-nlpAvatar JohnSnowLabs

    JohnSnowLabs/spark-nlp

    4,135Vezi pe GitHub↗

    Spark NLP este un toolkit pentru analiza scalabilă a textului și machine learning, construit pe framework-ul de calcul distribuit Apache Spark. Oferă un framework de machine learning multimodal și un sistem de pipeline distribuit pentru secvențierea adnotatoarelor în vederea procesării datelor lingvistice la scară largă. Biblioteca include un procesor de text de tip transformer pentru generarea de embedding-uri vectoriale contextuale și un motor de inferență dedicat pentru gestionarea modelelor de limbaj mari (LLM). Proiectul se distinge prin capacitatea sa de a procesa tipuri de date eterogene, inclusiv text, audio și imagini, într-o arhitectură unificată vision-language. Suportă capabilități avansate de AI generativ, cum ar fi prompt engineering, extracția structurată a entităților cu output JSON constrâns și inferența locală pentru a elimina latența rețelei. În plus, oferă instrumente pentru traducerea între limbi și clasificare zero-shot pe modalități de text și imagine. Framework-ul acoperă o gamă largă de capabilități, inclusiv antrenarea modelelor supervizate pentru recunoașterea entităților și analiza sentimentelor, precum și răspunsul extractiv la întrebări și sumarizarea documentelor. Integrează suport pentru baze de date vectoriale pentru căutarea de similaritate și oferă infrastructură pentru accelerare GPU și gestionarea ciclului de viață al modelelor printr-un registru centralizat. Toolkit-ul permite distribuirea modelelor și pipeline-urilor personalizate printr-un repository public și suportă implementarea modelelor prin API-uri REST.

    Processes and classifies combined text, image, and audio data within a unified vision-language architecture.

    Scala
    Vezi pe GitHub↗4,135
  • scisharp/llamasharpAvatar SciSharp

    SciSharp/LLamaSharp

    3,714Vezi pe GitHub↗

    LLamaSharp is a .NET LLM inference library and local runtime that enables the execution of large language models on CPU and GPU hardware. It serves as a multimodal AI library capable of processing both text and image inputs to generate analytical textual responses without relying on external APIs. The project distinguishes itself as a grammar-based text generator that enforces specific output formats, such as JSON, through constrained sampling pipelines. It also functions as a retrieval augmented generation framework integration, allowing the combination of local inference with external data

    Provides a framework capable of processing both text and image inputs to generate analytical textual responses.

    C#
    Vezi pe GitHub↗3,714
  1. Home
  2. Artificial Intelligence & ML
  3. AI Application Frameworks
  4. Multimodal Frameworks