awesome-repositories.comCatégoriesBlog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

11 dépôts

Awesome GitHub RepositoriesMultimodal Model Integrations

Connecting different types of AI models, such as LLMs and VLMs, to exchange data.

Distinct from Large Language Model Integration: Existing candidates focus on secure database connectivity or visualization, not multimodal model linking.

Explore 11 awesome GitHub repositories matching artificial intelligence & ml · Multimodal Model Integrations. Refine with filters or upvote what's useful.

Awesome Multimodal Model Integrations GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • microsoft/taskmatrixAvatar de microsoft

    microsoft/TaskMatrix

    34,079Voir sur GitHub↗

    TaskMatrix is a visual language model orchestration framework and modular visual pipeline designed to coordinate disparate foundation models. It functions as a multi-model workflow coordinator that sequences visual and textual models through logic paths to handle image processing tasks without requiring additional training. The system integrates large language models with visual foundation models to enable the exchange of image data during interactive chat sessions. It utilizes template-based orchestration to chain specialized models together for complex visual tasks. The framework supports

    Links large language models with visual foundation models to exchange image data during chat sessions.

    Python
    Voir sur GitHub↗34,079
  • rohitg00/ai-engineering-from-scratchAvatar de rohitg00

    rohitg00/ai-engineering-from-scratch

    33,575Voir sur GitHub↗

    This project is a structured AI engineering curriculum and educational program designed to teach the construction of machine learning models, neural networks, and autonomous agents from the ground up. It serves as a comprehensive machine learning course covering mathematical foundations, deep learning architectures, and reinforcement learning through practical implementation. The project provides a technical framework for building autonomous loops and memory systems via an agent framework, as well as guides for implementing multimodal AI systems that integrate vision, audio, and text processi

    Teaches how to integrate vision, audio, and text into unified multimodal AI models.

    Pythonagentsaiai-agents
    Voir sur GitHub↗33,575
  • opengvlab/llama-adapterAvatar de OpenGVLab

    OpenGVLab/LLaMA-Adapter

    5,921Voir sur GitHub↗

    LLaMA-Adapter est un framework de fine-tuning efficace en paramètres conçu pour adapter les grands modèles de langage en utilisant un ensemble minimal de paramètres entraînables. Il fonctionne comme un outil d'instruction tuning et un adaptateur multimodal, permettant aux modèles pré-entraînés de suivre des instructions humaines et de traiter des données non textuelles. Le projet se spécialise dans l'intégration de données d'image, vidéo, audio et capteurs dans les modèles de langage pour une compréhension cross-modale. Il permet la personnalisation des modèles LLaMA via l'utilisation d'adaptateurs légers, ce qui permet l'extraction et le stockage des poids appris indépendamment du checkpoint complet du modèle. Le framework couvre l'intégralité du cycle de vie d'entraînement et d'évaluation, incluant le pré-entraînement et le raffinement des adaptateurs. Il fournit des capacités pour l'intégration de données multimodales et l'évaluation de la performance des modèles par rapport à des jeux de données de référence pour mesurer la précision des réponses.

    Integrates non-textual data like images, video, and audio into language models for cross-modal understanding.

    Python
    Voir sur GitHub↗5,921
  • firebase/firebase-js-sdkAvatar de firebase

    firebase/firebase-js-sdk

    5,125Voir sur GitHub↗

    Il s'agit d'un SDK backend-as-a-service qui connecte les applications web et mobiles à une suite de services cloud. Il fournit une interface unifiée pour gérer l'identité des utilisateurs, exécuter une logique serverless et gérer le stockage d'objets cloud. La boîte à outils se caractérise par sa synchronisation de données en temps réel, qui permet aux données documentaires NoSQL de rester cohérentes sur plusieurs clients avec une persistance hors ligne intégrée. Elle facilite l'accès sécurisé des utilisateurs via une variété de fournisseurs d'identité et gère l'invocation de fonctions serverless pour exécuter une logique backend en réponse à des requêtes HTTPS ou des événements de base de données. Le SDK couvre un large éventail de capacités opérationnelles, incluant la gestion de bases de données NoSQL et relationnelles, la surveillance des crashs et l'analyse du comportement des utilisateurs. Il fournit également des outils pour la configuration d'application à distance, les notifications push ciblées et l'intégration de grands modèles de langage pour des fonctionnalités propulsées par l'IA. Le projet est implémenté en TypeScript et fournit des bibliothèques spécifiques au langage qui abstraient les API REST et WebSocket en méthodes de haut niveau.

    Integrates multimodal models to process text, images, audio, and video for generative responses.

    TypeScriptfirebasefirebase-authfirebase-authentication
    Voir sur GitHub↗5,125
  • yangjian102621/geekaiAvatar de yangjian102621

    yangjian102621/geekai

    4,665Voir sur GitHub↗

    Geekai est une plateforme IA multi-modèles et un framework SaaS conçu pour déployer et gérer des agents IA et des modèles multimodaux via une interface unifiée. Il sert de passerelle IA multimodale, fournissant un accès centralisé aux grands modèles de langage et aux outils génératifs pour la production de texte, d'image, d'audio et de vidéo. Le projet fonctionne comme un orchestrateur d'agents IA, permettant la définition de personas spécialisés et l'importation de workflows externes et de bases de connaissances. Il se distingue en fournissant une couche de service commerciale complète, incluant la facturation basée sur des crédits, la gestion des abonnements et un écosystème de créateurs pour monétiser des applications IA personnalisées. La plateforme couvre de larges domaines de capacités incluant la génération de contenu IA pour des présentations et de la vidéo par transfert de mouvement, l'administration des opérations d'entreprise avec contrôle d'accès basé sur les rôles, et une abstraction de stockage basée sur des drivers pour gérer les assets à travers des fournisseurs locaux et cloud. Elle incorpore également l'analyse commerciale, la limitation de débit API et les migrations de base de données automatisées. Le système prend en charge le déploiement d'instances privées sur des serveurs auto-hébergés avec des paramètres HTTPS et SSL configurables.

    Provides a unified interface to connect and exchange data between various large language models and generative tools.

    Vueazurechatgptdalle3
    Voir sur GitHub↗4,665
  • modelscope/ms-agentAvatar de modelscope

    modelscope/ms-agent

    4,318Voir sur GitHub↗

    ms-agent is an LLM agent framework and multi-agent orchestration system designed to build autonomous entities that combine large language models with tool calling and structured workflows. It serves as a tool integration platform and workflow engine for executing complex tasks through the coordination of specialized agents. The project distinguishes itself through a multimodal agent workflow engine capable of automating the production of text, images, and video. It features a sandboxed code execution environment for running generated code and quantitative data analysis in isolated containers,

    Sets up interfaces that allow LLMs and VLMs to process and respond to multiple data types simultaneously.

    Pythonagentic-insightagentic-searchchat-bot
    Voir sur GitHub↗4,318
  • basedhardware/openglassAvatar de BasedHardware

    BasedHardware/OpenGlass

    4,069Voir sur GitHub↗

    OpenGlass is an AI smart glasses framework and microcontroller hardware project designed to turn standard eyewear into computer vision wearables. It provides a system for integrating wearable camera sensors with multimodal AI to process visual data in real time. The project enables the development of AI-powered glasses that can identify people and objects, translate visual text, and record life events. It connects off-the-shelf electronic components to mobile software and large language models for visual analysis. The system covers a range of capabilities including real-time visual stream pr

    Integrates wearable camera sensors with multimodal models to perform visual analysis and translation.

    C
    Voir sur GitHub↗4,069
  • lazyagi/lazyllmAvatar de LazyAGI

    LazyAGI/LazyLLM

    3,842Voir sur GitHub↗

    LazyLLM is a multi-agent framework and orchestration engine designed for building complex AI applications. It provides a system for chaining large language models into sequential or parallel pipelines, utilizing a tool registry to convert standard functions into discoverable tools that models can invoke via reasoning. The project features an application deployment kit that enables hosting model workflows as web services with integrated chat interfaces and API gateways. It includes an infrastructure abstraction layer that allows users to switch between bare-metal servers, clusters, and public

    Connects different types of AI models, such as LLMs and media generators, to exchange data in sequential pipelines.

    Pythonagentsai-agentdata
    Voir sur GitHub↗3,842
  • lanqian528/chat2apiAvatar de lanqian528

    lanqian528/chat2api

    3,368Voir sur GitHub↗

    chat2api is a web-to-API bridge and proxy that converts web-based chat sessions into a standardized API format. This allows web accounts to be used programmatically within third-party client applications. The system includes a multi-account rotator that distributes requests across a pool of authentication tokens using random or sequential polling to bypass rate limits. It also functions as a multimodal API proxy, translating base64 or URL-encoded images and files into formats compatible with web-based chat interfaces. The project manages the full lifecycle of session tokens, featuring statef

    Integrates multimodal capabilities by sending images and files to LLMs for visual analysis.

    Python
    Voir sur GitHub↗3,368
  • transformerlensorg/transformerlensAvatar de TransformerLensOrg

    TransformerLensOrg/TransformerLens

    3,098Voir sur GitHub↗

    TransformerLens is a library for mechanistic interpretability research designed to reverse engineer the learned algorithms within large language models. It provides a standardized framework for wrapping diverse transformer architectures, allowing researchers to extract, manipulate, and analyze internal activations and weights through a consistent interface. The project distinguishes itself through a comprehensive system of activation hooks that can capture, patch, and ablate internal tensors during the forward pass. It includes specialized utilities for decomposing fused projections, material

    Validates that multimodal models correctly process image inputs during forward passes and activation caching.

    Python
    Voir sur GitHub↗3,098
  • volcengine/openvikingAvatar de volcengine

    volcengine/OpenViking

    2,993Voir sur GitHub↗

    OpenViking is a multi-tenant context server and knowledge base administration system designed to provide AI agents with persistent long-term memory. It enables the indexing of diverse documents and codebases to support retrieval-augmented generation, allowing agents to recall past interactions, user preferences, and learned experiences across sessions. The project is distinguished by its use of a URI-based virtual filesystem to organize memories, resources, and skills. It implements a tiered context loading system that balances retrieval precision with token budgets by structuring data into a

    Connects to external VLM and Embedding providers via OpenAI-compatible APIs for image understanding and semantic retrieval.

    Pythonagentagentic-ragai-agents
    Voir sur GitHub↗2,993
  1. Home
  2. Artificial Intelligence & ML
  3. Multimodal Model Integrations

Explorer les sous-tags

  • Integration ValidationsTesting the correctness of data flow between different modalities within a unified model. **Distinct from Multimodal Model Integrations:** Focuses on verifying the correct processing of image inputs during forward passes, not the act of linking models.