awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 dépôts

Awesome GitHub RepositoriesVisual-Language Multimodal Integration

Combining visual and textual data into a shared embedding space for multimodal reasoning.

Distinguishing note: The candidates focus on visualizers or QA benchmarks, not the core architectural integration of vision and language modalities.

Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Visual-Language Multimodal Integration. Refine with filters or upvote what's useful.

Awesome Visual-Language Multimodal Integration GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • meta-llama/llama-modelsAvatar de meta-llama

    meta-llama/llama-models

    7,643Voir sur GitHub↗

    Ce projet fournit un framework fondamental et une implémentation de référence pour exécuter la modélisation causale du langage et le raisonnement multimodal sur des systèmes locaux. Il inclut un ensemble de composants de base pour gérer les actifs de modèles, un framework de fine-tuning et les définitions structurelles nécessaires pour instancier des architectures basées sur des transformers. Le système se distingue par sa capacité à traiter des entrées combinées de texte et d'image via des modèles transformers multimodaux pour le raisonnement visuel et l'analyse de documents. Il prend également en charge le déploiement de modèles quantifiés, réduisant l'empreinte mémoire grâce à des techniques de basse précision pour permettre l'inférence sur des appareils en périphérie (edge devices). Le projet couvre de larges domaines de capacités, incluant le fine-tuning supervisé et l'adaptation de bas rang (LoRA) pour la personnalisation de domaine, ainsi qu'un gestionnaire d'actifs complet pour télécharger, vérifier et organiser les poids des modèles et les tokenizers. Des fonctionnalités supplémentaires englobent la génération de texte multilingue, le traitement de contexte long et l'ancrage visuel du langage.

    Integrates visual and textual data streams into a shared embedding space to enable cross-modal reasoning.

    Python
    Voir sur GitHub↗7,643
  • thudm/cogvlmAvatar de THUDM

    THUDM/CogVLM

    6,742Voir sur GitHub↗

    CogVLM is a multimodal large language model designed to integrate visual and textual data for reasoning about images and generating natural language. It functions as a visual question answering system that analyzes image content to provide detailed descriptions or answer specific questions. The project includes a visual grounding model capable of mapping text descriptions to precise bounding box coordinates within an image. It also features a vision-based automation agent that analyzes screen captures to generate execution plans and interaction coordinates for software interfaces. The system

    Integrates visual features and text embeddings into a shared space for reasoning across image and language inputs.

    Python
    Voir sur GitHub↗6,742
  • huggingface/nanovlmAvatar de huggingface

    huggingface/nanoVLM

    4,917Voir sur GitHub↗

    nanoVLM est un framework d'entraînement et une boîte à outils pour les petits modèles vision-langage. Il fournit un environnement basé sur PyTorch pour entraîner et affiner des modèles afin d'associer des entrées d'image à des descriptions textuelles et de générer des réponses en langage naturel. Le projet inclut un outil de versioning de modèles dans le cloud pour enregistrer et charger les poids des modèles vers des dépôts centralisés afin de synchroniser les ressources entre les environnements. Il dispose également d'une suite d'évaluation dédiée pour mesurer la précision et la fiabilité des modèles vision-langage par rapport à des jeux de données de tâches standard. Le framework couvre la planification des ressources GPU via la mesure de la consommation VRAM et gère la stabilité de l'entraînement avec la persistance d'état basée sur des points de contrôle et la gestion de la mémoire par lots.

    Integrates visual feature extractors with language models in a shared embedding space for multimodal processing.

    Python
    Voir sur GitHub↗4,917
  • spandan-madan/deeplearningprojectAvatar de Spandan-Madan

    Spandan-Madan/DeepLearningProject

    4,785Voir sur GitHub↗

    Ce projet est un pipeline de classification multi-étiquettes conçu pour la prédiction de genre. Il implémente un workflow de machine learning qui assigne plusieurs étiquettes de catégorie à un seul élément en traitant à la fois des données textuelles et visuelles. Le système utilise l'extraction de caractéristiques multimodales pour transformer les images et les descriptions textuelles en vecteurs sémantiques. Ce processus inclut l'utilisation de réseaux pré-entraînés pour l'extraction de caractéristiques visuelles et la moyenne sémantique des mots pour l'analyse textuelle, permettant au modèle d'intégrer différents types de données dans une entrée unifiée. Le pipeline couvre l'intégralité du cycle de vie du machine learning, incluant l'intégration de métadonnées de jeux de données provenant de bases externes et l'organisation des données dans un pipeline linéaire multi-étapes. La performance est mesurée par une évaluation basée sur la vérité terrain avec des calculs de précision et de rappel, tandis que les relations entre catégories sont analysées via des matrices de co-occurrence par paires.

    Combines visual features from images and semantic vectors from text into a unified input for genre prediction.

    HTMLdeep-learningmachine-learningneural-networks
    Voir sur GitHub↗4,785
  • johnsnowlabs/spark-nlpAvatar de JohnSnowLabs

    JohnSnowLabs/spark-nlp

    4,135Voir sur GitHub↗

    Spark NLP est une boîte à outils pour l'analyse de texte évolutive et l'apprentissage automatique construite sur le framework de calcul distribué Apache Spark. Il fournit un framework d'apprentissage automatique multimodal et un système de pipeline distribué pour séquencer les annotateurs afin de traiter des données linguistiques à grande échelle. La bibliothèque inclut un processeur de texte transformer pour générer des embeddings vectoriels contextuels et un moteur d'inférence dédié pour gérer les grands modèles de langage. Le projet se distingue par sa capacité à traiter des types de données hétérogènes, y compris le texte, l'audio et les images, au sein d'une architecture vision-langage unifiée. Il prend en charge des capacités avancées d'IA générative telles que le prompt engineering, l'extraction d'entités structurées avec sortie JSON contrainte, et l'inférence locale pour éliminer la latence réseau. De plus, il fournit des outils pour la traduction inter-langues et la classification zero-shot à travers les modalités texte et image. Le framework couvre un large éventail de capacités, y compris l'entraînement de modèles supervisés pour la reconnaissance d'entités et l'analyse de sentiment, ainsi que la réponse aux questions extractive et la synthèse de documents. Il intègre la prise en charge des bases de données vectorielles pour la recherche de similarité et offre une infrastructure pour l'accélération GPU et la gestion du cycle de vie des modèles via un registre centralisé. La boîte à outils permet la distribution de modèles et de pipelines personnalisés via un dépôt public et prend en charge le déploiement de modèles via des API REST.

    Combines visual and textual data into a shared embedding space for image captioning and document reasoning.

    Scala
    Voir sur GitHub↗4,135
  • apple/ml-mgieAvatar de apple

    apple/ml-mgie

    3,876Voir sur GitHub↗

    ml-mgie is a multimodal machine learning framework and image editor designed for instruction-based image manipulation. It utilizes multimodal large language models to translate natural language prompts into precise visual modifications, functioning as a text-to-image editing model. The system is a research implementation focused on aligning visual imagination with textual commands. It employs a training process based on image-pair datasets and descriptive instructions to learn how to execute complex visual edits. The framework covers capabilities in AI-powered visual content creation, includ

    Integrates visual and textual encoders to interpret editing instructions and generate modification parameters.

    Python
    Voir sur GitHub↗3,876
  1. Home
  2. Artificial Intelligence & ML
  3. Visual-Language Multimodal Integration