awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 Repos

Awesome GitHub RepositoriesVisual-Language Multimodal Integration

Combining visual and textual data into a shared embedding space for multimodal reasoning.

Distinguishing note: The candidates focus on visualizers or QA benchmarks, not the core architectural integration of vision and language modalities.

Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Visual-Language Multimodal Integration. Refine with filters or upvote what's useful.

Awesome Visual-Language Multimodal Integration GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • meta-llama/llama-modelsAvatar von meta-llama

    meta-llama/llama-models

    7,643Auf GitHub ansehen↗

    Dieses Projekt bietet ein grundlegendes Framework und eine Referenzimplementierung für die Ausführung von kausaler Sprachmodellierung und multimodalem Reasoning auf lokalen Systemen. Es enthält eine Reihe von Kernkomponenten für die Verwaltung von Modell-Assets, ein Fine-Tuning-Framework sowie strukturelle Definitionen, die für die Instanziierung von Transformer-basierten Architekturen erforderlich sind. Das System zeichnet sich durch die Fähigkeit aus, kombinierte Text- und Bildeingaben durch multimodale Transformer-Modelle für visuelles Reasoning und Dokumentenanalyse zu verarbeiten. Es unterstützt zudem die Bereitstellung quantisierter Modelle, wodurch der Speicherbedarf durch Techniken mit niedriger Präzision reduziert wird, um Inferenz auf Edge-Geräten zu ermöglichen. Das Projekt deckt breite Funktionsbereiche ab, einschließlich Supervised Fine-Tuning und Low-Rank Adaptation für die Domänenanpassung sowie einen umfassenden Asset-Manager zum Herunterladen, Verifizieren und Organisieren von Modellgewichten und Tokenizern. Zusätzliche Funktionen umfassen mehrsprachige Textgenerierung, Verarbeitung langer Kontexte und Visual Language Grounding.

    Integrates visual and textual data streams into a shared embedding space to enable cross-modal reasoning.

    Python
    Auf GitHub ansehen↗7,643
  • thudm/cogvlmAvatar von THUDM

    THUDM/CogVLM

    6,742Auf GitHub ansehen↗

    CogVLM is a multimodal large language model designed to integrate visual and textual data for reasoning about images and generating natural language. It functions as a visual question answering system that analyzes image content to provide detailed descriptions or answer specific questions. The project includes a visual grounding model capable of mapping text descriptions to precise bounding box coordinates within an image. It also features a vision-based automation agent that analyzes screen captures to generate execution plans and interaction coordinates for software interfaces. The system

    Integrates visual features and text embeddings into a shared space for reasoning across image and language inputs.

    Python
    Auf GitHub ansehen↗6,742
  • huggingface/nanovlmAvatar von huggingface

    huggingface/nanoVLM

    4,917Auf GitHub ansehen↗

    nanoVLM ist ein Trainings-Framework und Toolkit für kleine Vision-Language-Modelle. Es bietet eine auf PyTorch basierende Umgebung zum Trainieren und Fine-Tuning von Modellen, um Bild-Inputs mit Textbeschreibungen zu verknüpfen und natürlichsprachliche Antworten zu generieren. Das Projekt enthält ein Cloud-Modell-Versionierungstool zum Speichern und Laden von Modellgewichten in zentralen Repositories, um Assets über Umgebungen hinweg zu synchronisieren. Es bietet zudem eine dedizierte Evaluierungssuite zur Messung der Genauigkeit und Zuverlässigkeit von Vision-Language-Modellen anhand von Standard-Aufgabendatensätzen. Das Framework deckt die GPU-Ressourcenplanung durch Messung des VRAM-Verbrauchs ab und verwaltet die Trainingsstabilität mit checkpoint-basierter Zustandspersistenz und batch-basiertem Speichermanagement.

    Integrates visual feature extractors with language models in a shared embedding space for multimodal processing.

    Python
    Auf GitHub ansehen↗4,917
  • spandan-madan/deeplearningprojectAvatar von Spandan-Madan

    Spandan-Madan/DeepLearningProject

    4,785Auf GitHub ansehen↗

    This project is a multi-label classification pipeline designed for genre prediction. It implements a machine learning workflow that assigns multiple category labels to a single item by processing both textual and visual input data. The system utilizes multimodal feature extraction to transform images and text descriptions into semantic vectors. This process includes using pre-trained networks for visual feature extraction and semantic word averaging for text analysis, allowing the model to integrate different data types into a unified input. The pipeline covers the full machine learning life

    Combines visual features from images and semantic vectors from text into a unified input for genre prediction.

    HTMLdeep-learningmachine-learningneural-networks
    Auf GitHub ansehen↗4,785
  • johnsnowlabs/spark-nlpAvatar von JohnSnowLabs

    JohnSnowLabs/spark-nlp

    4,135Auf GitHub ansehen↗

    Spark NLP is a toolkit for scalable text analysis and machine learning built on the Apache Spark distributed computing framework. It provides a multimodal machine learning framework and a distributed pipeline system for sequencing annotators to process large-scale linguistic data. The library includes a transformer text processor for generating contextual vector embeddings and a dedicated inference engine for managing large language models. The project distinguishes itself through its ability to process heterogeneous data types, including text, audio, and images, within a unified vision-langu

    Combines visual and textual data into a shared embedding space for image captioning and document reasoning.

    Scala
    Auf GitHub ansehen↗4,135
  • apple/ml-mgieAvatar von apple

    apple/ml-mgie

    3,876Auf GitHub ansehen↗

    ml-mgie is a multimodal machine learning framework and image editor designed for instruction-based image manipulation. It utilizes multimodal large language models to translate natural language prompts into precise visual modifications, functioning as a text-to-image editing model. The system is a research implementation focused on aligning visual imagination with textual commands. It employs a training process based on image-pair datasets and descriptive instructions to learn how to execute complex visual edits. The framework covers capabilities in AI-powered visual content creation, includ

    Integrates visual and textual encoders to interpret editing instructions and generate modification parameters.

    Python
    Auf GitHub ansehen↗3,876
  1. Home
  2. Artificial Intelligence & ML
  3. Visual-Language Multimodal Integration