awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 repositorios

Awesome GitHub RepositoriesMultimodal Visual Understanding

Systems that integrate visual and language data to perform complex reasoning and maintain context across visual inputs.

Distinct from Multimodal Understanding: The existing candidates focus on document-specific or audio-specific understanding rather than general multimodal visual reasoning.

Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Multimodal Visual Understanding. Refine with filters or upvote what's useful.

Awesome Multimodal Visual Understanding GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • zai-org/cogvlmAvatar de zai-org

    zai-org/CogVLM

    6,742Ver en GitHub↗

    CogVLM is a multimodal large language model designed for visual reasoning and multi-turn dialogue. It functions as a visual grounding model and a quantized vision model, combining text and image processing to perform complex understanding and maintain context across visual inputs. The project includes capabilities as a GUI automation agent, allowing it to analyze application screenshots, plan operational steps, and return precise screen coordinates for interface interaction. It further supports visual grounding by generating bounding box coordinates to map text descriptions to specific spatia

    Integrates visual and language data to perform complex understanding and maintain context across visual inputs.

    Pythoncross-modalitylanguage-modelmulti-modal
    Ver en GitHub↗6,742
  • deepseek-ai/deepseek-vl2Avatar de deepseek-ai

    deepseek-ai/DeepSeek-VL2

    5,302Ver en GitHub↗

    DeepSeek-VL2 es un modelo de lenguaje grande multimodal y sistema de visión-lenguaje diseñado para analizar escenas visuales y generar texto descriptivo. Funciona como un modelo de respuesta a preguntas visuales y fundamentación visual (visual grounding), capaz de extraer información de documentos y localizar objetos o regiones específicas dentro de imágenes basadas en descripciones textuales. El proyecto utiliza una arquitectura de mezcla de expertos (mixture-of-experts) para procesar entradas combinadas de imagen y texto. Está optimizado para la inferencia mediante prellenado incremental, lo que reduce los requisitos de memoria de GPU en el hardware. El modelo cubre el análisis de datos multimodal y la comprensión de documentos visuales, incluyendo la interpretación de gráficos y diseños. Realiza inferencia visual y fundamentación para hacer coincidir consultas textuales con el contenido visual correspondiente.

    Processes combined image and text inputs to perform complex multimodal visual reasoning.

    Python
    Ver en GitHub↗5,302
  • openimages/datasetAvatar de openimages

    openimages/dataset

    4,366Ver en GitHub↗

    This project is a computer vision dataset and image annotation repository designed for training and evaluating machine learning models. It provides a large collection of labeled images, serving as an object detection benchmark and a source of pixel-level segmentation data. The repository distinguishes itself as a multimodal visual dataset by pairing images with synchronized voice, text, and mouse traces to support narrative understanding. It further enables the analysis of model fairness through the inclusion of demographic attributes and exhaustive annotations. The dataset covers a broad ra

    Integrates visual and language data, linking voice traces and narratives to image regions for complex reasoning.

    Python
    Ver en GitHub↗4,366
  • deepseek-ai/deepseek-vlAvatar de deepseek-ai

    deepseek-ai/DeepSeek-VL

    4,134Ver en GitHub↗

    DeepSeek-VL es un modelo de lenguaje grande multimodal y motor de razonamiento de imagen a texto. Funciona como un modelo de visión-lenguaje y sistema de respuesta a preguntas visuales que integra la percepción visual con el razonamiento lingüístico para comprender y describir imágenes. El proyecto permite la comprensión multimodal de imágenes y el análisis de imágenes de documentos, procesando específicamente capturas de pantalla de páginas web y diagramas técnicos. Proporciona capacidades para IA conversacional visual, permitiendo a los usuarios interactuar con datos visuales para extraer información y realizar razonamientos complejos a través de diferentes tipos de información visual. El sistema utiliza una arquitectura transformer de visión-lenguaje que combina un Vision Transformer para la codificación visual con un modelo de lenguaje grande. Emplea ajuste de instrucciones multimodal y una capa de proyección para alinear los vectores de características visuales con el espacio de embedding del modelo de lenguaje para la generación de texto autorregresiva.

    Integrates visual and language data to analyze images and diagrams through complex multimodal reasoning.

    Python
    Ver en GitHub↗4,134
  • moonshotai/kimi-codeAvatar de MoonshotAI

    MoonshotAI/kimi-code

    2,473Ver en GitHub↗

    Kimi-code is a command-line interface and orchestration framework designed to integrate autonomous AI agents into software development workflows. It functions as a terminal-based assistant that manages multi-step coding tasks, including planning, file system modifications, shell command execution, and test running, all while maintaining conversational context within a local development environment. The project distinguishes itself through a focus on secure, autonomous agent orchestration and granular control over AI interactions. It enforces strict security by requiring explicit user approval

    Analyzes screen recordings and video clips alongside text prompts to understand visual context.

    TypeScript
    Ver en GitHub↗2,473
  1. Home
  2. Artificial Intelligence & ML
  3. Multimodal Visual Understanding