6 repositorios
Combining visual and textual data into a shared embedding space for multimodal reasoning.
Distinguishing note: The candidates focus on visualizers or QA benchmarks, not the core architectural integration of vision and language modalities.
Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Visual-Language Multimodal Integration. Refine with filters or upvote what's useful.
Este proyecto proporciona un framework fundamental y una implementación de referencia para ejecutar modelos de lenguaje causales y razonamiento multimodal en sistemas locales. Incluye un conjunto de componentes básicos para gestionar activos de modelos, un framework de ajuste fino (fine-tuning) y las definiciones estructurales necesarias para instanciar arquitecturas basadas en transformers. El sistema se distingue por su capacidad para procesar entradas combinadas de texto e imagen a través de modelos transformer multimodales para el razonamiento visual y el análisis de documentos. También admite el despliegue de modelos cuantizados, reduciendo el uso de memoria mediante técnicas de baja precisión para permitir la inferencia en dispositivos de borde (edge devices). El proyecto cubre áreas de capacidad amplias, incluyendo el ajuste fino supervisado y la adaptación de bajo rango (LoRA) para la personalización de dominios, así como un gestor de activos integral para descargar, verificar y organizar pesos de modelos y tokenizadores. La funcionalidad adicional abarca la generación de texto multilingüe, el procesamiento de contextos largos y el grounding de lenguaje visual.
Integrates visual and textual data streams into a shared embedding space to enable cross-modal reasoning.
CogVLM is a multimodal large language model designed to integrate visual and textual data for reasoning about images and generating natural language. It functions as a visual question answering system that analyzes image content to provide detailed descriptions or answer specific questions. The project includes a visual grounding model capable of mapping text descriptions to precise bounding box coordinates within an image. It also features a vision-based automation agent that analyzes screen captures to generate execution plans and interaction coordinates for software interfaces. The system
Integrates visual features and text embeddings into a shared space for reasoning across image and language inputs.
nanoVLM es un framework de entrenamiento y kit de herramientas para modelos pequeños de visión-lenguaje. Proporciona un entorno basado en PyTorch para entrenar y ajustar modelos con el fin de asociar entradas de imagen con descripciones textuales y generar respuestas en lenguaje natural. El proyecto incluye una herramienta de versionado de modelos en la nube para guardar y cargar pesos de modelos en repositorios centralizados, sincronizando activos entre entornos. También cuenta con una suite de evaluación dedicada para medir la precisión y fiabilidad de los modelos de visión-lenguaje frente a datasets de tareas estándar. El framework cubre la planificación de recursos de GPU mediante la medición del consumo de VRAM y gestiona la estabilidad del entrenamiento con persistencia de estado basada en checkpoints y gestión de memoria por lotes.
Integrates visual feature extractors with language models in a shared embedding space for multimodal processing.
Este proyecto es un pipeline de clasificación multietiqueta diseñado para la predicción de géneros. Implementa un flujo de trabajo de aprendizaje automático que asigna múltiples etiquetas de categoría a un solo elemento procesando datos de entrada tanto textuales como visuales. El sistema utiliza extracción de características multimodal para transformar imágenes y descripciones de texto en vectores semánticos. Este proceso incluye el uso de redes preentrenadas para la extracción de características visuales y el promedio de palabras semánticas para el análisis de texto, permitiendo que el modelo integre diferentes tipos de datos en una entrada unificada. El pipeline cubre todo el ciclo de vida del aprendizaje automático, incluyendo la integración de metadatos de conjuntos de datos desde bases de datos externas y la organización de los datos en un pipeline lineal de múltiples etapas. El rendimiento se mide mediante la evaluación de métricas de verdad fundamental utilizando cálculos de precisión y exhaustividad (recall), mientras que las relaciones entre categorías se analizan mediante matrices de coocurrencia por pares.
Combines visual features from images and semantic vectors from text into a unified input for genre prediction.
Spark NLP es un kit de herramientas para el análisis de texto escalable y aprendizaje automático construido sobre el framework de computación distribuida Apache Spark. Proporciona un framework de aprendizaje automático multimodal y un sistema de tuberías distribuido para secuenciar anotadores para procesar datos lingüísticos a gran escala. La librería incluye un procesador de texto transformer para generar embeddings vectoriales contextuales y un motor de inferencia dedicado para gestionar grandes modelos de lenguaje. El proyecto se distingue por su capacidad para procesar tipos de datos heterogéneos, incluyendo texto, audio e imágenes, dentro de una arquitectura unificada de visión-lenguaje. Admite capacidades avanzadas de IA generativa como prompt engineering, extracción de entidades estructuradas con salida JSON restringida e inferencia local para eliminar la latencia de red. Además, proporciona herramientas para la traducción entre idiomas y la clasificación zero-shot a través de modalidades de texto e imagen. El framework cubre una amplia gama de capacidades, incluyendo el entrenamiento de modelos supervisados para el reconocimiento de entidades y el análisis de sentimientos, así como la respuesta a preguntas extractiva y el resumen de documentos. Integra soporte para bases de datos vectoriales para la búsqueda de similitud y ofrece infraestructura para la aceleración por GPU y la gestión del ciclo de vida del modelo a través de un registro centralizado. El kit de herramientas permite la distribución de modelos y tuberías personalizados a través de un repositorio público y admite el despliegue de modelos mediante APIs REST.
Combines visual and textual data into a shared embedding space for image captioning and document reasoning.
ml-mgie is a multimodal machine learning framework and image editor designed for instruction-based image manipulation. It utilizes multimodal large language models to translate natural language prompts into precise visual modifications, functioning as a text-to-image editing model. The system is a research implementation focused on aligning visual imagination with textual commands. It employs a training process based on image-pair datasets and descriptive instructions to learn how to execute complex visual edits. The framework covers capabilities in AI-powered visual content creation, includ
Integrates visual and textual encoders to interpret editing instructions and generate modification parameters.