2 repositorios
Training processes that map images and text across multiple languages into a shared vector space.
Distinct from Caption-Based Training: Extends caption-based training to include shared latent spaces for multilingual alignment, not just image-text association.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Multilingual Image-Text Alignment. Refine with filters or upvote what's useful.
Kolors es una implementación de modelo generativo para sintetizar imágenes fotorrealistas a partir de descripciones en lenguaje natural y referencias visuales. Utiliza un framework de modelo de difusión latente para producir imágenes de alta fidelidad, operando dentro de un espacio latente comprimido para mejorar la eficiencia y la calidad de la generación. El sistema funciona como un generador de imágenes multilingüe, interpretando prompts de texto en varios idiomas para producir resultados visuales semánticamente precisos. Incluye un pipeline de entrenamiento de modelos personalizado que utiliza adaptación de bajo rango (LoRA) para enseñar al modelo sujetos específicos o estilos artísticos a partir de un pequeño conjunto de imágenes. El proyecto cubre una amplia gama de capacidades de síntesis y edición de imágenes, incluyendo transformaciones de texto a imagen e imagen a imagen. Proporciona herramientas para el control del diseño espacial mediante mapas de profundidad o pose, inyección de identidad visual para consistencia estética y relleno (inpainting) basado en máscaras para reconstruir o modificar regiones específicas de la imagen. La implementación incluye utilidades para la evaluación de la calidad de la imagen, puntuando las imágenes generadas según métricas de preferencia humana para la calidad estética y semántica.
Provides the ability to interpret text prompts in multiple languages to produce semantically accurate visual outputs.
This project is a research framework and toolkit designed for training large-scale vision transformers and multimodal language models. It provides a comprehensive suite for vision-language pretraining, enabling the development of models that map images and text into shared latent spaces. The framework is distinguished by its capabilities in high-fidelity image generation and multimodal research, utilizing normalizing flows and variational autoencoders to produce images from text prompts or class labels. It supports the development of both generative and contrastive models, allowing for a wide
Maps images and text into a shared space using captioning-based pretraining and self-supervised losses.