2 Repos
Training processes that map images and text across multiple languages into a shared vector space.
Distinct from Caption-Based Training: Extends caption-based training to include shared latent spaces for multilingual alignment, not just image-text association.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Multilingual Image-Text Alignment. Refine with filters or upvote what's useful.
Kolors ist eine Implementierung eines generativen Modells zur Synthese fotorealistischer Bilder aus natürlichsprachlichen Beschreibungen und visuellen Referenzen. Es nutzt ein Latent-Diffusion-Modell-Framework, um hochauflösende Bilder zu erzeugen, und arbeitet innerhalb eines komprimierten latenten Raums, um Effizienz und Qualität der Generierung zu verbessern. Das System fungiert als mehrsprachiger Bildgenerator, der Text-Prompts in verschiedenen Sprachen interpretiert, um semantisch präzise visuelle Ergebnisse zu liefern. Es enthält eine benutzerdefinierte Modell-Trainings-Pipeline, die Low-Rank Adaptation (LoRA) verwendet, um dem Modell spezifische Motive oder künstlerische Stile anhand einer kleinen Anzahl von Bildern beizubringen. Das Projekt deckt ein breites Spektrum an Bildsynthese- und Bearbeitungsfunktionen ab, einschließlich Text-zu-Bild- und Bild-zu-Bild-Transformationen. Es bietet Tools zur Steuerung des räumlichen Layouts mittels Tiefen- oder Posenkarten, zur Injektion visueller Identität für ästhetische Konsistenz sowie maskenbasiertes Inpainting zur Rekonstruktion oder Modifikation spezifischer Bildbereiche. Die Implementierung enthält Dienstprogramme zur Bewertung der Bildqualität, die generierte Bilder anhand menschlicher Präferenzmetriken für ästhetische und semantische Qualität bewerten.
Provides the ability to interpret text prompts in multiple languages to produce semantically accurate visual outputs.
This project is a research framework and toolkit designed for training large-scale vision transformers and multimodal language models. It provides a comprehensive suite for vision-language pretraining, enabling the development of models that map images and text into shared latent spaces. The framework is distinguished by its capabilities in high-fidelity image generation and multimodal research, utilizing normalizing flows and variational autoencoders to produce images from text prompts or class labels. It supports the development of both generative and contrastive models, allowing for a wide
Maps images and text into a shared space using captioning-based pretraining and self-supervised losses.