3 dépôts
Complete neural network implementations for synthesizing images from text descriptions.
Distinct from PyTorch Implementations: Shortlist candidates focus on general PyTorch implementations or retrieval, not the specific category of text-to-image model implementations.
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Text-to-Image Implementations. Refine with filters or upvote what's useful.
This is a PyTorch implementation of a text-to-image model designed for synthesizing high-fidelity images from natural language descriptions. It utilizes a diffusion image generator to transform latent embeddings into visual data through an iterative denoising process. The system employs a two-stage latent mapping process, using a CLIP-based latent prior to map text embeddings to image embeddings before decoding them into pixels. It features a cascading diffusion decoder that produces high-resolution imagery by passing low-resolution outputs through a sequence of models at increasing scales.
Provides a full PyTorch implementation of a text-to-image model for synthesizing high-fidelity images.
IP-Adapter is a framework for conditioning pretrained text-to-image diffusion models to use image prompts as visual guides. It serves as a text-to-image model extension that transforms a text-based diffusion model to accept and process image inputs as primary generation sources. The system implements identity preservation to maintain consistent facial features across multiple outputs using a reference photo. It also enables style transfer workflows to produce image variations that preserve the artistic characteristics of a source image. Capabilities cover multi-modal prompting, including the
Transforms text-based diffusion models into multimodal systems that accept image inputs.
Ce projet est une implémentation PyTorch d'un transformeur texte-vers-image. C'est un modèle d'IA générative conçu pour mapper des jetons (tokens) de texte discrets vers des pixels d'image en utilisant un réseau transformeur pour créer du contenu visuel à partir de descriptions textuelles. Le système utilise un encodeur d'image VAE discret pour compresser les données visuelles en jetons pour le traitement par transformeur. Il prend en charge le guidage sans classificateur pour ajuster l'influence des prompts textuels pendant l'inférence et inclut des capacités pour classer les images générées en fonction de leur similarité avec les prompts textuels. L'architecture intègre des mécanismes d'attention creuse et des réseaux résiduels réversibles pour optimiser la complexité computationnelle et la consommation de mémoire. Les capacités d'entraînement incluent la mise à l'échelle GPU distribuée et des frameworks pour gérer des charges de travail à grande échelle sur plusieurs processeurs graphiques afin d'associer des images à des descriptions textuelles. L'implémentation fournit un support pour la tokenisation de texte personnalisée via l'intégration de tokeniseurs pré-entraînés ou de modèles de langage.
Provides a full PyTorch implementation of the DALL-E text-to-image synthesis architecture.