1 Repo
Architectural additions that enable text-to-image models to process additional input modalities like images.
Distinct from Text-to-Image Implementations: Focuses on expanding input capabilities of existing models rather than providing a full implementation from scratch.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multimodal Extensions. Refine with filters or upvote what's useful.
IP-Adapter is a framework for conditioning pretrained text-to-image diffusion models to use image prompts as visual guides. It serves as a text-to-image model extension that transforms a text-based diffusion model to accept and process image inputs as primary generation sources. The system implements identity preservation to maintain consistent facial features across multiple outputs using a reference photo. It also enables style transfer workflows to produce image variations that preserve the artistic characteristics of a source image. Capabilities cover multi-modal prompting, including the
Transforms text-based diffusion models into multimodal systems that accept image inputs.