6 dépôts
Creating new images using another image as a structural or stylistic reference.
Distinct from Image Generation: Distinct from general generation by requiring an image as a primary prompt/reference.
Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Image-Conditioned Generation. Refine with filters or upvote what's useful.
SD.Next is an all-in-one web interface and multi-backend inference engine for generating, editing, and processing images and videos using diffusion models. It functions as a comprehensive tool for diffusion model management and an automated image processing pipeline for bulk operations. The project is distinguished by its hardware-backend abstraction layer, which provides automatic detection and acceleration for NVIDIA CUDA, AMD ROCm, Intel OpenVINO, and DirectML. It features a headless generative API and a programmatic command interface, allowing users to trigger tasks via REST API or CLI wi
Generates or edits images using other images as starting points or visual references.
IP-Adapter is a framework for conditioning pretrained text-to-image diffusion models to use image prompts as visual guides. It serves as a text-to-image model extension that transforms a text-based diffusion model to accept and process image inputs as primary generation sources. The system implements identity preservation to maintain consistent facial features across multiple outputs using a reference photo. It also enables style transfer workflows to produce image variations that preserve the artistic characteristics of a source image. Capabilities cover multi-modal prompting, including the
Creates new visual content using an existing image as the primary structural or stylistic reference.
OOTDiffusion is an AI virtual try-on system designed for controllable image synthesis. It generates images of people wearing specific clothing items by superimposing garments onto human figures for both half-body and full-body compositions. The project facilitates digital fashion prototyping and virtual clothing fitting by creating garment-to-person overlays. It aims to maintain the original identity of the wearer and the specific details of the clothing during the synthesis process. The system utilizes a latent diffusion model and conditioning-based image generation to control the output. I
Implements generation guided by garment images and human poses as structural and stylistic references.
ComfyUIIPAdapterplus est une extension basée sur des nœuds pour ComfyUI qui implémente des modèles IPAdapter pour guider la génération d'images en utilisant des images de référence. Il fonctionne comme un outil de prompting d'image et un adaptateur d'image Stable Diffusion, permettant aux fichiers de référence de servir de prompts visuels pour contrôler le style, la composition et l'identité du sujet. Le projet fournit des capacités spécialisées pour maintenir l'identité faciale et des caractéristiques haute fidélité à travers les portraits générés. Il permet le transfert de caractéristiques visuelles et de styles artistiques à partir d'images de référence, ainsi que l'extraction de mises en page spatiales pour guider l'arrangement des objets dans de nouvelles générations. L'extension couvre de larges domaines fonctionnels, incluant le conditionnement d'image IA, la génération de personnages cohérents et le contrôle de la composition d'image.
Enables the generation of new images using reference files as structural or stylistic baselines.
SUPIR est un système d'upscaling et de restauration d'images par IA conçu pour supprimer les artefacts et restaurer la qualité des photographies réelles. Il fonctionne comme un outil d'amélioration et de restauration d'images basé sur la diffusion qui utilise une mise à l'échelle de modèles à grande échelle pour produire des résultats haute résolution avec des détails photoréalistes. Le système équilibre l'esthétique visuelle avec la fidélité de l'entrée, permettant un compromis entre le respect strict de l'image originale et l'attrait visuel global de la sortie. Il exploite l'inférence de modèles à grande échelle pour améliorer la clarté de l'image et maintenir des détails réalistes pendant le processus d'upscaling.
Uses the original low-resolution image as a structural reference to guide the generation of high-resolution output.
Nunchaku is a 4-bit model quantization library and diffusion model inference engine designed to run large-scale neural networks on consumer GPUs. It functions as a GPU-accelerated optimizer that reduces VRAM usage and increases inference speed through weight compression and memory management. The project utilizes low-rank weight decomposition and SVD weight quantization to compress models to four-bit precision while maintaining visual fidelity. It employs kernel-level operator fusion to minimize data movement and hardware-aware precision mapping to adjust numerical precision based on the unde
Supports image-to-image generation by using existing images as structural or stylistic references alongside text prompts.