2 repository-uri
Diffusion-based tools specifically designed to apply natural language edits to existing images.
Distinct from Diffusion Models: Distinct from general Diffusion Models by specializing in editing existing images via instructions rather than just synthesizing new ones.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Instruction-Based Editors. Refine with filters or upvote what's useful.
Instruct-pix2pix is an instruction-based image model and PyTorch library designed to modify visual content by following natural language directions. It functions as a diffusion model image editor that applies human-written instructions to existing pictures rather than using traditional text-to-image prompts. The project provides a fine-tunable diffusion framework for adapting pre-trained checkpoints to specific image editing datasets. It includes a synthetic dataset generator that creates paired images and text triplets to train models on various image editing tasks. The system covers a rang
Provides an image editing tool that applies natural language instructions to existing pictures via a latent diffusion model.
OmniGen este un model unificat de generare a imaginilor și un framework de difuzie care procesează text, imagini și sarcini de viziune printr-un singur sistem. Funcționează ca un framework de difuzie multimodal care tratează diverse operațiuni de viziune ca probleme unificate de sinteză a imaginilor folosind ponderi de model partajate, eliminând nevoia de module adaptoare externe. Sistemul suportă generarea de imagini bazată pe subiect pentru a păstra identitatea obiectelor din fotografiile de referință și permite sinteza imaginilor multi-referință. De asemenea, operează ca un editor de imagini bazat pe instrucțiuni, modificând conținutul vizual prin prompt-uri în limbaj natural. Framework-ul se extinde la sarcini de viziune computațională generativă, unde operațiuni precum detectarea marginilor și recunoașterea posturii sunt efectuate prin transformarea lor în sarcini de sinteză. Performanța pe sarcini specifice poate fi îmbunătățită prin fine-tuning-ul ponderilor modelului și adaptare low-rank.
Implements a diffusion-based tool for applying natural language edits to existing images.