2 repository-uri
Modifying visual content based on natural language commands while preserving non-targeted regions.
Distinct from Image Editing: Focuses on natural language instructions for precise local modification rather than general generative editing.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Instruction-Based Editing. Refine with filters or upvote what's useful.
OmniGen2 este un model unificat de generare de imagini și un model de limbaj mare multimodal conceput pentru a gestiona generarea text-to-image, sarcinile image-to-image și editarea imaginilor în cadrul unui singur framework. Acesta funcționează ca un motor vizual de model de limbaj cauzal capabil să genereze și să editeze imagini pe baza unor input-uri combinate de text și vizuale. Sistemul dispune de compoziție vizuală în context și generare bazată pe subiect, permițându-i să extragă subiecte din imagini de referință și să le plaseze în scene noi. De asemenea, suportă editarea imaginilor bazată pe instrucțiuni, unde obiecte sau stiluri specifice sunt modificate prin comenzi în limbaj natural, păstrând în același timp restul imaginii. Capabilitățile modelului se extind la analiza și raționamentul conținutului vizual, permițând recunoașterea obiectelor prin input-uri combinate de text și viziune. Pentru a îmbunătăți calitatea output-ului, acesta folosește un proces iterativ de rafinare vizuală cu un mecanism de autocorecție. Performanța este gestionată prin optimizarea utilizării VRAM prin descărcarea dinamică a ponderilor și accelerarea vitezei de inferență folosind tehnici de caching.
Modifies specific objects or styles in an image via natural language commands.
ml-mgie is a multimodal machine learning framework and image editor designed for instruction-based image manipulation. It utilizes multimodal large language models to translate natural language prompts into precise visual modifications, functioning as a text-to-image editing model. The system is a research implementation focused on aligning visual imagination with textual commands. It employs a training process based on image-pair datasets and descriptive instructions to learn how to execute complex visual edits. The framework covers capabilities in AI-powered visual content creation, includ
Provides a framework for modifying visual content based on natural language instructions while preserving non-targeted regions.