5 Repos
Using spatial control networks to constrain image structure and maintain spatial consistency during generation.
Distinct from ControlNet Synthesis: None of the candidates cover general ControlNet guidance; they focus on depth replacements or specific synthesis like QR codes.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · ControlNet Guidance. Refine with filters or upvote what's useful.
SD.Next is an all-in-one web interface and multi-backend inference engine for generating, editing, and processing images and videos using diffusion models. It functions as a comprehensive tool for diffusion model management and an automated image processing pipeline for bulk operations. The project is distinguished by its hardware-backend abstraction layer, which provides automatic detection and acceleration for NVIDIA CUDA, AMD ROCm, Intel OpenVINO, and DirectML. It features a headless generative API and a programmatic command interface, allowing users to trigger tasks via REST API or CLI wi
Uses ControlNet to steer image generation by constraining pose, depth, and style.
sd-scripts is a suite of utilities designed for fine-tuning generative models, preprocessing datasets, and converting model weights. It provides a collection of scripts for executing Stable Diffusion training through methods such as DreamBooth, textual inversion, and full fine-tuning, alongside a framework for creating and managing Low-Rank Adaptation weights. The project features specialized capabilities for model weight conversion between different architectures and precision formats. It includes tools for merging adaptation weights into base models, extracting weights from trained models,
Provides capabilities to constrain image structure using hint images and pre-processors.
Adetailer ist eine Stable-Diffusion-Inpainting-Erweiterung und ein automatisierter Detail-Enhancer, der spezifische Bildbereiche identifiziert, um die Qualität durch gezieltes Inpainting zu verbessern. Es fungiert als KI-Bildmaskierungstool, das Erkennungsmodelle verwendet, um präzise Masken für die automatisierte Bildbearbeitung zu erstellen. Das System zeichnet sich dadurch aus, dass es strukturelle Leitlinien wie Tiefe und Pose integriert, um den Inpainting-Prozess einzuschränken und die anatomische Konsistenz zu wahren. Es unterstützt zudem objekt-spezifische Prompt-Zuweisungen, wodurch eindeutige Textanweisungen mithilfe von Trennzeichen (Separator Tokens) mehreren erkannten Objekten innerhalb eines einzigen Bildes zugeordnet werden können. Das Tool bietet eine vollständige Pipeline zur Bildverfeinerung, die automatisierte Maskengenerierung, morphologische Maskentransformationen und Objektfilterung basierend auf Konfidenzschwellen und Größenverhältnissen abdeckt. Es kombiniert diese Funktionen in einem iterativen Prozess aus Erkennung, Maskierung und Diffusion, um Details zu verfeinern, ohne die globale Komposition zu verändern.
Integrates spatial control networks to maintain anatomical and structural consistency during localized inpainting.
Kolors ist eine Implementierung eines generativen Modells zur Synthese fotorealistischer Bilder aus natürlichsprachlichen Beschreibungen und visuellen Referenzen. Es nutzt ein Latent-Diffusion-Modell-Framework, um hochauflösende Bilder zu erzeugen, und arbeitet innerhalb eines komprimierten latenten Raums, um Effizienz und Qualität der Generierung zu verbessern. Das System fungiert als mehrsprachiger Bildgenerator, der Text-Prompts in verschiedenen Sprachen interpretiert, um semantisch präzise visuelle Ergebnisse zu liefern. Es enthält eine benutzerdefinierte Modell-Trainings-Pipeline, die Low-Rank Adaptation (LoRA) verwendet, um dem Modell spezifische Motive oder künstlerische Stile anhand einer kleinen Anzahl von Bildern beizubringen. Das Projekt deckt ein breites Spektrum an Bildsynthese- und Bearbeitungsfunktionen ab, einschließlich Text-zu-Bild- und Bild-zu-Bild-Transformationen. Es bietet Tools zur Steuerung des räumlichen Layouts mittels Tiefen- oder Posenkarten, zur Injektion visueller Identität für ästhetische Konsistenz sowie maskenbasiertes Inpainting zur Rekonstruktion oder Modifikation spezifischer Bildbereiche. Die Implementierung enthält Dienstprogramme zur Bewertung der Bildqualität, die generierte Bilder anhand menschlicher Präferenzmetriken für ästhetische und semantische Qualität bewerten.
Implements ControlNet guidance to constrain image structure and ensure precise spatial layout using depth or pose maps.
Dieses Projekt ist eine ComfyUI-ControlNet-Preprocessor-Suite und ein Computer-Vision-Analyse-Toolkit. Es fungiert als Stable-Diffusion-Bild-Preprocessor, der strukturelle Hinweise aus Bildern extrahiert, um latente Diffusions-Workflows zu steuern. Das System bietet spezialisierte Modelle für die menschliche Pose-Schätzung, einschließlich skelettaler Keypoints und Gesichts-Meshes, sowie 3D-Szenen-Mapping durch Tiefen- und Oberflächennormalenschätzung. Es enthält zudem Tools für KI-Videobewegungssteuerung mittels optischer Flussanalyse. Die breitere Funktionspalette deckt die strukturelle Bildanalyse ab – wie Line-Art, Kantenerkennung und semantische Segmentierung – sowie Luminanz-Isolierung und die Generierung von Farb- und Stilhinweisen. Diese Prozesse werden durch hardwarebeschleunigte Runtimes und Model-Checkpoint-Caching unterstützt, um die Inferenz-Latenz zu reduzieren.
Feeds processed hint images into secondary networks to modulate and constrain the primary generative process.