24 dépôts
Iterative noise prediction training workflows using U-Net architectures and time embeddings.
Distinct from Diffusion Models: Specifically covers the training process for diffusion models, whereas the parent is a general interface for initializing and running them.
Explore 24 awesome GitHub repositories matching artificial intelligence & ml · Diffusion Model Training. Refine with filters or upvote what's useful.
Latent Diffusion is a framework for high-resolution image synthesis that performs the denoising process within a compressed latent space. It uses variational autoencoders to encode images into a lower-dimensional representation, reducing the computational cost of noise prediction compared to operating on raw pixels. The project enables text-to-image generation by integrating natural language descriptions through cross-attention conditioning. It also supports image inpainting and restoration, filling masked or missing image areas with generated content, and example-based synthesis using retrie
Includes workflows for training latent diffusion models on large datasets of diverse visual examples.
This is a PyTorch implementation of a text-to-image model designed for synthesizing high-fidelity images from natural language descriptions. It utilizes a diffusion image generator to transform latent embeddings into visual data through an iterative denoising process. The system employs a two-stage latent mapping process, using a CLIP-based latent prior to map text embeddings to image embeddings before decoding them into pixels. It features a cascading diffusion decoder that produces high-resolution imagery by passing low-resolution outputs through a sequence of models at increasing scales.
Implements a cascading diffusion decoder to produce high-resolution imagery by passing outputs through multiple models at increasing scales.
Magic Animate is a diffusion model video generator designed for human image animation. It transforms a static human photo into a temporally consistent video by mapping movements from a reference motion clip, acting as a tool to create realistic animations from a single image. The system ensures visual stability and minimizes flicker through temporal attention injection and motion-controlled noise scheduling. To accelerate the generation of high-resolution video, it includes a distributed GPU inference engine that splits model workloads across multiple graphics cards. The project covers a com
Implements a staged training strategy that optimizes appearance and temporal modules separately before performing global fine-tuning.
Implementation of Denoising Diffusion Probabilistic Model in Pytorch
Trains a denoising diffusion probabilistic model on images or sequences using a U-Net backbone.
DiT est un modèle de diffusion latente et un framework d'IA générative basé sur des transformers implémenté en PyTorch. Il fonctionne comme un générateur d'images conditionné par classe qui remplace les backbones convolutionnels traditionnels par une architecture transformer pour synthétiser des images haute fidélité. Le projet utilise un traitement latent basé sur des patchs et une compression de l'espace latent pour opérer sur des représentations d'images de faible dimension. Il incorpore un guidage conditionné par classe et des échelles de guidage ajustables pour contrôler le contenu visuel des images générées pendant le processus d'échantillonnage. Le framework couvre l'entraînement distribué de modèles, l'échantillonnage itératif de bruit et la création de jeux de données d'images synthétiques. Il inclut également des outils d'évaluation de la qualité des modèles pour calculer les scores de précision et de qualité par rapport aux benchmarks standard.
Provides distributed training workflows for transformer-based latent diffusion models to improve scalability and speed.
This is a PyTorch-based implementation of diffusion models for synthesizing photorealistic images and video. It provides a framework for text-to-image and text-to-video generation, as well as unconditional image synthesis. The system utilizes a cascading diffusion pipeline to produce high-resolution imagery by passing low-resolution outputs through a sequence of super-resolution models. It also includes capabilities for image inpainting, allowing the reconstruction of masked or missing regions of visual media guided by surrounding context and text prompts. The project includes tools for diff
Distributes diffusion model training across multiple GPUs using data parallelism to increase throughput.
This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene
Provides detailed implementations for training diffusion models to predict noise and generate images.
This project is a cloud-based AI deployment system and latent diffusion model trainer. It provides a framework for launching image generation interfaces and training pipelines on remote GPU infrastructure, specifically serving as a text-to-image model fine-tuner. The system features a specialized training interface for fine-tuning Stable Diffusion models on custom image datasets. It allows for the creation of personalized visual outputs by training models on specific subjects or artistic styles using a small set of reference images. The software covers generative AI deployment, custom style
Implements iterative noise prediction training workflows to create images of specific subjects or styles.
This project is a toolkit for fine-tuning and managing text-to-image diffusion models. It focuses on low-rank adaptation to create small, portable weight files that customize model styles and behaviors without modifying the entire base model. The project provides specialized utilities for model distillation using singular value decomposition to extract adapters from fully trained models, as well as tools for blending and merging multiple adapters through weight interpolation. It includes capabilities for subject inversion and pivotal tuning to increase the visual fidelity of specific identiti
Provides a specialized training setup for fine-tuning diffusion models to fill image gaps and restore visual details.
This is a classifier-guided diffusion framework for high-fidelity image generation. It implements a cascaded diffusion pipeline that chains a base diffusion model with a dedicated upsampler to progressively increase image resolution in stages, and uses classifier-guided diffusion sampling to steer the reverse diffusion process toward higher-quality outputs. The framework provides tools for training diffusion models from scratch using distributed processes with gradient accumulation, as well as training classifier models that provide gradient-based guidance during sampling. It supports both un
Trains a diffusion model on a dataset using distributed processes and adjustable settings.
StableCascade is a generative AI system and latent diffusion framework designed for text-to-image synthesis and image-to-image transformations. It utilizes a multi-stage cascade architecture that encodes and decodes images via a latent space to produce high-fidelity visual imagery. The system includes a cascade diffusion pipeline for controlling image structure through inpainting, outpainting, and super-resolution. It also provides a toolkit for image-to-image generation and the creation of image variations using embeddings. The framework supports model optimization through low-rank adaptati
Uses cascading decoders to progressively increase image resolution through sequential model passes.
lora-scripts est une boîte à outils de fine-tuning conçue pour adapter des modèles de diffusion de base à des styles ou sujets spécifiques. Elle fournit un ensemble spécialisé de scripts et d'outils pour exécuter des tâches d'entraînement de type Low-Rank Adaptation (LoRA) et Dreambooth. Le projet dispose d'une interface graphique basée sur le web qui gère le workflow d'entraînement, permettant aux utilisateurs de configurer et d'exécuter des tâches sans édition manuelle de scripts. Cette interface mappe les entrées utilisateur aux hyperparamètres et fournit un tableau de bord en temps réel pour surveiller les métriques d'entraînement et les courbes de perte afin de suivre la convergence du modèle. Le système inclut un gestionnaire d'étiquetage de jeux de données pour organiser et modifier les étiquettes d'images. Pour garantir une exécution cohérente sur différents hôtes matériels, l'environnement d'entraînement est fourni sous forme de configuration conteneurisée pré-configurée.
Implements specialized fine-tuning logic for diffusion models via standalone Python scripts.
Wonder3D est un système basé sur la diffusion pour la reconstruction 3D à partir d'une image unique. Il génère des maillages 3D très détaillés à partir d'une seule image d'entrée en produisant des cartes de normales multi-vues cohérentes et des images couleur. Le pipeline fonctionne comme un générateur de cartes de normales multi-vues et un extracteur de maillage texturé. Il utilise une synthèse multi-vues inter-domaines pour créer des cartes dépendantes de la vue, qui sont ensuite converties en géométrie 3D par fusion de radiance et reconstruction de surface efficace en mémoire. Le projet couvre la génération de maillage 3D, la génération multi-vues et la modélisation 3D texturée. Il inclut également des capacités pour entraîner des modèles de diffusion afin d'optimiser la cohérence des cartes dépendantes de la vue générées.
Provides workflows to optimize attention and cross-domain modules for improving view-dependent map consistency.
This project is a diffusion model training framework and image synthesis pipeline. It provides the tools necessary to train generative models to learn image data distributions through an iterative denoising process. The framework includes a generative model evaluation tool consisting of automated scripts used to measure the quality and accuracy of produced samples. The system covers model training pipelines and performance evaluation for generative diffusion models.
Implements a complete training pipeline for generative diffusion models to learn image data distributions.
Tiny Universe is an educational monorepo that delivers multiple independent implementations of core AI subsystems as self-contained Jupyter notebooks. It provides from-scratch constructions of foundational architectures including a complete Transformer model built from the original paper specification, a denoising diffusion probabilistic model for image generation, and a ReAct-style autonomous agent framework that equips an LLM with tools for planning and multi-step task execution. The project distinguishes itself by covering the full lifecycle of modern AI systems through hands-on implementa
Provides a minimal DDPM implementation translating mathematical formulas into training and sampling code.
This is a collection of Jupyter notebooks that serve as educational guides for training, fine-tuning, and deploying machine learning models within the Hugging Face ecosystem. The notebooks cover the full lifecycle of model development, from loading and configuring pre-trained transformers to packaging trained models for real-time inference via scalable endpoints. The notebooks demonstrate a range of capabilities including diffusion model training and fine-tuning for image generation and editing, transformer model adaptation for natural language processing tasks, and parameter-efficient fine-t
Provides notebooks that teach training and fine-tuning of diffusion models for image generation and editing.
Ce projet est un cours éducatif et une collection de supports de formation axés sur les modèles de diffusion générative. Il fournit un programme et des guides pratiques pour entraîner, affiner et déployer des modèles capables de synthétiser des images, de l'audio et de la vidéo. Le matériel couvre des stratégies d'implémentation spécifiques, notamment la synthèse basée sur le bruit, le raffinement itératif et la compression de l'espace latent. Il fournit des instructions sur la manière de guider les sorties génératives par la synthèse conditionnelle et l'optimisation de l'adhérence aux prompts, ainsi que des techniques pour l'inpainting d'images et l'édition basée sur le texte. Le projet inclut du contenu sur l'optimisation et le développement de modèles, couvrant l'affinage de concepts et la réduction des étapes d'inférence. Il fournit également des flux de travail pour produire des médias synthétiques, tels que la génération de séquences vidéo et la conversion de spectrogrammes visuels en audio. L'implémentation pratique est fournie via des exemples de code PyTorch et des tutoriels pour publier les poids des modèles et les métadonnées sur le Hugging Face Hub.
Teaches the core process of denoising data by adding varying levels of noise and updating model weights.
DiffBIR est un framework de restauration d'images basé sur la diffusion, conçu pour la reconstruction d'images en aveugle. Il utilise des priors de diffusion générative pour récupérer des images de haute qualité à partir de sources présentant des dégradations inconnues ou complexes, sans nécessiter de modèles de dégradation explicites. Le système inclut des modèles spécialisés pour la restauration de visages, permettant de récupérer les points de repère faciaux, les textures et les arrière-plans dans des portraits dégradés. Pour prendre en charge les sorties haute résolution sur du matériel à mémoire limitée, il utilise un upscaler d'images par tuiles qui divise les images en petits patchs pendant l'échantillonnage. Le framework couvre un pipeline de restauration multi-étapes et l'upscaling d'images génératif. Il intègre des capacités pour l'entraînement de modèles de restauration et l'application de poids spécialisés afin d'optimiser l'amélioration pour des scènes spécifiques.
Includes workflows for training diffusion models to combine restoration with generative capabilities.
Il s'agit d'un framework de deep learning PyTorch et d'un outil pour la synthèse de mouvement humain qui génère des animations de personnages 3D à partir de prompts textuels ou de descriptions d'actions. Il fonctionne comme un générateur texte-vers-mouvement qui convertit le langage naturel et les étiquettes catégorielles en séquences de mouvement squelettique 3D temporellement cohérentes. Le système utilise un modèle de diffusion basé sur des transformers pour débruiter de manière itérative les données de mouvement. Il inclut des capacités pour la génération conditionnée par l'action, le passage du mouvement monoculaire au 3D et l'édition de séquences de mouvement à l'aide de contraintes textuelles. Le framework intègre l'application de contraintes de mouvement géométriques pour assurer la plausibilité physique par le biais de pertes de position articulaire et de vitesse. Il couvre en outre l'ensemble du pipeline d'animation, y compris l'entraînement du modèle de mouvement, l'évaluation des performances par rapport à des jeux de données de référence, le rendu de maillage 3D et le contrôle de simulation basé sur la physique pour l'interaction environnementale.
Provides training workflows for diffusion models to learn mappings between text, actions, and human movement.
Ce projet est un framework de deep learning pour la super-résolution d'image IA et la synthèse faciale. Il fournit un upscaler d'image par modèle de diffusion et un synthétiseur d'image faciale génératif capable de transformer des images basse résolution en sorties haute résolution en utilisant des poids de modèles pré-entraînés. Le système utilise un raffinement de diffusion itératif et un échantillonnage guidé par basse résolution pour restaurer les détails fins et la netteté. Il prend en charge à la fois la génération d'image inconditionnelle, où les images sont créées à partir de zéro, et l'amélioration de résolution guidée pour une reconstruction faciale haute fidélité. Le dépôt inclut un pipeline d'entraînement de modèle de diffusion avec entraînement distribué multi-GPU et initialisation des poids pré-entraînés. Cet environnement est pris en charge par le suivi des expériences de modèle, la journalisation des métriques externes et la reprise de modèle basée sur des points de contrôle (checkpoints).
Implements a training workflow for diffusion models featuring U-Net architectures and time embeddings.