28 repositorios
Trains a denoising diffusion model on images and then samples new images by reversing the noise process.
Distinct from Generative Image Models: Distinct from general Generative Image Models: specifically generates images from random noise via iterative denoising, not image-to-image translation or other generative methods.
Explore 28 awesome GitHub repositories matching artificial intelligence & ml · Noise-to-Image Generation. Refine with filters or upvote what's useful.
Implementation of Denoising Diffusion Probabilistic Model in Pytorch
Trains a diffusion model on images and generates new images by reversing the noise process.
VAR is a visual autoregressive model and image generation framework that applies large language model scaling laws to visual data. It functions as an image generator that uses a coarse-to-fine next-scale prediction approach rather than traditional raster-scan tokenization. The system utilizes scale-based tokenization to represent images as a hierarchy of discrete tokens. It generates high-resolution content by iteratively predicting the next resolution level, refining coarse predictions into fine-grained details. The project covers a broad range of capabilities including autoregressive image
Produces large image sets using classifier-free guidance and smoothing to balance visual quality and diversity.
This is a PyTorch-based implementation of diffusion models for synthesizing photorealistic images and video. It provides a framework for text-to-image and text-to-video generation, as well as unconditional image synthesis. The system utilizes a cascading diffusion pipeline to produce high-resolution imagery by passing low-resolution outputs through a sequence of super-resolution models. It also includes capabilities for image inpainting, allowing the reconstruction of masked or missing regions of visual media guided by surrounding context and text prompts. The project includes tools for diff
Synthesizes photorealistic images by reversing a Gaussian noise process guided by text embeddings.
mmagic is a multimodal training pipeline and framework for generative AI, focusing on visual synthesis and restoration. It provides the infrastructure to build and train models for tasks such as text-to-image and text-to-video generation, 3D-aware content synthesis, and high-fidelity image translation using diffusion models and generative adversarial networks. The project distinguishes itself through specialized capabilities for generative model personalization, including techniques for fine-tuning subjects and styles. It also supports advanced visual manipulations such as latent space interp
Samples new images from random noise using both unconditional and conditional generative models.
This is a classifier-guided diffusion framework for high-fidelity image generation. It implements a cascaded diffusion pipeline that chains a base diffusion model with a dedicated upsampler to progressively increase image resolution in stages, and uses classifier-guided diffusion sampling to steer the reverse diffusion process toward higher-quality outputs. The framework provides tools for training diffusion models from scratch using distributed processes with gradient accumulation, as well as training classifier models that provide gradient-based guidance during sampling. It supports both un
Steers a diffusion model's sampling process with a classifier to produce higher-fidelity images.
This is a TensorFlow implementation of the Deep Convolutional Generative Adversarial Network (DCGAN) architecture, providing a framework for training generative models that produce synthetic images from random noise vectors. The project implements the core DCGAN design, using transposed convolutions for upsampling, batch normalization for training stability, and leaky ReLU activations in the discriminator, all executed as static TensorFlow computation graphs. The implementation supports training on custom image datasets by accepting user-supplied image folders without requiring a predefined f
Transforms random noise vectors through a trained generator to produce synthetic images.
This repository is a collection of practical deep learning implementations and examples built using the TensorFlow framework. It provides a variety of neural network architectures focusing on natural language processing, recommendation systems, reinforcement learning, and time series prediction. The project features a range of specialized models, including sequence-to-sequence and transformer architectures for text processing, and factorization machines for personalized ranking and retrieval. It also includes implementations of reinforcement learning agents using actor-critic and policy gradi
Implements GAN-based noise-to-image generators to produce synthetic image data.
Instruct-pix2pix is an instruction-based image model and PyTorch library designed to modify visual content by following natural language directions. It functions as a diffusion model image editor that applies human-written instructions to existing pictures rather than using traditional text-to-image prompts. The project provides a fine-tunable diffusion framework for adapting pre-trained checkpoints to specific image editing datasets. It includes a synthetic dataset generator that creates paired images and text triplets to train models on various image editing tasks. The system covers a rang
Transforms input images by adding specific noise and denoising them guided by text prompts.
StableCascade is a generative AI system and latent diffusion framework designed for text-to-image synthesis and image-to-image transformations. It utilizes a multi-stage cascade architecture that encodes and decodes images via a latent space to produce high-fidelity visual imagery. The system includes a cascade diffusion pipeline for controlling image structure through inpainting, outpainting, and super-resolution. It also provides a toolkit for image-to-image generation and the creation of image variations using embeddings. The framework supports model optimization through low-rank adaptati
Implements image-to-image transformation by adding and then removing noise to refine existing visual content.
This project is a framework for training and sampling generative models designed to produce high-quality images in few steps. It provides implementations for image generation models that transform random noise into structured visual data through an optimized sampling process. The system specializes in accelerating image generation through consistency distillation and consistency training. It includes tools to transform pre-trained diffusion models into faster versions by distilling knowledge from a teacher model into a student model, as well as methods to train consistency models from scratch
Transforms random Gaussian noise into structured visual data using a denoising diffusion and sampling process.
StoryDiffusion is a generative AI system designed for consistent character image and video generation. It utilizes a pluggable cross-attention module to inject shared character representations into pretrained diffusion models, allowing for visual identity stability across multiple images and scenes without retraining the base model. The project features a video generation pipeline that produces temporally coherent sequences from text prompts or condition images. It employs a latent space motion interpolator to predict intermediate frames and semantic motion, enabling long-range video generati
Generates high-quality visuals by reversing the noise process via iterative denoising.
Este proyecto es una colección de modelos predictivos y herramientas cuantitativas para la previsión de precios de acciones. Implementa una variedad de arquitecturas de aprendizaje automático, incluyendo redes generativas antagónicas (GAN), redes de memoria a largo plazo (LSTM) y modelos de lenguaje para análisis financiero. El sistema se distingue por combinar la previsión de series temporales con el procesamiento de lenguaje natural para convertir noticias financieras en puntuaciones de sentimiento numéricas. También incorpora la generación de datos de mercado sintéticos y la optimización automatizada de hiperparámetros utilizando métodos bayesianos y de aprendizaje por refuerzo para reducir el error de predicción. El código base cubre una amplia gama de capacidades de finanzas cuantitativas, incluyendo la descomposición de señales mediante transformadas de Fourier y la eliminación de ruido de datos a través de modelos autorregresivos. Además, proporciona utilidades para el cálculo de indicadores técnicos, clasificación de importancia de características e integración de índices económicos externos.
Creates synthetic market data distributions using generator and discriminator networks to improve price forecasting.
AnimeGANv2 es un framework de entrenamiento de redes generativas antagónicas (GAN) y una herramienta de estilización de imágenes diseñada para convertir fotografías y vídeos reales en imágenes con estilo anime. Funciona como un generador de estilo anime que transforma escenas reales en animación mediante transferencia de estilo supervisada. El proyecto proporciona un sistema para entrenar modelos de estilo y extraer parámetros de peso específicos del generador a partir de checkpoints de deep learning para crear modelos ligeros para inferencia. Se centra en la estilización de paisajes y en la capacidad de imitar estilos artísticos específicos a partir de datasets proporcionados. El framework admite tanto la conversión de foto a anime como de vídeo a anime, aplicando una estética consistente en cada fotograma. Sus capacidades cubren la generación de arte mediante IA y el entrenamiento de generadores para replicar estilos objetivo.
Functions as a GAN-based tool that transforms real-world landscape photographs and videos into anime imagery.
StarGAN es un framework de traducción de imagen a imagen en PyTorch diseñado para sintetizar estilos visuales y atributos a través de múltiples dominios. Implementa una red generativa antagónica (GAN) que sirve como traductor de imágenes de aprendizaje profundo para modificar características visuales específicas dentro de un conjunto de datos de imágenes. El framework utiliza un modelo unificado único para manejar traducciones entre múltiples dominios de imagen en lugar de requerir pares separados de modelos. Es una implementación de investigación que aprende mapeos entre diferentes atributos de imagen sin necesidad de datos de entrenamiento emparejados. El proyecto cubre el entrenamiento y la optimización de modelos generativos, incluyendo la aplicación de checkpoints de modelos pre-entrenados para inferencia. También proporciona utilidades para la preparación y organización de conjuntos de datos de imágenes basados en etiquetas y divisiones.
Provides a framework that learns mappings between different image attributes without requiring paired training data.
DragGAN es un editor y manipulador de imágenes generativas interactivo que permite a los usuarios remodelar la salida visual moviendo puntos de control en una variedad de redes generativas. Funciona como una herramienta para la edición de imágenes basada en puntos, mapeando cambios de coordenadas definidos por el usuario al espacio latente de un modelo generativo para deformar imágenes. El sistema incluye una herramienta de inversión de imágenes generativas que convierte fotografías reales en representaciones latentes. Este proceso permite la manipulación interactiva de contenido no generado al llevar imágenes del mundo real a un formato compatible para la red generativa adversaria. El proyecto cubre una amplia superficie de capacidades, incluyendo la inversión de imagen a latente, seguimiento de puntos diferenciable y optimización de descenso de gradiente iterativo. Estos componentes trabajan juntos para traducir los movimientos de los puntos de control gráficos en modificaciones visuales precisas mientras se restringe la salida a una distribución de imágenes realistas.
Provides a tool for manipulating generative images by dragging points to reshape the output on a generative manifold.
AnimeGAN es una red generativa antagónica (GAN) y traductor de imágenes desarrollado con TensorFlow. Está diseñado para la transferencia de estilo de foto a anime, utilizando un sistema de aprendizaje profundo para transformar fotografías del mundo real y fotogramas de video en imágenes de estilo anime. El sistema incluye un convertidor de video a anime que aplica transformaciones visuales consistentes a través de fotogramas secuenciales. Admite tanto el entrenamiento de redes generativas en datasets artísticos para replicar estilos específicos como la extracción de pesos del generador a partir de puntos de control (checkpoints) para una inferencia eficiente. El proyecto proporciona utilidades para el refinamiento de imágenes, incluyendo suavizado de bordes y desenfoque para mejorar las transiciones visuales. También gestiona el procesamiento de archivos de video a través de pipelines de fotogramas secuenciales.
Implements a GAN architecture specifically designed to transform real-world photos into stylized anime images.
Este proyecto es un framework de modelos generativos basado en PyTorch, diseñado para transformar ruido en distribuciones de datos complejas mediante el aprendizaje de campos vectoriales y trayectorias de probabilidad. Funciona como un kit de herramientas generativo multimodal para producir texto e imágenes sintéticas a través de flujos de probabilidad aprendidos. La librería se distingue por su soporte para integraciones en variedades continuas, discretas y de Riemann. Esto permite que el framework maneje una variedad de tipos de datos, incluyendo datos categóricos mediante el emparejamiento de flujos de estado discreto y espacios no euclidianos mediante la integración en variedades de Riemann. El kit de herramientas cubre todo el pipeline generativo, incluyendo la definición de trayectorias de probabilidad, regresión de campos vectoriales y el uso de solvers de ecuaciones diferenciales para el muestreo de datos. Estas capacidades permiten el entrenamiento e inferencia de modelos generativos capaces de crear contenido sintético en múltiples modalidades.
Generates synthetic images by integrating learned vector fields to transform noise into visual data.
Este proyecto es una implementación en PyTorch de AnimeGANv2, una red generativa antagónica (GAN) y modelo de traducción de imagen a imagen diseñado para transformar fotografías del mundo real en imágenes de anime estilizadas. El repositorio incluye un convertidor de pesos de modelos que permite la traducción de checkpoints a través de diferentes entornos de ejecución. Esta utilidad realiza el remapeo de claves de pesos y la permutación de dimensiones de tensores para asegurar la compatibilidad entre implementaciones de frameworks. El sistema soporta la estilización de fotos con IA mediante la carga de pesos preentrenados y proporciona alineación de upsampling configurable para mantener la coherencia visual durante los aumentos de resolución de imagen.
Uses GAN architectures specifically designed for transforming real-world photographs into anime artistic styles.
RestorePhotos es una herramienta de restauración facial por IA y un escalador de imágenes de deep learning diseñado para eliminar el desenfoque y reconstruir detalles perdidos en fotografías faciales degradadas. Funciona como un potenciador de fotos faciales y un procesador de imágenes de redes generativas antagónicas (GAN) que transforma píxeles de baja calidad en rasgos faciales de alta resolución. El sistema utiliza un motor de inferencia acelerado por GPU para ejecutar modelos de machine learning para la restauración de imágenes en tiempo real. Esta aceleración de hardware admite las pesadas multiplicaciones de matrices y operaciones basadas en tensores necesarias para enfocar imágenes faciales y mejorar la fidelidad visual. El proyecto cubre la restauración de fotos por IA y la restauración de archivos digitales, centrándose específicamente en la mejora de imágenes faciales. Emplea un pipeline de procesamiento secuencial para realizar el escalado de imágenes mediante deep learning, aumentando la resolución y claridad de las imágenes al reconstruir los detalles faltantes.
Implements a generative adversarial network to reconstruct facial details and remove blur from degraded photographs.
This project is an educational course and collection of training materials focused on generative diffusion models. It provides a curriculum and practical guides for training, fine-tuning, and deploying models capable of synthesizing images, audio, and video. The material covers specific implementation strategies including noise-based synthesis, iterative refinement, and latent space compression. It provides instruction on guiding generative outputs through conditional synthesis and prompt adherence optimization, as well as techniques for image inpainting and text-based editing. The project i
Covers the process of generating high-resolution images from random noise via iterative denoising in latent space.