awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectDespreCum realizăm clasamentulPresăServer MCP
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
facebookresearch avatar

facebookresearch/DiTArchived

0
View on GitHub↗
8,642 stele·796 fork-uri·Python·7 vizualizări

DiT

DiT este un model de difuzie latentă și un framework de AI generativ bazat pe transformatoare, implementat în PyTorch. Funcționează ca un generator de imagini condiționat de clasă care înlocuiește backbone-urile convoluționale tradiționale cu o arhitectură de transformator pentru a sintetiza imagini de înaltă fidelitate.

Proiectul utilizează procesarea latentă bazată pe patch-uri și compresia spațiului latent pentru a opera pe reprezentări de imagini cu dimensiuni reduse. Încorporează ghidaj condiționat de clasă și scale de ghidaj ajustabile pentru a controla conținutul vizual al imaginilor generate în timpul procesului de eșantionare.

Framework-ul acoperă antrenarea distribuită a modelelor, eșantionarea iterativă a zgomotului și crearea de seturi de date de imagini sintetice. Include, de asemenea, instrumente pentru evaluarea calității modelului pentru a calcula scorurile de acuratețe și calitate față de benchmark-urile standard.

Features

  • Diffusion Transformers - Combines transformer-based attention with diffusion-based denoising to synthesize high-fidelity images.
  • Diffusion Model Training - Provides distributed training workflows for transformer-based latent diffusion models to improve scalability and speed.
  • Patch-Based Processing - Splits latent image representations into small patches to be processed as tokens by the transformer architecture.
  • Latent Space Compression - Utilizes low-dimensional representations to reduce computational overhead while maintaining high visual fidelity.
  • Latent Diffusion Models - Performs iterative denoising within compressed latent spaces to produce high-fidelity synthetic images.
  • Conditional Image Generation - Implements guidance mechanisms that use category labels to control the visual content of generated images.
  • Transformer-Based Generative Backbones - Replaces traditional convolutional backbones with transformer blocks to improve scaling in image generation.
  • Latent Noise Prediction - Generates images by iteratively predicting and removing noise within a compressed latent representation.
  • Synthetic Content Generators - Produces synthetic visual content by adjusting sampling steps and guidance scales from pre-trained weights.
  • Diffusion Model Evaluators - Provides tools to calculate accuracy and quality scores for diffusion model outputs against standard benchmarks.
  • Conditional Training - Provides scripts to train models that are conditioned on specific class labels via embedding concatenation.
  • Image Set Sampling - Produces batches of images by adjusting class-conditional weights and guidance scales during the sampling process.
  • Large Scale Training - Provides distributed training capabilities to scale model training across multiple GPUs for large-scale image datasets.
  • Synthetic Dataset Generation - Generates large batches of high-quality synthetic images to create datasets for visual benchmarking.
  • Diffusion Model Research - Scalable diffusion models using transformer backbones.
  • Vision Transformers - Scalable diffusion models built upon transformer architectures.
  • Generation - Listed in the “Generation” section of the Awesome Diffusion Models awesome list.

Istoric stele

Graficul istoricului de stele pentru facebookresearch/ditGraficul istoricului de stele pentru facebookresearch/dit

Căutare AI

Explorează mai multe repository-uri excelente

Descrie ce ai nevoie în limbaj simplu — AI-ul sortează mii de proiecte open source selectate în funcție de relevanță.

Start searching with AI

Alternative open-source pentru DiT

Proiecte open-source similare, clasificate după numărul de funcționalități comune cu DiT.
  • compvis/latent-diffusionAvatar CompVis

    CompVis/latent-diffusion

    14,072Vezi pe GitHub↗

    Latent Diffusion is a framework for high-resolution image synthesis that performs the denoising process within a compressed latent space. It uses variational autoencoders to encode images into a lower-dimensional representation, reducing the computational cost of noise prediction compared to operating on raw pixels. The project enables text-to-image generation by integrating natural language descriptions through cross-attention conditioning. It also supports image inpainting and restoration, filling masked or missing image areas with generated content, and example-based synthesis using retrie

    Jupyter Notebook
    Vezi pe GitHub↗14,072
  • huggingface/diffusion-models-classAvatar huggingface

    huggingface/diffusion-models-class

    4,331Vezi pe GitHub↗

    This project is an educational course and collection of training materials focused on generative diffusion models. It provides a curriculum and practical guides for training, fine-tuning, and deploying models capable of synthesizing images, audio, and video. The material covers specific implementation strategies including noise-based synthesis, iterative refinement, and latent space compression. It provides instruction on guiding generative outputs through conditional synthesis and prompt adherence optimization, as well as techniques for image inpainting and text-based editing. The project i

    Jupyter Notebook
    Vezi pe GitHub↗4,331
  • lucidrains/dalle2-pytorchAvatar lucidrains

    lucidrains/DALLE2-pytorch

    11,310Vezi pe GitHub↗

    This is a PyTorch implementation of a text-to-image model designed for synthesizing high-fidelity images from natural language descriptions. It utilizes a diffusion image generator to transform latent embeddings into visual data through an iterative denoising process. The system employs a two-stage latent mapping process, using a CLIP-based latent prior to map text embeddings to image embeddings before decoding them into pixels. It features a cascading diffusion decoder that produces high-resolution imagery by passing low-resolution outputs through a sequence of models at increasing scales.

    Pythonartificial-intelligencedeep-learningtext-to-image
    Vezi pe GitHub↗11,310
  • tingsongyu/pytorch_tutorialAvatar TingsongYu

    TingsongYu/PyTorch_Tutorial

    8,018Vezi pe GitHub↗

    This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene

    Python
    Vezi pe GitHub↗8,018
Vezi toate cele 30 alternative pentru DiT→

Întrebări frecvente

Ce face facebookresearch/dit?

DiT este un model de difuzie latentă și un framework de AI generativ bazat pe transformatoare, implementat în PyTorch. Funcționează ca un generator de imagini condiționat de clasă care înlocuiește backbone-urile convoluționale tradiționale cu o arhitectură de transformator pentru a sintetiza imagini de înaltă fidelitate.

Care sunt principalele funcționalități ale facebookresearch/dit?

Principalele funcționalități ale facebookresearch/dit sunt: Diffusion Transformers, Diffusion Model Training, Patch-Based Processing, Latent Space Compression, Latent Diffusion Models, Conditional Image Generation, Transformer-Based Generative Backbones, Latent Noise Prediction.

Care sunt câteva alternative open-source pentru facebookresearch/dit?

Alternativele open-source pentru facebookresearch/dit includ: compvis/latent-diffusion — Latent Diffusion is a framework for high-resolution image synthesis that performs the denoising process within a… huggingface/diffusion-models-class — This project is an educational course and collection of training materials focused on generative diffusion models. It… lucidrains/dalle2-pytorch — This is a PyTorch implementation of a text-to-image model designed for synthesizing high-fidelity images from natural… tingsongyu/pytorch_tutorial — This project is a comprehensive collection of educational examples and reference implementations for building vision… openai/improved-diffusion — This project is a diffusion model framework for training and sampling from denoising probabilistic models to generate… stability-ai/generative-models — This is a framework for training and sampling diffusion models to generate high-fidelity images, video, and 4D assets.…