1 repositorio
Transformer architectures that process visual data across multiple scales to balance global structure and fine detail.
Distinct from Diffusion Transformers: Distinct from general diffusion transformers: specifically focuses on the multi-resolution scaling aspect of the architecture.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multi-Resolution Processing. Refine with filters or upvote what's useful.
HunyuanDiT es un modelo generativo bilingüe de texto a imagen y un generador de imágenes de transformador de difusión. Utiliza un sistema de difusión latente para sintetizar imágenes de alta resolución a partir de prompts de texto, con un enfoque específico en la comprensión y generación de contenido a partir de descripciones en chino e inglés. El proyecto presenta una arquitectura de transformador de resolución múltiple y un espacio de incrustación bilingüe para mapear diferentes scripts en un área semántica compartida. Admite el refinamiento iterativo de imágenes en múltiples turnos, lo que traduce el diálogo conversacional en prompts actualizados para modificar progresivamente el contenido visual. El sistema incluye capacidades para el subtitulado automático de imágenes, restricciones estructurales de imagen para el control del diseño y ajuste fino de los pesos del modelo para adaptar el generador a conjuntos de datos o estilos artísticos específicos. Las optimizaciones de rendimiento incluyen la destilación del modelo para la aceleración de la inferencia y el soporte para la ejecución en hardware con poca memoria de video.
Employs a multi-resolution transformer architecture to process visual data across different scales for better structural and detail balance.