1 dépôt
Transformer architectures that process visual data across multiple scales to balance global structure and fine detail.
Distinct from Diffusion Transformers: Distinct from general diffusion transformers: specifically focuses on the multi-resolution scaling aspect of the architecture.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multi-Resolution Processing. Refine with filters or upvote what's useful.
HunyuanDiT est un modèle génératif texte-image bilingue et un générateur d'images par transformateur de diffusion. Il utilise un système de diffusion latente pour synthétiser des images haute résolution à partir d'invites textuelles, avec un accent particulier sur la compréhension et la génération de contenu à partir de descriptions en chinois et en anglais. Le projet présente une architecture de transformateur multi-résolution et un espace d'embedding bilingue pour mapper différentes écritures dans un espace sémantique partagé. Il prend en charge le raffinement d'image itératif multi-tours, qui traduit le dialogue conversationnel en invites mises à jour pour modifier progressivement le contenu visuel. Le système inclut des capacités pour le sous-titrage automatique d'images, des contraintes structurelles d'image pour le contrôle de la mise en page, et le réglage fin (fine-tuning) des poids du modèle pour adapter le générateur à des jeux de données ou des styles artistiques spécifiques. Les optimisations de performance incluent la distillation de modèle pour l'accélération de l'inférence et la prise en charge de l'exécution sur du matériel avec une faible mémoire vidéo.
Employs a multi-resolution transformer architecture to process visual data across different scales for better structural and detail balance.