1 مستودع
Transformer architectures that process visual data across multiple scales to balance global structure and fine detail.
Distinct from Diffusion Transformers: Distinct from general diffusion transformers: specifically focuses on the multi-resolution scaling aspect of the architecture.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multi-Resolution Processing. Refine with filters or upvote what's useful.
HunyuanDiT هو نموذج توليدي ثنائي اللغة لتحويل النص إلى صورة ومولد صور يعتمد على محولات الانتشار (diffusion transformer). يستخدم نظام انتشار كامن لتوليف صور عالية الدقة من مطالبات نصية، مع تركيز خاص على فهم وتوليد المحتوى من الأوصاف باللغتين الصينية والإنجليزية. يتميز المشروع ببنية محول متعددة الدقة ومساحة تضمين ثنائية اللغة لربط نصوص مختلفة في منطقة دلالية مشتركة. يدعم تحسين الصور التكراري متعدد الجولات، والذي يترجم الحوار التفاعلي إلى مطالبات محدثة لتعديل المحتوى المرئي تدريجياً. يتضمن النظام قدرات للتعليق التوضيحي التلقائي للصور، وقيود هيكلية للصور للتحكم في التخطيط، وضبط أوزان النموذج لتكييف المولد مع مجموعات بيانات أو أنماط فنية محددة. تشمل تحسينات الأداء تقطير النموذج لتسريع الاستدلال ودعم التنفيذ على الأجهزة ذات ذاكرة الفيديو المنخفضة.
Employs a multi-resolution transformer architecture to process visual data across different scales for better structural and detail balance.