1 रिपॉजिटरी
Transformer architectures that process visual data across multiple scales to balance global structure and fine detail.
Distinct from Diffusion Transformers: Distinct from general diffusion transformers: specifically focuses on the multi-resolution scaling aspect of the architecture.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Multi-Resolution Processing. Refine with filters or upvote what's useful.
HunyuanDiT एक द्विभाषी टेक्स्ट-टू-इमेज जनरेटिव मॉडल और डिफ्यूज़न ट्रांसफ़ॉर्मर इमेज जनरेटर है। यह टेक्स्ट प्रॉम्प्ट्स से उच्च-रिज़ॉल्यूशन वाली इमेज को संश्लेषित करने के लिए एक लेटेंट डिफ्यूज़न सिस्टम का उपयोग करता है, जिसका मुख्य ध्यान चीनी और अंग्रेजी दोनों भाषा के विवरणों से सामग्री को समझने और उत्पन्न करने पर है। इस प्रोजेक्ट में एक मल्टी-रिज़ॉल्यूशन ट्रांसफ़ॉर्मर आर्किटेक्चर और विभिन्न लिपियों को एक साझा सिमेंटिक क्षेत्र में मैप करने के लिए एक द्विभाषी एम्बेडिंग स्पेस है। यह पुनरावृत्ति मल्टी-टर्न इमेज रिफाइनमेंट का समर्थन करता है, जो दृश्य सामग्री को क्रमिक रूप से संशोधित करने के लिए संवादात्मक संवाद को अपडेट किए गए प्रॉम्प्ट्स में अनुवादित करता है। इस सिस्टम में ऑटोमेटेड इमेज कैप्शनिंग, लेआउट नियंत्रण के लिए स्ट्रक्चरल इमेज बाधाएं, और विशिष्ट डेटासेट या कलात्मक शैलियों के लिए जनरेटर को अनुकूलित करने के लिए मॉडल वेट फ़ाइन-ट्यूनिंग की क्षमताएं शामिल हैं। प्रदर्शन अनुकूलन में इन्फरेंस त्वरण के लिए मॉडल डिस्टिलेशन और कम वीडियो मेमोरी वाले हार्डवेयर पर निष्पादन के लिए समर्थन शामिल है।
Employs a multi-resolution transformer architecture to process visual data across different scales for better structural and detail balance.