2 Repos
Training and distillation methods designed to reduce the temporal cost of generating samples from generative models.
Distinct from Distributed Consistency Models: Distinct from Distributed Consistency Models: focuses on reducing generation latency in AI models rather than data consistency in distributed systems.
Explore 2 awesome GitHub repositories matching software engineering & architecture · Inference Speed Optimization. Refine with filters or upvote what's useful.
This project is a framework for training and sampling generative models designed to produce high-quality images in few steps. It provides implementations for image generation models that transform random noise into structured visual data through an optimized sampling process. The system specializes in accelerating image generation through consistency distillation and consistency training. It includes tools to transform pre-trained diffusion models into faster versions by distilling knowledge from a teacher model into a student model, as well as methods to train consistency models from scratch
Reduces the temporal cost of image creation by training student models to mimic teacher models.
LongCat-Video ist eine Sammlung spezialisierter Modelle für die Videosynthese, die auf einer Large-Language-Model-Architektur basiert, um hochauflösende Videos aus Text, Bildern oder bestehenden Sequenzen zu erstellen. Es enthält dedizierte Systeme für Text-to-Video-Generierung, Image-to-Video-Animation und die Erstellung sprechender Avatare. Das Projekt bietet spezifische Funktionen zur Verlängerung bestehender Clips durch ein Video-Continuation-Modell, das nachfolgende Frames vorhersagt. Es ermöglicht zudem die Synchronisation von Lippenbewegungen mit Audio- und Text-Prompts, um sprechende Videos zu produzieren. Das System integriert verschiedene Optimierungstechniken zur Steuerung der Generierungseffizienz, einschließlich destillationsbasiertem Sampling und Quantisierung, um Speicherverbrauch und Inferenzlatenz zu reduzieren. Zusätzliche strukturelle Komponenten decken die Kompression im latenten Raum und die räumlich-zeitliche Modellierung ab, um die Konsistenz über Zeit und Raum hinweg zu wahren.
Reduces generation latency and memory usage through distillation and quantization.