2 Repos
Compression techniques specifically designed to reduce the footprint of training datasets.
Distinct from Video Processing: Distinct from general video codecs by focusing on reducing training costs while preserving quality.
Explore 2 awesome GitHub repositories matching part of an awesome list · Training Data Compression. Refine with filters or upvote what's useful.
Open-Sora-Plan is a text-to-video framework and distributed video training system. It utilizes a diffusion transformer architecture and large language model components to transform written descriptions or image prompts into high-quality video sequences. The system features a distributed infrastructure designed for large-scale video training and inference. It employs sequence parallelism to split high-resolution or long-duration video samples across multiple GPUs and uses a sparse attention mechanism to increase processing speed. The project includes capabilities for both text-to-video and im
Reduces the size of video frames to lower training costs while preserving high image quality.
Starspace ist ein Vektor-Embedding-Framework, das für das Training hochdimensionaler Repräsentationen von Text und Bildern entwickelt wurde. Es fungiert als Machine-Learning-System für neuronales Ranking, Textklassifizierung und Knowledge-Graph-Embedding und bildet verschiedene Objekttypen in einen gemeinsamen numerischen Raum ab, um Abruf- und Vorhersageaufgaben zu erleichtern. Das System enthält spezialisierte Tools für die Vervollständigung von Knowledge-Graphen und Link-Vorhersagen, indem Entitäten und ihre Beziehungen innerhalb eines multirelationalen Vektorraums dargestellt werden. Es bietet zudem Funktionen für semantische Inhaltsempfehlungen und groß angelegte Textklassifizierung durch Abbildung von Eingaben auf Ziel-Labels oder Kandidatenelemente. Das Framework deckt breite Funktionsbereiche ab, einschließlich ähnlicher Entitäts-Rankings, Vektor-Embedding-Extraktion aus Dokumenten oder N-Grammen und der Verwendung von Random-Walk-basiertem Training. Um große Datensätze zu verwalten, integriert es diskbasiertes komprimiertes Datenladen und Negative-Sampling-Optimierung.
Supports reading training data from compressed formats to minimize the disk footprint of large datasets.