2 dépôts
Compression techniques specifically designed to reduce the footprint of training datasets.
Distinct from Video Processing: Distinct from general video codecs by focusing on reducing training costs while preserving quality.
Explore 2 awesome GitHub repositories matching part of an awesome list · Training Data Compression. Refine with filters or upvote what's useful.
Open-Sora-Plan is a text-to-video framework and distributed video training system. It utilizes a diffusion transformer architecture and large language model components to transform written descriptions or image prompts into high-quality video sequences. The system features a distributed infrastructure designed for large-scale video training and inference. It employs sequence parallelism to split high-resolution or long-duration video samples across multiple GPUs and uses a sparse attention mechanism to increase processing speed. The project includes capabilities for both text-to-video and im
Reduces the size of video frames to lower training costs while preserving high image quality.
Starspace est un framework de vecteurs d'embedding conçu pour entraîner des représentations de haute dimension de texte et d'images. Il fonctionne comme un système de machine learning pour le ranking neuronal, la classification de texte et l'embedding de graphes de connaissances, mappant différents types d'objets dans un espace numérique partagé pour faciliter les tâches de récupération et de prédiction. Le système inclut des outils spécialisés pour la complétion de graphes de connaissances et la prédiction de liens en représentant les entités et leurs relations au sein d'un espace vectoriel multi-relationnel. Il fournit en outre des capacités pour la recommandation de contenu sémantique et la classification de texte à grande échelle en mappant les entrées vers des étiquettes cibles ou des éléments candidats. Le framework couvre de larges domaines de capacités incluant le ranking d'entités basé sur la similarité, l'extraction d'embedding vectoriel à partir de documents ou de n-grammes, et l'utilisation de l'entraînement basé sur des marches aléatoires (random-walk). Pour gérer de grands jeux de données, il intègre un chargement de données compressées sur disque et une optimisation par échantillonnage négatif.
Supports reading training data from compressed formats to minimize the disk footprint of large datasets.