2 repositorios
Compression techniques specifically designed to reduce the footprint of training datasets.
Distinct from Video Processing: Distinct from general video codecs by focusing on reducing training costs while preserving quality.
Explore 2 awesome GitHub repositories matching part of an awesome list · Training Data Compression. Refine with filters or upvote what's useful.
Open-Sora-Plan is a text-to-video framework and distributed video training system. It utilizes a diffusion transformer architecture and large language model components to transform written descriptions or image prompts into high-quality video sequences. The system features a distributed infrastructure designed for large-scale video training and inference. It employs sequence parallelism to split high-resolution or long-duration video samples across multiple GPUs and uses a sparse attention mechanism to increase processing speed. The project includes capabilities for both text-to-video and im
Reduces the size of video frames to lower training costs while preserving high image quality.
Starspace es un framework de vector embedding diseñado para entrenar representaciones de alta dimensión de texto e imágenes. Funciona como un sistema de aprendizaje automático para ranking neuronal, clasificación de texto y embedding de grafos de conocimiento, mapeando diferentes tipos de objetos en un espacio numérico compartido para facilitar tareas de recuperación y predicción. El sistema incluye herramientas especializadas para la finalización de grafos de conocimiento y predicción de enlaces representando entidades y sus relaciones dentro de un espacio vectorial multirelacional. Además, proporciona capacidades para la recomendación de contenido semántico y clasificación de texto a gran escala mapeando entradas a etiquetas objetivo o elementos candidatos. El framework cubre áreas de capacidad amplias, incluyendo ranking de entidades basado en similitud, extracción de vector embedding de documentos o n-gramas, y el uso de entrenamiento basado en caminatas aleatorias (random-walk). Para gestionar grandes datasets, incorpora carga de datos comprimidos basada en disco y optimización de muestreo negativo.
Supports reading training data from compressed formats to minimize the disk footprint of large datasets.