awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 repositorios

Awesome GitHub RepositoriesTraining Data Compression

Compression techniques specifically designed to reduce the footprint of training datasets.

Distinct from Video Processing: Distinct from general video codecs by focusing on reducing training costs while preserving quality.

Explore 2 awesome GitHub repositories matching part of an awesome list · Training Data Compression. Refine with filters or upvote what's useful.

Awesome Training Data Compression GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • pku-yuangroup/open-sora-planAvatar de PKU-YuanGroup

    PKU-YuanGroup/Open-Sora-Plan

    12,163Ver en GitHub↗

    Open-Sora-Plan is a text-to-video framework and distributed video training system. It utilizes a diffusion transformer architecture and large language model components to transform written descriptions or image prompts into high-quality video sequences. The system features a distributed infrastructure designed for large-scale video training and inference. It employs sequence parallelism to split high-resolution or long-duration video samples across multiple GPUs and uses a sparse attention mechanism to increase processing speed. The project includes capabilities for both text-to-video and im

    Reduces the size of video frames to lower training costs while preserving high image quality.

    Python
    Ver en GitHub↗12,163
  • facebookresearch/starspaceAvatar de facebookresearch

    facebookresearch/Starspace

    3,954Ver en GitHub↗

    Starspace es un framework de vector embedding diseñado para entrenar representaciones de alta dimensión de texto e imágenes. Funciona como un sistema de aprendizaje automático para ranking neuronal, clasificación de texto y embedding de grafos de conocimiento, mapeando diferentes tipos de objetos en un espacio numérico compartido para facilitar tareas de recuperación y predicción. El sistema incluye herramientas especializadas para la finalización de grafos de conocimiento y predicción de enlaces representando entidades y sus relaciones dentro de un espacio vectorial multirelacional. Además, proporciona capacidades para la recomendación de contenido semántico y clasificación de texto a gran escala mapeando entradas a etiquetas objetivo o elementos candidatos. El framework cubre áreas de capacidad amplias, incluyendo ranking de entidades basado en similitud, extracción de vector embedding de documentos o n-gramas, y el uso de entrenamiento basado en caminatas aleatorias (random-walk). Para gestionar grandes datasets, incorpora carga de datos comprimidos basada en disco y optimización de muestreo negativo.

    Supports reading training data from compressed formats to minimize the disk footprint of large datasets.

    C++
    Ver en GitHub↗3,954
  1. Home
  2. Part of an Awesome List
  3. Media & Communication
  4. Video Processing
  5. Training Data Compression