awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 dépôts

Awesome GitHub RepositoriesTraining Data Compression

Compression techniques specifically designed to reduce the footprint of training datasets.

Distinct from Video Processing: Distinct from general video codecs by focusing on reducing training costs while preserving quality.

Explore 2 awesome GitHub repositories matching part of an awesome list · Training Data Compression. Refine with filters or upvote what's useful.

Awesome Training Data Compression GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • pku-yuangroup/open-sora-planAvatar de PKU-YuanGroup

    PKU-YuanGroup/Open-Sora-Plan

    12,163Voir sur GitHub↗

    Open-Sora-Plan is a text-to-video framework and distributed video training system. It utilizes a diffusion transformer architecture and large language model components to transform written descriptions or image prompts into high-quality video sequences. The system features a distributed infrastructure designed for large-scale video training and inference. It employs sequence parallelism to split high-resolution or long-duration video samples across multiple GPUs and uses a sparse attention mechanism to increase processing speed. The project includes capabilities for both text-to-video and im

    Reduces the size of video frames to lower training costs while preserving high image quality.

    Python
    Voir sur GitHub↗12,163
  • facebookresearch/starspaceAvatar de facebookresearch

    facebookresearch/Starspace

    3,954Voir sur GitHub↗

    Starspace est un framework de vecteurs d'embedding conçu pour entraîner des représentations de haute dimension de texte et d'images. Il fonctionne comme un système de machine learning pour le ranking neuronal, la classification de texte et l'embedding de graphes de connaissances, mappant différents types d'objets dans un espace numérique partagé pour faciliter les tâches de récupération et de prédiction. Le système inclut des outils spécialisés pour la complétion de graphes de connaissances et la prédiction de liens en représentant les entités et leurs relations au sein d'un espace vectoriel multi-relationnel. Il fournit en outre des capacités pour la recommandation de contenu sémantique et la classification de texte à grande échelle en mappant les entrées vers des étiquettes cibles ou des éléments candidats. Le framework couvre de larges domaines de capacités incluant le ranking d'entités basé sur la similarité, l'extraction d'embedding vectoriel à partir de documents ou de n-grammes, et l'utilisation de l'entraînement basé sur des marches aléatoires (random-walk). Pour gérer de grands jeux de données, il intègre un chargement de données compressées sur disque et une optimisation par échantillonnage négatif.

    Supports reading training data from compressed formats to minimize the disk footprint of large datasets.

    C++
    Voir sur GitHub↗3,954
  1. Home
  2. Part of an Awesome List
  3. Media & Communication
  4. Video Processing
  5. Training Data Compression