awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 Repos

Awesome GitHub RepositoriesTraining Data Compression

Compression techniques specifically designed to reduce the footprint of training datasets.

Distinct from Video Processing: Distinct from general video codecs by focusing on reducing training costs while preserving quality.

Explore 2 awesome GitHub repositories matching part of an awesome list · Training Data Compression. Refine with filters or upvote what's useful.

Awesome Training Data Compression GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • pku-yuangroup/open-sora-planAvatar von PKU-YuanGroup

    PKU-YuanGroup/Open-Sora-Plan

    12,163Auf GitHub ansehen↗

    Open-Sora-Plan is a text-to-video framework and distributed video training system. It utilizes a diffusion transformer architecture and large language model components to transform written descriptions or image prompts into high-quality video sequences. The system features a distributed infrastructure designed for large-scale video training and inference. It employs sequence parallelism to split high-resolution or long-duration video samples across multiple GPUs and uses a sparse attention mechanism to increase processing speed. The project includes capabilities for both text-to-video and im

    Reduces the size of video frames to lower training costs while preserving high image quality.

    Python
    Auf GitHub ansehen↗12,163
  • facebookresearch/starspaceAvatar von facebookresearch

    facebookresearch/Starspace

    3,954Auf GitHub ansehen↗

    Starspace ist ein Vektor-Embedding-Framework, das für das Training hochdimensionaler Repräsentationen von Text und Bildern entwickelt wurde. Es fungiert als Machine-Learning-System für neuronales Ranking, Textklassifizierung und Knowledge-Graph-Embedding und bildet verschiedene Objekttypen in einen gemeinsamen numerischen Raum ab, um Abruf- und Vorhersageaufgaben zu erleichtern. Das System enthält spezialisierte Tools für die Vervollständigung von Knowledge-Graphen und Link-Vorhersagen, indem Entitäten und ihre Beziehungen innerhalb eines multirelationalen Vektorraums dargestellt werden. Es bietet zudem Funktionen für semantische Inhaltsempfehlungen und groß angelegte Textklassifizierung durch Abbildung von Eingaben auf Ziel-Labels oder Kandidatenelemente. Das Framework deckt breite Funktionsbereiche ab, einschließlich ähnlicher Entitäts-Rankings, Vektor-Embedding-Extraktion aus Dokumenten oder N-Grammen und der Verwendung von Random-Walk-basiertem Training. Um große Datensätze zu verwalten, integriert es diskbasiertes komprimiertes Datenladen und Negative-Sampling-Optimierung.

    Supports reading training data from compressed formats to minimize the disk footprint of large datasets.

    C++
    Auf GitHub ansehen↗3,954
  1. Home
  2. Part of an Awesome List
  3. Media & Communication
  4. Video Processing
  5. Training Data Compression