awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 repository-uri

Awesome GitHub RepositoriesData Wrangling

Libraries for cleaning and augmenting datasets to improve model training.

Explore 5 awesome GitHub repositories matching part of an awesome list · Data Wrangling. Refine with filters or upvote what's useful.

Awesome Data Wrangling GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • albu/albumentationsAvatar albu

    albu/albumentations

    15,308Vezi pe GitHub↗

    Albumentations is an image augmentation library and computer vision preprocessing tool designed to expand datasets for deep learning models. It provides a collection of transformations that modify pixel values and spatial geometry to increase the diversity of training samples and improve model generalization. The library supports both 2D image augmentation and 3D volumetric data augmentation. It handles a variety of labels alongside images, ensuring that bounding boxes, keypoints, and segmentation masks remain accurately aligned when spatial transformations are applied. The tool incorporates

    High-performance library for image augmentation tasks.

    Python
    Vezi pe GitHub↗15,308
  • aleju/imgaugAvatar aleju

    aleju/imgaug

    14,742Vezi pe GitHub↗

    imgaug is a Python library for machine learning data augmentation and computer vision dataset expansion. It provides tools to increase the volume and variety of training sets by applying random geometric, color, and noise transformations to images. The library ensures spatial consistency by synchronizing transformations across images and their associated annotations, such as bounding boxes, keypoints, and segmentation maps. It uses a compositional pipeline pattern to chain multiple augmentations into sequences and employs deterministic seed management to reproduce specific data samples. The

    Library for image augmentation and keypoint transformation.

    Python
    Vezi pe GitHub↗14,742
  • mdbloice/augmentorAvatar mdbloice

    mdbloice/Augmentor

    5,137Vezi pe GitHub↗

    Augmentor este o bibliotecă și un framework Python de augmentare a imaginilor, conceput pentru a extinde seturile de date de machine learning. Funcționează ca un instrument de preprocesare care generează variații sintetice ale imaginilor pentru a crește diversitatea datelor și ca un streamer de date de antrenament care introduce imagini și etichete augmentate direct în buclele rețelelor neuronale, fără a necesita stocare intermediară pe disc. Framework-ul menține alinierea spațială între imagini și măștile corespunzătoare, ceea ce este necesar pentru antrenarea segmentării semantice. Suportă diverse transformări geometrice și la nivel de pixel, inclusiv distorsiuni elastice, schimbări de perspectivă prin înclinare și rotire, rotație, forfecare și ștergerea aleatorie a regiunilor. Sistemul include capabilități pentru strategii de procesare per-clasă pentru a aborda dezechilibrul datelor și utilizează multi-threading pentru a accelera generarea paralelă a seturilor de date augmentate. Oferă, de asemenea, utilitare pentru curățarea și standardizarea fișierelor imagine brute în etapa de preprocesare.

    User-friendly tool for image augmentation in classification tasks.

    Python
    Vezi pe GitHub↗5,137
  • facebookresearch/auglyAvatar facebookresearch

    facebookresearch/AugLy

    5,086Vezi pe GitHub↗

    AugLy este o bibliotecă de augmentare a datelor multimodale și un augmentator de seturi de date pentru machine learning. Oferă un sistem pentru generarea de variații sintetice ale datelor de antrenament pe seturi de date audio, imagine, text și video pentru a crește diversitatea eșantioanelor și a îmbunătăți robustețea modelului. Biblioteca funcționează ca un simulator de zgomot multimedia, conceput special pentru a imita capturile reale ale utilizatorilor prin suprapunerea șabloanelor de social media și a artefactelor de internet peste media. Include un tracker de proveniență a datelor pentru a înregistra transformările specifice și nivelurile de intensitate aplicate fiecărei piese de date augmentate. Instrumentul acoperă o gamă largă de capabilități de expansiune a seturilor de date, inclusiv transformări lingvistice pentru text, transformări temporale și vizuale pentru video și transformări sonice pentru audio.

    Multi-modal data augmentation library for audio, image, and text.

    Python
    Vezi pe GitHub↗5,086
  • cgnorthcutt/cleanlabAvatar cgnorthcutt

    cgnorthcutt/cleanlab

    57Vezi pe GitHub↗

    Official cleanlab repo is at https://github.com/cleanlab/cleanlab

    Automated detection and correction of labeling errors in datasets.

    Vezi pe GitHub↗57
  1. Home
  2. Part of an Awesome List
  3. Databases & Data
  4. Data Wrangling