2 dépôts
Manages the migration of massive datasets using controlled batching to optimize memory and avoid packet limits.
Distinct from Large-Scale Dataset Management: Distinct from Large-Scale Dataset Management: focuses on the active process of migration via batching rather than general storage management.
Explore 2 awesome GitHub repositories matching data & databases · Batch-Driven Data Migration. Refine with filters or upvote what's useful.
ActiveRecord Import est une bibliothèque pour insérer de grands jeux de données dans une base de données en utilisant ActiveRecord via des requêtes uniques ou par lots. Il fonctionne comme un importateur de données en masse et un outil d'insertion SQL en masse conçu pour minimiser la surcharge des requêtes et augmenter les performances d'écriture. Le projet inclut un moteur d'upsert pour gérer les conflits de contraintes uniques en mettant à jour les enregistrements existants ou en ignorant les doublons. Il dispose également d'un importateur d'associations récursives qui permet aux enregistrements parents et à leurs associations enfants imbriquées d'être insérés en une seule opération. La bibliothèque fournit une couche de validation pré-insertion pour vérifier la validité des enregistrements et signaler les échecs avant de valider les données. Elle gère la migration de données à grande échelle en divisant les jeux de données en lots pour contrôler l'utilisation de la mémoire et éviter les limites de taille de paquet de la base de données. L'outil fournit des résumés de résultats contenant les comptes de succès et les identifiants d'enregistrements, ainsi qu'un suivi de progression pour les lots de données.
Processes massive datasets in controlled batches to manage memory usage and avoid database packet size limits.
This project provides a collection of command-line tools and scripts designed to automate the ingestion, migration, and preparation of large-scale annotated image datasets. It serves as a utility for managing the retrieval of image collections paired with bounding box and segmentation annotations, facilitating their integration into machine learning data pipelines. The toolset enables the bulk transfer of image data and metadata manifests into private cloud storage environments. It utilizes manifest-driven orchestration to process structured resource locations, ensuring that raw image files r
Automates bulk retrieval and migration of large-scale media datasets by processing structured resource manifests.