2 repositorios
Manages the migration of massive datasets using controlled batching to optimize memory and avoid packet limits.
Distinct from Large-Scale Dataset Management: Distinct from Large-Scale Dataset Management: focuses on the active process of migration via batching rather than general storage management.
Explore 2 awesome GitHub repositories matching data & databases · Batch-Driven Data Migration. Refine with filters or upvote what's useful.
ActiveRecord Import es una biblioteca para insertar grandes conjuntos de datos en una base de datos utilizando ActiveRecord a través de consultas únicas o por lotes. Funciona como un importador de datos masivos y herramienta de inserción masiva SQL diseñada para minimizar la sobrecarga de consultas y aumentar el rendimiento de escritura. El proyecto incluye un motor de upsert para manejar conflictos de restricciones únicas actualizando registros existentes o ignorando duplicados. También cuenta con un importador de asociaciones recursivas que permite insertar registros padre y sus asociaciones hijas anidadas en una sola operación. La biblioteca proporciona una capa de validación previa a la inserción para verificar la validez de los registros e informar fallos antes de confirmar los datos. Gestiona la migración de datos a gran escala dividiendo los conjuntos de datos en lotes para controlar el uso de memoria y evitar los límites de tamaño de paquete de la base de datos. La herramienta proporciona resúmenes de resultados que contienen recuentos de éxito e identificadores de registros, junto con el seguimiento del progreso para los lotes de datos.
Processes massive datasets in controlled batches to manage memory usage and avoid database packet size limits.
This project provides a collection of command-line tools and scripts designed to automate the ingestion, migration, and preparation of large-scale annotated image datasets. It serves as a utility for managing the retrieval of image collections paired with bounding box and segmentation annotations, facilitating their integration into machine learning data pipelines. The toolset enables the bulk transfer of image data and metadata manifests into private cloud storage environments. It utilizes manifest-driven orchestration to process structured resource locations, ensuring that raw image files r
Automates bulk retrieval and migration of large-scale media datasets by processing structured resource manifests.