2 dépôts
Mechanisms that isolate and record data that fails type conversion or validation during the ETL process.
Distinct from Data Quality Monitors: Focuses on capturing failing records for quality assurance, rather than tracking general health metrics over time.
Explore 2 awesome GitHub repositories matching data & databases · Dirty Data Capture. Refine with filters or upvote what's useful.
DataX is a distributed data integration framework and plugin-based ETL tool designed for synchronizing large datasets between heterogeneous sources and destinations. It functions as a JDBC data migration engine and offline synchronization tool, enabling the movement of data between relational databases, NoSQL stores, and object storage. The system utilizes a plugin-based connector architecture that decouples reader and writer logic, allowing it to map and transform data types across different storage engines using a standardized internal representation. This design supports heterogeneous data
Captures and isolates records that fail during transfer due to type conversion errors to maintain data quality.
Chunjun est un framework d'intégration de données distribué et un pipeline ETL basé sur SQL conçu pour synchroniser les données entre des sources hétérogènes. Il fonctionne comme un outil de capture de données modifiées (CDC) et un synchroniseur de données hétérogènes, utilisant un environnement de traitement distribué pour déplacer et transformer les données à travers différents types de bases de données. Le système se distingue par son architecture de connecteurs basée sur des plugins, qui permet le développement de plugins de source et de destination personnalisés pour étendre la connectivité aux systèmes de données non pris en charge. Il prend en charge la capture de données modifiées en temps réel à partir des journaux de bases de données relationnelles et implémente la propagation de l'évolution de schéma pour appliquer automatiquement les changements structurels des tables sources aux tables de destination. Le framework fournit des capacités pour la synchronisation de données incrémentielle et le calcul de données inter-sources utilisant la logique SQL. La fiabilité est gérée via une récupération de tâche basée sur des points de contrôle pour reprendre les transferts interrompus et des files d'attente de lettres mortes pour la gestion des données sales afin d'auditer les enregistrements mal formés. Les tâches d'intégration peuvent être déployées sur des clusters autonomes, Yarn ou des environnements Kubernetes, avec une prise en charge du déploiement conteneurisé via Docker.
Isolates and stores malformed records that fail processing to prevent pipeline crashes and enable correction.