17 Repos
Tools and platforms for moving, streaming, and synchronizing data.
Explore 17 awesome GitHub repositories matching part of an awesome list · Data Ingestion. Refine with filters or upvote what's useful.
Apache Pulsar is a cloud-native distributed pub-sub messaging system designed for high-performance data ingestion. It functions as a geo-replicated data streamer and a multi-tenant event streaming platform, providing a serverless stream processing engine and a tiered storage messaging broker. The system distinguishes itself by separating serving layers from storage layers to allow independent scaling of compute and data retention. It features native geo-replication to synchronize messages across different geographical regions and employs a multi-layered tenant isolation model using authentica
Distributed pub-sub messaging platform with flexible messaging models.
Rudder Server ist eine Customer Data Platform (CDP) und Event-Routing-Pipeline, die darauf ausgelegt ist, Kundendaten zu sammeln, zu transformieren und von verschiedenen Quellen an Data Warehouses und Business-Tools weiterzuleiten. Es fungiert als Customer-Identity-Resolver, der Identifikatoren aus mehreren Quellen verknüpft, um einen einheitlichen Identitätsgraphen und umfassende verhaltensbasierte Kundenprofile zu erstellen. Das System zeichnet sich durch Reverse-ETL-Funktionen aus, die verarbeitete Kundensegmente und Zielgruppen aus Data Warehouses zurück in operative Drittanbieteranwendungen pushen. Es bietet zudem eine containerisierte Datenebene für Kubernetes-Deployments, was die Verwaltung der Dateninfrastruktur als Code ermöglicht. Die Plattform deckt eine breite Palette von Datenmanagement-Funktionen ab, einschließlich Echtzeit-Event-Transformation, Schema-Validierung via Datenkatalogen und Privacy-Governance. Dazu gehören Tools zur Verwaltung der Benutzereinwilligung, zur Durchsetzung der Datenresidenz innerhalb spezifischer geografischer Regionen und zur Maskierung personenbezogener Daten während der Übertragung. Installation und Deployment der Datenebenen-Komponenten werden mittels Helm-Charts verwaltet.
Open-source customer data infrastructure for event routing.
Scribe ist ein verteiltes Log-Aggregationssystem, das entwickelt wurde, um Echtzeit-Logdaten von zahlreichen Servern zu sammeln und an zentralen Speicher oder Analysetools weiterzuleiten. Es fungiert als Log-Daten-Pipeline und skalierbarer Collector, der Streaming-Daten erfasst und auf lokale Festplatten oder entfernte Endpunkte schreibt. Das System verwendet ein Log-Routing-Server-Modell, das eingehende Streams basierend auf vordefinierten Konfigurationsmappings in spezifische Buckets organisiert. Es unterstützt Multi-Hop-Log-Forwarding, wodurch Daten über eine Kette von Zwischenservern geleitet werden können, um Logs aus diversen Netzwerksegmenten zu zentralisieren. Zuverlässigkeit und Beobachtbarkeit werden durch lokales Festplatten-Buffering verwaltet, das ausgehende Nachrichten bei Netzwerkausfällen speichert, um Datenverlust zu verhindern, sowie durch zählerbasiertes Health-Monitoring, um interne Nachrichtenzahlen und den Erfolg der Zustellung zu verfolgen. Die Architektur umfasst zudem asynchrones Nachrichten-Streaming und zentralisiertes Log-Routing, um hochdurchsatzfähige Datenströme über ein Netzwerk hinweg zu verwalten.
Aggregator for streaming log data.
ingestr is a command-line tool for copying and syncing data between different database engines and third-party platforms without writing custom code. It functions as an ETL pipeline utility that extracts data from diverse sources and loads it into destinations. The tool features a schema-agnostic data loader that maps source fields to destination columns dynamically, removing the need for predefined static table definitions. It also operates as an incremental data synchronizer, updating destination tables by appending new records or merging changes to maintain current datasets. The system pr
CLI utility for copying data between various sources.
DEPRECATED: Data collection and processing made easy.
Open-source stream processing and data collection system.
A distributed data integration framework that simplifies common aspects of big data integration such as data ingestion, replication, organization and lifecycle management for both streaming and batch data ecosystems.
Universal framework for data ingestion and integration.
Secor is a service implementing Kafka log persistence
Service for implementing Kafka log persistence.
Build data pipelines with SQL and Python, ingest data from different sources, add quality checks, and build end-to-end flows.
End-to-end pipeline tool for ingestion, transformation, and quality.
Netflix's distributed Data Pipeline
Log aggregation system based on Chukwa.
Build platforms that flexibly mix SQL, batch, and stream processing paradigms
Distributed streaming infrastructure built on cloud storage.
A probabilistic data structure service and storage
Probabilistic data store for counting and sketching.
🦎 A multi-protocol edge & service proxy. Seamlessly interface web apps, IoT clients, & microservices to Apache Kafka® via declaratively defined, stateless APIs.
API gateway for event-driven architectures and streaming protocols.
Hadoop log aggregator and dashboard
Log aggregation and dashboarding tool.
Hadoop Data Integration with various databases, ftp servers, salesforce. Incremental update, dedup, append, merge your data on Hadoop.
Framework for connecting disparate data sources to Hadoop.
DocId set compression and set operation library
Utility for compressing sorted integer arrays.