awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

36 Repos

Awesome GitHub RepositoriesData Ingestion Pipelines

Tools for moving, streaming, and synchronizing data between systems.

Explore 36 awesome GitHub repositories matching part of an awesome list · Data Ingestion Pipelines. Refine with filters or upvote what's useful.

Awesome Data Ingestion Pipelines GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • apache/pulsarAvatar von apache

    apache/pulsar

    15,276Auf GitHub ansehen↗

    Apache Pulsar is a cloud-native distributed pub-sub messaging system designed for high-performance data ingestion. It functions as a geo-replicated data streamer and a multi-tenant event streaming platform, providing a serverless stream processing engine and a tiered storage messaging broker. The system distinguishes itself by separating serving layers from storage layers to allow independent scaling of compute and data retention. It features native geo-replication to synchronize messages across different geographical regions and employs a multi-layered tenant isolation model using authentica

    Distributed pub-sub messaging platform with flexible messaging models.

    Java
    Auf GitHub ansehen↗15,276
  • yahoo/kafka-managerAvatar von yahoo

    yahoo/kafka-manager

    11,926Auf GitHub ansehen↗

    Kafka Manager is a web-based management interface and monitoring tool for Apache Kafka clusters. It serves as a central control plane for topic administration, consumer monitoring, and cluster health inspection. The project provides specialized utilities for data rebalancing and partition reassignment to distribute workloads across brokers. It also includes tools to optimize partition leadership by electing preferred replicas. The platform covers a broad range of administrative capabilities, including the creation and configuration of message topics, tracking of consumer offsets, and the col

    Management interface for Apache Kafka clusters.

    Scala
    Auf GitHub ansehen↗11,926
  • kreuzberg-dev/kreuzbergAvatar von kreuzberg-dev

    kreuzberg-dev/kreuzberg

    8,527Auf GitHub ansehen↗

    Kreuzberg is a document extraction engine that converts PDFs, Office files, images, and over 90 other formats into clean, structured text and metadata. It is built around a compiled Rust core that can be used as a native library, a command-line tool, a REST API server, or a WebAssembly module for browser-based processing. The system is designed to run entirely on self-hosted infrastructure, with no data leaving the user's environment. What distinguishes Kreuzberg is its breadth of integration surfaces and its pipeline architecture. It exposes extraction capabilities through native bindings fo

    Polyglot library for document intelligence and extraction.

    Rustdocument-intelligenceelixirffi
    Auf GitHub ansehen↗8,527
  • wurstmeister/kafka-dockerAvatar von wurstmeister

    wurstmeister/kafka-docker

    6,968Auf GitHub ansehen↗

    This project provides a containerized distribution of Apache Kafka for deploying distributed messaging brokers and event streaming platforms. It functions as a cluster orchestrator that enables the launch of interconnected brokers to establish high-throughput data pipelines. The system uses environment variables to automate topic provisioning and configure broker parameters during the container boot sequence. It manages network listener mapping and advertised hostnames to facilitate client connectivity across different networks. Capability areas include cluster deployment, broker scaling man

    Containerized deployment for Kafka.

    Shell
    Auf GitHub ansehen↗6,968
  • edenhill/kafkacatAvatar von edenhill

    edenhill/kafkacat

    5,761Auf GitHub ansehen↗

    Kafkacat ist eine Suite von Kommandozeilen-Dienstprogrammen für die Interaktion mit Apache Kafka-Clustern. Sie bietet ein Nicht-JVM-Binärprogramm zum Produzieren und Konsumieren von Nachrichten, zum Untersuchen von Cluster-Metadaten und zum Debuggen des Kafka-Protokolls über das Terminal. Das Tool fungiert als Producer und Consumer, der in der Lage ist, Daten aus Dateien oder der Standardeingabe zu pushen und Nachrichten aus spezifischen Topics und Partitionen zu lesen. Es enthält einen Metadaten-Inspektor zum Abrufen des Cluster-Status und der Partitionskonfigurationen in Klartext oder JSON sowie einen Protokoll-Debugger zur Untersuchung von Nachrichten-Offsets, Zeitstempeln und Binär-Payloads. Das Projekt deckt die Datendeserialisierung unter Verwendung von Schemas oder primitiven Dekodern sowie offsetbasierte Abfragen ab, um Daten von präzisen Zeitstempeln abzurufen. Zudem bietet es Simulationsdienstprogramme zum Ausführen ephemerer In-Memory-Broker für Integrationstests und Performance-Benchmarking.

    Generic command-line producer and consumer for Kafka.

    C
    Auf GitHub ansehen↗5,761
  • rudderlabs/rudder-serverAvatar von rudderlabs

    rudderlabs/rudder-server

    4,437Auf GitHub ansehen↗

    Rudder Server ist eine Customer Data Platform (CDP) und Event-Routing-Pipeline, die darauf ausgelegt ist, Kundendaten zu sammeln, zu transformieren und von verschiedenen Quellen an Data Warehouses und Business-Tools weiterzuleiten. Es fungiert als Customer-Identity-Resolver, der Identifikatoren aus mehreren Quellen verknüpft, um einen einheitlichen Identitätsgraphen und umfassende verhaltensbasierte Kundenprofile zu erstellen. Das System zeichnet sich durch Reverse-ETL-Funktionen aus, die verarbeitete Kundensegmente und Zielgruppen aus Data Warehouses zurück in operative Drittanbieteranwendungen pushen. Es bietet zudem eine containerisierte Datenebene für Kubernetes-Deployments, was die Verwaltung der Dateninfrastruktur als Code ermöglicht. Die Plattform deckt eine breite Palette von Datenmanagement-Funktionen ab, einschließlich Echtzeit-Event-Transformation, Schema-Validierung via Datenkatalogen und Privacy-Governance. Dazu gehören Tools zur Verwaltung der Benutzereinwilligung, zur Durchsetzung der Datenresidenz innerhalb spezifischer geografischer Regionen und zur Maskierung personenbezogener Daten während der Übertragung. Installation und Deployment der Datenebenen-Komponenten werden mittels Helm-Charts verwaltet.

    Open-source customer data infrastructure for event streaming.

    Gobigquerycdpcustomer-data
    Auf GitHub ansehen↗4,437
  • apache/iggyAvatar von apache

    apache/iggy

    4,382Auf GitHub ansehen↗

    Iggy is a distributed message streaming platform and multi-protocol message broker that functions as a persistent distributed log store. It provides infrastructure for publishing and consuming binary messages using an append-only log, ensuring high availability and data consistency across nodes through Viewstamped Replication. The platform is distinguished by its specialized LLM streaming infrastructure, which uses a server protocol to connect large language models to streaming data and system controls. This includes standardized protocols for context management and data bridging via HTTP or

    Provides a modular system for ingesting and forwarding data between external sources and streams using plugins.

    Rustapachehttpiggy
    Auf GitHub ansehen↗4,382
  • awslabs/aws-data-wranglerAvatar von awslabs

    awslabs/aws-data-wrangler

    4,107Auf GitHub ansehen↗

    Dieses Projekt ist eine AWS-Pandas-Integrationsbibliothek und ein Daten-Pipeline-Framework, das entwickelt wurde, um die Bewegung und Transformation von Daten zwischen lokalem Speicher und AWS-Speicher- und Analysediensten zu vereinfachen. Es fungiert als Cloud-Data-Lake-Toolkit und Storage-File-Manager, der es Nutzern ermöglicht, strukturierte Daten über verschiedene Cloud-Umgebungen hinweg zu lesen, zu schreiben und zu transformieren. Die Bibliothek zeichnet sich als verteilter Compute-Orchestrator aus, der Cluster in Umgebungen wie EMR verwalten kann, um Datensätze zu verarbeiten, die die Speichergrenzen einer einzelnen Maschine überschreiten. Sie bietet zudem spezialisierte Funktionen zur Verwaltung von Vektor-Indizes und zur Durchführung von Ähnlichkeitssuchen innerhalb von Cloud-Storage-Buckets. Die breiteren Funktionen umfassen Cloud-Datenbank-ETL für Dienste wie DynamoDB, RDS und Timestream sowie Cloud-Data-Catalog-Management via AWS Glue. Sie unterstützt serverlose Datenanalyse durch Athena und Redshift und bietet Utilities zur Verwaltung von S3-Objekten, zur Indexierung von Dokumenten in OpenSearch und zur Analyse von CloudWatch-Logs.

    Utility belt for handling data operations on AWS.

    Python
    Auf GitHub ansehen↗4,107
  • facebookarchive/scribeAvatar von facebookarchive

    facebookarchive/scribe

    3,911Auf GitHub ansehen↗

    Scribe ist ein verteiltes Log-Aggregationssystem, das entwickelt wurde, um Echtzeit-Logdaten von zahlreichen Servern zu sammeln und an zentralen Speicher oder Analysetools weiterzuleiten. Es fungiert als Log-Daten-Pipeline und skalierbarer Collector, der Streaming-Daten erfasst und auf lokale Festplatten oder entfernte Endpunkte schreibt. Das System verwendet ein Log-Routing-Server-Modell, das eingehende Streams basierend auf vordefinierten Konfigurationsmappings in spezifische Buckets organisiert. Es unterstützt Multi-Hop-Log-Forwarding, wodurch Daten über eine Kette von Zwischenservern geleitet werden können, um Logs aus diversen Netzwerksegmenten zu zentralisieren. Zuverlässigkeit und Beobachtbarkeit werden durch lokales Festplatten-Buffering verwaltet, das ausgehende Nachrichten bei Netzwerkausfällen speichert, um Datenverlust zu verhindern, sowie durch zählerbasiertes Health-Monitoring, um interne Nachrichtenzahlen und den Erfolg der Zustellung zu verfolgen. Die Architektur umfasst zudem asynchrones Nachrichten-Streaming und zentralisiertes Log-Routing, um hochdurchsatzfähige Datenströme über ein Netzwerk hinweg zu verwalten.

    Aggregator for streaming log data.

    C++
    Auf GitHub ansehen↗3,911
  • bruin-data/ingestrAvatar von bruin-data

    bruin-data/ingestr

    3,714Auf GitHub ansehen↗

    ingestr is a command-line tool for copying and syncing data between different database engines and third-party platforms without writing custom code. It functions as an ETL pipeline utility that extracts data from diverse sources and loads it into destinations. The tool features a schema-agnostic data loader that maps source fields to destination columns dynamically, removing the need for predefined static table definitions. It also operates as an incremental data synchronizer, updating destination tables by appending new records or merging changes to maintain current datasets. The system pr

    CLI tool for copying data between various sources.

    Go
    Auf GitHub ansehen↗3,714
  • mozilla-services/hekaAvatar von mozilla-services

    mozilla-services/heka

    3,403Auf GitHub ansehen↗

    DEPRECATED: Data collection and processing made easy.

    Stream processing software for data collection.

    Go
    Auf GitHub ansehen↗3,403
  • sohu-co/kafka-nodeAvatar von SOHU-Co

    SOHU-Co/kafka-node

    2,652Auf GitHub ansehen↗

    Node.js client for Apache Kafka 0.8 and later.

    Node.js client for Apache Kafka.

    JavaScript
    Auf GitHub ansehen↗2,652
  • linkedin/gobblinAvatar von linkedin

    linkedin/gobblin

    2,267Auf GitHub ansehen↗

    A distributed data integration framework that simplifies common aspects of big data integration such as data ingestion, replication, organization and lifecycle management for both streaming and batch data ecosystems.

    Universal framework for data ingestion.

    Java
    Auf GitHub ansehen↗2,267
  • apache/incubator-gobblinAvatar von apache

    apache/incubator-gobblin

    2,267Auf GitHub ansehen↗

    A distributed data integration framework that simplifies common aspects of big data integration such as data ingestion, replication, organization and lifecycle management for both streaming and batch data ecosystems.

    Universal data ingestion framework for Hadoop.

    Java
    Auf GitHub ansehen↗2,267
  • pinterest/secorAvatar von pinterest

    pinterest/secor

    1,858Auf GitHub ansehen↗

    Secor is a service implementing Kafka log persistence

    Service for implementing Kafka log persistence.

    Java
    Auf GitHub ansehen↗1,858
  • bruin-data/bruinAvatar von bruin-data

    bruin-data/bruin

    1,620Auf GitHub ansehen↗

    Build data pipelines with SQL and Python, ingest data from different sources, add quality checks, and build end-to-end flows.

    End-to-end pipeline tool for ingestion and quality checks.

    Goanalyticsbigquerydata-analysis
    Auf GitHub ansehen↗1,620
  • edenhill/librdkafkaAvatar von edenhill

    edenhill/librdkafka

    991Auf GitHub ansehen↗

    The Apache Kafka C/C++ library

    C/C++ library for Apache Kafka integration.

    C
    Auf GitHub ansehen↗991
  • netflix/suroAvatar von Netflix

    Netflix/suro

    796Auf GitHub ansehen↗

    Netflix's distributed Data Pipeline

    Log aggregator based on Chukwa architecture.

    Java
    Auf GitHub ansehen↗796
  • gazette/coreAvatar von gazette

    gazette/core

    793Auf GitHub ansehen↗

    Build platforms that flexibly mix SQL, batch, and stream processing paradigms

    Distributed streaming infrastructure built on cloud storage.

    Go
    Auf GitHub ansehen↗793
  • skizzehq/skizzeAvatar von skizzehq

    skizzehq/skizze

    772Auf GitHub ansehen↗

    A probabilistic data structure service and storage

    Probabilistic data store for counting and sketching.

    Go
    Auf GitHub ansehen↗772
Vorherige12Nächste
  1. Home
  2. Part of an Awesome List
  3. Databases & Data
  4. Data Ingestion Pipelines