awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

7 repositorios

Awesome GitHub RepositoriesStreaming Source and Sink Integration

Connectivity frameworks for ingesting data from sources and egressing it to sinks in streaming pipelines.

Distinct from Streaming Source and Sink Tables: Shortlist candidates focus on specific SQL table definitions or AI integrations rather than the general source/sink architectural pattern.

Explore 7 awesome GitHub repositories matching data & databases · Streaming Source and Sink Integration. Refine with filters or upvote what's useful.

Awesome Streaming Source and Sink Integration GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • zhisheng17/flink-learningAvatar de zhisheng17

    zhisheng17/flink-learning

    15,071Ver en GitHub↗

    This project is a collection of educational resources and reference implementations for the Apache Flink stream processing framework. It provides a learning resource focused on mastering distributed stream processing through implementation guides, performance tuning tutorials, and practical examples. The repository features detailed walkthroughs for building real-time data pipelines using the DataStream and Table APIs. It includes specific integration examples for connecting Apache Flink with Kafka brokers and Elasticsearch indices, as well as reference implementations for real-time deduplica

    Implements connectivity between processing jobs and external systems for data ingestion and egress.

    Javaclickhouseelasticsearchflink
    Ver en GitHub↗15,071
  • vesoft-inc/nebulaAvatar de vesoft-inc

    vesoft-inc/nebula

    12,239Ver en GitHub↗

    Nebula is a distributed graph database designed for storing and querying massive volumes of interconnected vertices and edges across a horizontally scalable cluster. It functions as a Kubernetes-native database and a distributed graph analytics engine, utilizing a Raft-based distributed store to ensure strong consistency and high availability. The system features an OpenCypher query engine for performing complex graph traversals and pattern matching. It distinguishes itself with a decoupled compute-storage architecture and a shared-nothing distributed design, allowing query processing and dat

    Provides a specialized stream processing connector for real-time data exchange with Apache Flink.

    C++big-datacppdatabase
    Ver en GitHub↗12,239
  • apache/flink-cdcAvatar de apache

    apache/flink-cdc

    6,430Ver en GitHub↗

    This project is a streaming data integration framework that captures real-time database changes and synchronizes them with downstream systems. It operates as a distributed streaming ETL and database synchronizer, reading database logs and snapshots to propagate row-level modifications to target sinks. The system supports declarative data integration, allowing users to define source-to-sink data flows using SQL or YAML configurations. It distinguishes itself by automating schema evolution to maintain synchronization when source structures change and ensuring exactly-once delivery and processin

    A streaming data integration framework that leverages Apache Flink connectors to synchronize database changes.

    Javabatchcdcchange-data-capture
    Ver en GitHub↗6,430
  • treeverse/lakefsAvatar de treeverse

    treeverse/lakeFS

    5,406Ver en GitHub↗

    lakeFS es un sistema de versionado de lagos de datos que proporciona ramificaciones (branching) y commits similares a Git para grandes conjuntos de datos almacenados en almacenamiento de objetos. Funciona como una capa de control de versiones, permitiendo la creación de instantáneas inmutables, commits atómicos y ramificaciones de copia cero para crear entornos aislados para la experimentación de datos sin duplicar archivos físicos. El sistema sirve como una puerta de enlace de almacenamiento compatible con S3 y un catálogo REST de Iceberg, permitiendo que los protocolos de almacenamiento en la nube estándar y los clientes compatibles gestionen tablas versionadas. Actúa como un guardián de calidad de datos mediante el uso de un sistema de hooks basado en eventos para validar conjuntos de datos contra políticas de gobernanza antes de que los cambios se fusionen en producción. La plataforma cubre amplias capacidades para la gobernanza de datos, incluyendo colaboración mediante pull requests, control de acceso basado en roles y seguimiento del linaje de datos. Proporciona integración para la orquestación de flujos de trabajo, pipelines de aprendizaje automático y varios motores de cómputo de big data, soportando conectividad de almacenamiento multi-nube y sincronización de identidad mediante SSO y SCIM. El software se puede instalar utilizando binarios, contenedores o Helm charts para su despliegue en Kubernetes.

    Exports high-throughput data feeds from streaming platforms into versioned object stores via S3 sinks.

    Go
    Ver en GitHub↗5,406
  • jimhigson/oboe.jsAvatar de jimhigson

    jimhigson/oboe.js

    4,819Ver en GitHub↗

    oboe.js es un analizador (parser) de JSON por streaming y un cliente HTTP diseñado para el procesamiento incremental de datos. Permite que las aplicaciones actúen sobre objetos JSON individuales a medida que llegan de una solicitud de red o un flujo de lectura, antes de que se complete la descarga total. La biblioteca funciona como un transformador de flujos JSON, permitiendo la modificación, filtrado y mapeo de nodos al vuelo. Cuenta con selección de nodos basada en rutas para activar callbacks cuando se encuentran patrones específicos y puede terminar una conexión de red prematuramente una vez que se encuentran los datos requeridos para ahorrar ancho de banda. Para manejar conjuntos de datos que superan la memoria disponible del sistema, la biblioteca utiliza una gestión de memoria basada en flujos para descartar los nodos procesados. También admite la fusión de registros históricos con actualizaciones en tiempo real a través de conexiones de larga duración y proporciona la capacidad de recuperar datos parciales si se interrumpe una conexión.

    Consumes data from any compatible stream source, including network sockets and local files.

    JavaScript
    Ver en GitHub↗4,819
  • kotlin/kotlinx-ioAvatar de Kotlin

    Kotlin/kotlinx-io

    1,539Ver en GitHub↗

    Kotlinx-io is a multiplatform library designed for input and output operations, providing a unified interface for streaming data, managing byte buffers, and interacting with local filesystems. It serves as a cross-platform abstraction layer that standardizes how applications handle data movement across different operating systems and hardware architectures. The library distinguishes itself by providing high-performance tools for both mutable and immutable byte sequences. It utilizes segmented memory pools and direct memory access to minimize allocation overhead and prevent unnecessary data co

    Standardizes data movement by providing consistent interfaces for reading from sources and writing to sinks.

    Kotliniokotlinkotlinx
    Ver en GitHub↗1,539
  • mrsuichuan/data-warehouse-learningAvatar de MrSuiChuan

    MrSuiChuan/data-warehouse-learning

    1,154Ver en GitHub↗

    Data warehouse learning is a reference implementation of a real-time stream processing system and open-source data lakehouse architecture. It combines stream processing engines, open lakehouse formats, and analytical data warehouses into a complete e-commerce data warehouse system built for both offline and real-time analytics pipelines. The project implements hybrid data warehouse architectures utilizing multi-layer storage models and stream-batch processing pipelines. It features change data capture pipelines that stream database transaction logs into messaging systems, progressive data tra

    Implements an e-commerce data warehouse system built with Flink, Paimon, and Doris for real-time analytics.

    Javadatartdinkydolphinscheduler
    Ver en GitHub↗1,154
  1. Home
  2. Data & Databases
  3. Streaming Source and Sink Integration

Explorar subetiquetas

  • Apache Flink ConnectorsSpecialized stream processing connectors for real-time data exchange with Apache Flink. **Distinct from Streaming Source and Sink Integration:** Distinct from Streaming Source and Sink Integration: specifically focuses on the Apache Flink ecosystem.