5 repositorios
The process of joining live event streams with reference data from external databases to add context.
Distinct from Database Change Streaming: Candidates are for video streaming or change streaming; none cover the logical enrichment of a stream via database joins.
Explore 5 awesome GitHub repositories matching data & databases · Stream Enrichment. Refine with filters or upvote what's useful.
RisingWave is a cloud-native streaming database and real-time analytics engine that uses standard SQL to process continuous data streams. It functions as a streaming data lakehouse, combining the capabilities of a streaming SQL database with a platform that integrates streaming ingestion with open table formats. The system is distinguished by its use of the PostgreSQL wire protocol, allowing it to integrate with existing SQL tools and drivers. It employs a decoupled compute and storage architecture, persisting streaming state and materialized views in cloud object storage to enable independen
Joins streaming events with reference data from databases and automatically updates outputs when reference data changes.
Snowplow is a behavioral event data pipeline and customer data infrastructure designed to capture user interactions and transform them into structured events for real-time analysis and long-term storage. It functions as a customer data platform that gathers user signals and enriches them with metadata to create a unified view of customer behavior. The system operates as an event schema validation engine to enforce strict data contracts on incoming streams, preventing data corruption. It further serves as a real-time event router and an event-driven automation platform, triggering proactive bu
Joins live event streams with reference data from external sources to add real-time context.
Hazelcast is a distributed data platform that combines an in-memory data grid with a stream processing engine to support real-time analytics and event-driven applications. It functions as a partitioned, distributed key-value store that replicates data across cluster nodes to provide low-latency access and high availability. The platform also serves as a distributed SQL query engine, allowing users to execute standard SQL statements against both in-memory datasets and external data sources. What distinguishes Hazelcast is its use of a distributed consensus subsystem to maintain strongly consis
Combines real-time event streams with static reference data stored in distributed maps to add context to processed records.
Este proyecto es una colección de frameworks y pipelines de big data, que incluye un framework de análisis de Apache Hive, una plataforma de análisis de datos de comportamiento, un motor de análisis predictivo y pipelines de datos en tiempo real. Proporciona la infraestructura para construir flujos de trabajo ETL (Extract, Transform, Load) para procesar grandes conjuntos de datos para almacenamiento distribuido y análisis basado en SQL. El sistema admite diversas implementaciones analíticas, como un motor predictivo que utiliza regresión lineal para la previsión de valores y una arquitectura en tiempo real que mueve datos a través de intermediarios de mensajes para informes inmediatos. Incluye capacidades especializadas para análisis de comportamiento del usuario, medición de rendimiento de comercio electrónico y análisis de datos de tránsito urbano. El código base cubre una amplia superficie de ingeniería y análisis de datos, incluyendo limpieza y transformación de datos, ingesta de datos distribuida, procesamiento de flujos basado en ventanas y visualización de resultados mediante herramientas de inteligencia de negocios. Además, permite el cálculo de métricas de negocio específicas como tasas de conversión, rendimiento de monetización y niveles de compromiso del usuario.
Augments real-time event streams by joining them with reference data from external databases to add descriptive metadata.
Ignite es una plataforma de cómputo y rejilla de datos distribuida en memoria. Funciona como una base de datos SQL distribuida y un motor de almacenamiento diseñado para almacenar y procesar grandes conjuntos de datos en RAM para minimizar la latencia y aumentar la velocidad de cálculo. El sistema se distingue por un motor de almacenamiento de varios niveles que gestiona la ubicación de los datos a través de la memoria y el disco para equilibrar el acceso de alta velocidad con una gran capacidad. Cuenta con una rejilla de cómputo distribuida que ejecuta lógica personalizada directamente en los nodos donde residen los datos para reducir el tráfico de red. La plataforma proporciona un amplio conjunto de capacidades, incluyendo gestión de transacciones ACID, consultas SQL estándar y operaciones de clave-valor. Admite la ingesta de datos de alto volumen a través de flujos reactivos y ofrece integración a través de múltiples lenguajes de programación, controladores de base de datos estándar y una API REST. El sistema puede desplegarse como un clúster distribuido utilizando contenedores u orquestarse mediante Kubernetes. El proyecto está escrito en Java y puede instalarse mediante archivos binarios.
Combines high-throughput event streams with reference data using a memory-first architecture for low-latency enrichment.