awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

4 repositorios

Awesome GitHub RepositoriesKubernetes-Native Data Platforms

Enterprise-grade data pipeline platforms deployed on Kubernetes for scalable, production data processing.

Distinct from Enterprise Data Platforms: Distinct from Enterprise Data Platforms: focuses on Kubernetes-native orchestration and pipeline automation rather than general database management.

Explore 4 awesome GitHub repositories matching data & databases · Kubernetes-Native Data Platforms. Refine with filters or upvote what's useful.

Awesome Kubernetes-Native Data Platforms GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • pachyderm/pachydermAvatar de pachyderm

    pachyderm/pachyderm

    6,292Ver en GitHub↗

    Pachyderm is a containerized, versioned, and lineage-tracked data pipeline platform that runs natively on Kubernetes. It combines a distributed file system backend with immutable data versioning, so every commit to a data repository creates an auditable snapshot, and every pipeline step executes as an isolated container. The platform is defined by a data-centric pipeline model where pipelines are specified by their input and output data repositories rather than explicit task sequences, and provenance is recorded as a directed acyclic graph of commits linking output data to its input sources an

    Provisioning a complete, scalable data pipeline infrastructure on cloud Kubernetes for enterprise-grade data processing workloads.

    Go
    Ver en GitHub↗6,292
  • jaypyles/scraperrAvatar de jaypyles

    jaypyles/Scraperr

    4,897Ver en GitHub↗

    Scraperr es una plataforma de web scraping y crawling autohospedada, diseñada para extraer datos estructurados de sitios web utilizando selectores XPath. Funciona como un sistema contenedorizado para gestionar trabajos de scraping a través de una cola y analizar el contenido resultante mediante inteligencia artificial. El proyecto se diferencia por su arquitectura nativa de Kubernetes, lo que permite un despliegue y gestión escalables mediante gestores de paquetes. Incluye un motor de crawling capaz de realizar spidering a nivel de dominio para descubrir páginas enlazadas y un analizador de datos que utiliza inteligencia artificial para consultar el contenido web extraído. La plataforma cubre una amplia gama de capacidades, incluyendo la extracción automatizada de datos, crawling web masivo y descarga de archivos multimedia. Proporciona herramientas para visualizar datos extraídos en tablas, configurar encabezados de solicitud personalizados para imitar identidades de navegador y exportar resultados a formatos CSV o Markdown. La aplicación admite parámetros de instalación personalizables y actualizaciones de versión a través de configuraciones de despliegue de Kubernetes.

    Implements a containerized scraping platform designed specifically for scalable orchestration on Kubernetes.

    TypeScriptdockerhelmkubernetes
    Ver en GitHub↗4,897
  • briefercloud/brieferAvatar de briefercloud

    briefercloud/briefer

    4,308Ver en GitHub↗

    Briefer es una plataforma de cuadernos de datos interactivos y herramienta de panel de inteligencia de negocios utilizada para el análisis y reporte de datos colaborativo. Proporciona un entorno contenerizado para construir informes que combinan SQL, Python y Markdown con visualizaciones nativas. La plataforma cuenta con un asistente de código integrado que utiliza modelos de lenguaje grandes para generar snippets de SQL y Python a partir de prompts de lenguaje natural. Está diseñada como una aplicación de datos de Kubernetes, desplegándose a través de gráficos Helm para gestionar entornos de cómputo aislados y garantizar recursos separados por página a través de aislamiento basado en pods. El sistema cubre una amplia gama de capacidades, incluyendo conectividad a bases de datos externas, co-edición en tiempo real y entrega automatizada de informes mediante programación. Se integra con OpenID Connect para el aprovisionamiento de identidad y proporciona control de acceso basado en roles, gestión segura de credenciales y almacenamiento en caché de consultas basado en resultados. La aplicación se despliega y escala a través de clústeres de Kubernetes utilizando gráficos Helm gestionados.

    Deployable via Helm as a Kubernetes-native data platform that manages isolated compute environments.

    TypeScriptanalyticsbibigquery
    Ver en GitHub↗4,308
  • vdaas/valdAvatar de vdaas

    vdaas/vald

    1,706Ver en GitHub↗

    Vald is a distributed, cloud-native search engine designed for high-dimensional vector data. It functions as an approximate nearest neighbor search platform, enabling the identification of similar data points across massive datasets through horizontal scaling and distributed indexing. The system is built for container orchestration environments, utilizing custom resource controllers to automate cluster lifecycle management and infrastructure state. It employs graph-based indexing to perform rapid similarity lookups and supports zero-downtime operations by decoupling index construction from qu

    Provides a resilient, cloud-native infrastructure for managing and querying vector indices with zero-downtime updates.

    Goanngapproximate-nearest-neighbor-searchcloud
    Ver en GitHub↗1,706
  1. Home
  2. Data & Databases
  3. Enterprise Data Services
  4. Enterprise Data Platforms
  5. Kubernetes-Native Data Platforms