awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

4 dépôts

Awesome GitHub RepositoriesKubernetes-Native Data Platforms

Enterprise-grade data pipeline platforms deployed on Kubernetes for scalable, production data processing.

Distinct from Enterprise Data Platforms: Distinct from Enterprise Data Platforms: focuses on Kubernetes-native orchestration and pipeline automation rather than general database management.

Explore 4 awesome GitHub repositories matching data & databases · Kubernetes-Native Data Platforms. Refine with filters or upvote what's useful.

Awesome Kubernetes-Native Data Platforms GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • pachyderm/pachydermAvatar de pachyderm

    pachyderm/pachyderm

    6,292Voir sur GitHub↗

    Pachyderm is a containerized, versioned, and lineage-tracked data pipeline platform that runs natively on Kubernetes. It combines a distributed file system backend with immutable data versioning, so every commit to a data repository creates an auditable snapshot, and every pipeline step executes as an isolated container. The platform is defined by a data-centric pipeline model where pipelines are specified by their input and output data repositories rather than explicit task sequences, and provenance is recorded as a directed acyclic graph of commits linking output data to its input sources an

    Provisioning a complete, scalable data pipeline infrastructure on cloud Kubernetes for enterprise-grade data processing workloads.

    Go
    Voir sur GitHub↗6,292
  • jaypyles/scraperrAvatar de jaypyles

    jaypyles/Scraperr

    4,897Voir sur GitHub↗

    Scraperr est une plateforme de web scraping et de crawling auto-hébergée conçue pour extraire des données structurées de sites web en utilisant des sélecteurs XPath. Elle fonctionne comme un système conteneurisé pour gérer les tâches de scraping via une file d'attente et analyser le contenu résultant à l'aide de l'intelligence artificielle. Le projet se différencie par son architecture native Kubernetes, permettant un déploiement et une gestion évolutifs via des gestionnaires de paquets. Il inclut un moteur de crawling capable de parcourir des domaines entiers pour découvrir des pages liées et un analyseur de données qui utilise l'IA pour interroger le contenu web extrait. La plateforme couvre un large éventail de capacités, notamment l'extraction automatisée de données, le crawling web en masse et le téléchargement de fichiers multimédias. Elle fournit des outils pour visualiser les données scrapées dans des tableaux, configurer des en-têtes de requête personnalisés pour imiter des identités de navigateur et exporter les résultats aux formats CSV ou Markdown. L'application prend en charge des paramètres d'installation personnalisables et des mises à jour de version via des configurations de déploiement Kubernetes.

    Implements a containerized scraping platform designed specifically for scalable orchestration on Kubernetes.

    TypeScriptdockerhelmkubernetes
    Voir sur GitHub↗4,897
  • briefercloud/brieferAvatar de briefercloud

    briefercloud/briefer

    4,308Voir sur GitHub↗

    Briefer est une plateforme de notebook de données interactif et un outil de tableau de bord de business intelligence utilisé pour l'analyse de données collaborative et le reporting. Il fournit un environnement conteneurisé pour construire des rapports qui combinent SQL, Python et Markdown avec des visualisations natives. La plateforme dispose d'un assistant de code intégré qui utilise de grands modèles de langage pour générer des snippets SQL et Python à partir de prompts en langage naturel. Elle est conçue comme une application de données Kubernetes, se déployant via des charts Helm pour gérer des environnements de calcul isolés et assurer des ressources séparées par page via une isolation basée sur des pods. Le système couvre un large éventail de capacités incluant la connectivité aux bases de données externes, la co-édition en temps réel et la livraison automatisée de rapports via la planification. Il s'intègre avec OpenID Connect pour le provisionnement d'identité et fournit un contrôle d'accès basé sur les rôles, une gestion sécurisée des identifiants et la mise en cache des requêtes basée sur les résultats. L'application est déployée et mise à l'échelle à travers des clusters Kubernetes en utilisant des charts Helm gérés.

    Deployable via Helm as a Kubernetes-native data platform that manages isolated compute environments.

    TypeScriptanalyticsbibigquery
    Voir sur GitHub↗4,308
  • vdaas/valdAvatar de vdaas

    vdaas/vald

    1,706Voir sur GitHub↗

    Vald is a distributed, cloud-native search engine designed for high-dimensional vector data. It functions as an approximate nearest neighbor search platform, enabling the identification of similar data points across massive datasets through horizontal scaling and distributed indexing. The system is built for container orchestration environments, utilizing custom resource controllers to automate cluster lifecycle management and infrastructure state. It employs graph-based indexing to perform rapid similarity lookups and supports zero-downtime operations by decoupling index construction from qu

    Provides a resilient, cloud-native infrastructure for managing and querying vector indices with zero-downtime updates.

    Goanngapproximate-nearest-neighbor-searchcloud
    Voir sur GitHub↗1,706
  1. Home
  2. Data & Databases
  3. Enterprise Data Services
  4. Enterprise Data Platforms
  5. Kubernetes-Native Data Platforms