4 dépôts
Named collections of data that are tracked through a version control system.
Distinct from Backend as a Service: Candidates focus on managed services or ML models, not the primitive concept of creating a versioned data collection.
Explore 4 awesome GitHub repositories matching data & databases · Versioned Datasets. Refine with filters or upvote what's useful.
Noms is a distributed version control database and content-addressable data store. It identifies data by cryptographic hashes to ensure integrity and deduplication, while tracking dataset state changes through a sequence of immutable commits to enable branching, forking, and historical recovery. The system functions as a peer-to-peer data synchronizer, reconciling state between disconnected database instances to ensure all nodes converge on the same data. It distinguishes itself as a schema-flexible document store that supports self-describing types, allowing schemas to evolve and widen as ne
Allows initializing named collections of versioned data within a database to serve as the primary interface for operations.
Lance is a columnar data format and storage layer designed for high-performance random access and the persistence of multimodal data. It functions as a vector database storage system, a multimodal data store, and a versioned dataset manager. The project distinguishes itself as a hybrid search engine that combines vector similarity search and full-text indexing on a single dataset. It provides unified storage for diverse data types including images, audio, and video, utilizing a system that lazy-loads large binary objects only when requested. The system manages dataset evolution through schem
Tracks data state changes using transactions, tags, and branches to maintain a complete history.
lakeFS est un système de versioning de data lake qui fournit des branches et des commits de type Git pour de grands jeux de données stockés dans un stockage objet. Il fonctionne comme une couche de contrôle de version, permettant la création d'instantanés immuables, de commits atomiques et de branches zero-copy pour créer des environnements isolés pour l'expérimentation de données sans dupliquer les fichiers physiques. Le système sert de passerelle de stockage compatible S3 et de catalogue REST Iceberg, permettant aux protocoles de stockage cloud standard et aux clients compatibles de gérer des tables versionnées. Il agit comme un gardien de la qualité des données en utilisant un système de hooks piloté par événements pour valider les jeux de données par rapport aux politiques de gouvernance avant que les changements ne soient fusionnés en production. La plateforme couvre de larges capacités pour la gouvernance des données, incluant la collaboration via pull requests, le contrôle d'accès basé sur les rôles et le suivi de la lignée des données (data lineage). Elle fournit une intégration pour l'orchestration de workflows, les pipelines de machine learning et divers moteurs de calcul big data, prenant en charge la connectivité de stockage multi-cloud et la synchronisation d'identité via SSO et SCIM. Le logiciel peut être installé en utilisant des binaires, des conteneurs ou des charts Helm pour un déploiement sur Kubernetes.
Enables the creation and saving of named collections of data tracked through a version control system.
Ce projet est une plateforme d'audit des dépenses publiques et de contrôle social pilotée par l'IA, conçue pour surveiller l'administration publique et signaler les activités financières suspectes. Il fonctionne comme un outil automatisé de détection de la fraude qui utilise la reconnaissance de formes pour identifier les irrégularités dans les registres de dépenses gouvernementales. Le système transforme les fichiers de dépenses publiques bruts en jeux de données structurés via un pipeline de données, mappant divers formats de données gouvernementales vers un modèle relationnel standardisé. Il utilise un système de signalement automatisé pour prioriser l'examen manuel par les auditeurs et génère des exportations de jeux de données versionnées basées sur des instantanés pour garantir la reproductibilité à des fins de vérification indépendante. La plateforme inclut une interface de visualisation de données destinée au public, permettant aux citoyens d'explorer et de valider des registres de dépenses détaillés. Cette capacité soutient la responsabilité du secteur public en exposant les modèles identifiés lors de l'analyse automatisée.
Creates reproducible, versioned snapshots of government spending data for independent verification.