4 مستودعات
Named collections of data that are tracked through a version control system.
Distinct from Backend as a Service: Candidates focus on managed services or ML models, not the primitive concept of creating a versioned data collection.
Explore 4 awesome GitHub repositories matching data & databases · Versioned Datasets. Refine with filters or upvote what's useful.
Noms is a distributed version control database and content-addressable data store. It identifies data by cryptographic hashes to ensure integrity and deduplication, while tracking dataset state changes through a sequence of immutable commits to enable branching, forking, and historical recovery. The system functions as a peer-to-peer data synchronizer, reconciling state between disconnected database instances to ensure all nodes converge on the same data. It distinguishes itself as a schema-flexible document store that supports self-describing types, allowing schemas to evolve and widen as ne
Allows initializing named collections of versioned data within a database to serve as the primary interface for operations.
Lance is a columnar data format and storage layer designed for high-performance random access and the persistence of multimodal data. It functions as a vector database storage system, a multimodal data store, and a versioned dataset manager. The project distinguishes itself as a hybrid search engine that combines vector similarity search and full-text indexing on a single dataset. It provides unified storage for diverse data types including images, audio, and video, utilizing a system that lazy-loads large binary objects only when requested. The system manages dataset evolution through schem
Tracks data state changes using transactions, tags, and branches to maintain a complete history.
lakeFS هو نظام إصدارات لبحيرات البيانات يوفر تفرعاً (branching) والتزامات (commits) تشبه Git لمجموعات البيانات الكبيرة المخزنة في تخزين الكائنات. يعمل كطبقة تحكم في الإصدار، مما يتيح إنشاء لقطات غير قابلة للتغيير، والتزامات ذرية، وتفرعاً بدون نسخ (zero-copy) لإنشاء بيئات معزولة لتجارب البيانات دون تكرار الملفات الفيزيائية. يعمل النظام كبوابة تخزين متوافقة مع S3 وفهرس Iceberg REST، مما يسمح لبروتوكولات التخزين السحابي القياسية والعملاء المتوافقين بإدارة الجداول ذات الإصدارات. يعمل كحارس لجودة البيانات باستخدام نظام خطافات (hooks) قائم على الأحداث للتحقق من مجموعات البيانات مقابل سياسات الحوكمة قبل دمج التغييرات في الإنتاج. تغطي المنصة قدرات واسعة لحوكمة البيانات، بما في ذلك التعاون عبر طلبات السحب (pull requests)، والتحكم في الوصول القائم على الأدوار، وتتبع أصل البيانات. يوفر تكاملاً لتنسيق سير العمل، وخطوط أنابيب التعلم الآلي، ومحركات حوسبة البيانات الضخمة المختلفة، ويدعم اتصال التخزين متعدد السحابة ومزامنة الهوية عبر SSO وSCIM. يمكن تثبيت البرنامج باستخدام ملفات ثنائية، أو حاويات، أو Helm charts للنشر على Kubernetes.
Enables the creation and saving of named collections of data tracked through a version control system.
هذا المشروع عبارة عن منصة مدعومة بالذكاء الاصطناعي لتدقيق الإنفاق العام والرقابة الاجتماعية، مصممة لمراقبة الإدارة العامة والإبلاغ عن الأنشطة المالية المشبوهة. يعمل كأداة آلية للكشف عن الاحتيال تستخدم التعرف على الأنماط لتحديد المخالفات في سجلات الإنفاق الحكومي. يقوم النظام بتحويل ملفات الإنفاق العام الخام إلى مجموعات بيانات مهيكلة من خلال خط أنابيب بيانات، حيث يربط تنسيقات البيانات الحكومية المتنوعة بنموذج علائقي موحد. ويستخدم نظام إبلاغ آلي لتحديد أولويات المراجعة اليدوية من قبل المدققين، ويولد صادرات بيانات ذات إصدارات تعتمد على اللقطات لضمان إمكانية إعادة الإنتاج للتحقق المستقل. تتضمن المنصة واجهة تصور بيانات موجهة للجمهور تسمح للمواطنين باستكشاف والتحقق من سجلات الإنفاق التفصيلية. تدعم هذه القدرة مساءلة القطاع العام من خلال كشف الأنماط التي تم العثور عليها أثناء التحليل الآلي.
Creates reproducible, versioned snapshots of government spending data for independent verification.