5 repository-uri
Storage designs that decouple data management from physical hardware to enable elastic scaling.
Distinct from Data Storage Architectures: Distinct from general data storage architectures: focuses on the decoupling of management from hardware.
Explore 5 awesome GitHub repositories matching data & databases · Software-Defined Architectures. Refine with filters or upvote what's useful.
Ceph is a unified, software-defined storage platform designed to provide object, block, and file storage services from a single distributed cluster. By decoupling data management from physical hardware, it enables elastic scaling across commodity hardware, allowing organizations to build large-scale storage infrastructure without reliance on proprietary vendor equipment. The system distinguishes itself through a shared-nothing, distributed architecture that utilizes deterministic hashing for data placement. This approach eliminates centralized metadata bottlenecks, allowing the cluster to sca
Decouples data management from physical hardware to enable elastic scaling and high availability.
Dask este un framework de calcul paralel și un scheduler de sarcini distribuit conceput pentru a scala fluxurile de lucru de știința datelor în Python de la mașini individuale la clustere mari. Acesta funcționează ca un manager de resurse de cluster care orchestrează logica computațională prin reprezentarea sarcinilor și a dependențelor acestora sub formă de grafuri aciclice direcționate. Această arhitectură permite sistemului să automatizeze distribuția sarcinilor de lucru pe hardware-ul disponibil, gestionând în același timp cerințe complexe de execuție. Proiectul se distinge printr-un motor de evaluare leneșă (lazy) care amână operațiunile pe date până când sunt solicitate explicit, permițând optimizarea globală a grafului și alocarea eficientă a resurselor. Acesta încorporează „spilling” de date conștient de memorie pentru a preveni blocarea sistemului la procesarea seturilor de date care depășesc memoria disponibilă și utilizează fuziunea grafului de sarcini pentru a combina secvențe de operațiuni în pași de execuție unici, minimizând overhead-ul de programare și comunicarea între noduri. Platforma oferă o suprafață cuprinzătoare de capabilități pentru analiza datelor la scară largă, inclusiv suport pentru învățare automată distribuită, integrare cu calcul de înaltă performanță și procesare paralelă a datelor. Oferă instrumente extinse pentru gestionarea ciclului de viață al clusterului, profilarea performanței și monitorizarea în timp real a execuției sarcinilor. Utilizatorii pot implementa aceste medii pe diverse infrastructuri, inclusiv hardware local, furnizori de cloud, sisteme containerizate și clustere de calcul de înaltă performanță.
Implements specific interfaces to create user-defined data structures that integrate with the task graph execution, visualization, and persistence systems.
dbt-core is a command-line framework for transforming data within a warehouse using modular SQL and version control. It functions as a data transformation engine that enables users to define data structures and business logic through declarative configuration files, which the system then compiles into executable code. By managing complex data dependencies through a directed acyclic graph, it ensures that transformation tasks execute in the correct order while maintaining a manifest-driven state to track lineage and execution history. The project distinguishes itself through an adapter-based d
Extends the framework with user-defined logic for persisting data models in the warehouse.
This project is a collection of software engineering principles and architectural design patterns designed to minimize the mental effort required to understand and maintain source code. It serves as a guide for implementing clean code methodologies and architectural simplification to reduce the overall cognitive load on developers. The framework emphasizes aligning module boundaries and ubiquitous language with business stakeholders to prevent architectural ripple effects. It advocates for balancing service granularity to avoid the overhead of distributed monoliths and suggests favoring objec
Defines module boundaries based on the business person or user they serve to minimize side effects.
Harvester este o platformă software de infrastructură hiperconvergentă care combină calculul, stocarea și rețelistica într-un singur sistem pentru gestionarea mediilor virtualizate pe servere bare metal. Funcționează ca o platformă de gestionare a virtualizării și un manager de hypervisor KVM, oferind o interfață centralizată pentru a orchestra întregul ciclu de viață al mașinilor virtuale. Proiectul se distinge prin integrarea stocării distribuite în bloc Longhorn pentru a oferi stocare redundantă, definită prin software, și un instrument de provizionare bare metal pentru implementare automatizată. Acest lucru permite orchestrarea infrastructurii pe servere fizice folosind boot-area prin PXE, iPXE și UEFI HTTP. Capabilitățile platformei includ orchestrarea mașinilor virtuale cu migrare live și provizionare cloud-init, precum și recuperarea în caz de dezastru la nivel enterprise prin snapshot-uri și backup-uri la distanță. De asemenea, acoperă configurarea rețelelor virtuale pentru VLAN-uri și IP-uri virtuale, alături de instrumente complete de instalare a sistemului pentru atribuirea rolurilor nodurilor și executarea de comenzi post-instalare.
Implements software-defined storage by managing block storage volumes and physical disks for virtualized workloads.