5 repositorios
Storage designs that decouple data management from physical hardware to enable elastic scaling.
Distinct from Data Storage Architectures: Distinct from general data storage architectures: focuses on the decoupling of management from hardware.
Explore 5 awesome GitHub repositories matching data & databases · Software-Defined Architectures. Refine with filters or upvote what's useful.
Ceph is a unified, software-defined storage platform designed to provide object, block, and file storage services from a single distributed cluster. By decoupling data management from physical hardware, it enables elastic scaling across commodity hardware, allowing organizations to build large-scale storage infrastructure without reliance on proprietary vendor equipment. The system distinguishes itself through a shared-nothing, distributed architecture that utilizes deterministic hashing for data placement. This approach eliminates centralized metadata bottlenecks, allowing the cluster to sca
Decouples data management from physical hardware to enable elastic scaling and high availability.
Dask es un framework de computación paralela y un programador de tareas distribuido diseñado para escalar flujos de trabajo de ciencia de datos en Python desde máquinas individuales hasta grandes clústeres. Funciona como un gestor de recursos de clúster que orquesta la lógica computacional representando las tareas y sus dependencias como grafos acíclicos dirigidos. Esta arquitectura permite al sistema automatizar la distribución de cargas de trabajo a través del hardware disponible mientras gestiona requisitos de ejecución complejos. El proyecto se distingue por un motor de evaluación perezosa que difiere las operaciones de datos hasta que se solicitan explícitamente, permitiendo la optimización global del grafo y una asignación eficiente de recursos. Incorpora el volcado de datos consciente de la memoria para evitar fallos del sistema al procesar conjuntos de datos que exceden la memoria disponible, y utiliza la fusión de grafos de tareas para combinar secuencias de operaciones en pasos de ejecución únicos, minimizando la sobrecarga de programación y la comunicación entre nodos. La plataforma proporciona una superficie de capacidades integral para el análisis de datos a gran escala, incluyendo soporte para aprendizaje automático distribuido, integración de computación de alto rendimiento y procesamiento de datos en paralelo. Ofrece herramientas extensas para la gestión del ciclo de vida del clúster, perfilado de rendimiento y monitoreo en tiempo real de la ejecución de tareas. Los usuarios pueden desplegar estos entornos en diversas infraestructuras, incluyendo hardware local, proveedores de nube, sistemas en contenedores y clústeres de computación de alto rendimiento.
Implements specific interfaces to create user-defined data structures that integrate with the task graph execution, visualization, and persistence systems.
dbt-core is a command-line framework for transforming data within a warehouse using modular SQL and version control. It functions as a data transformation engine that enables users to define data structures and business logic through declarative configuration files, which the system then compiles into executable code. By managing complex data dependencies through a directed acyclic graph, it ensures that transformation tasks execute in the correct order while maintaining a manifest-driven state to track lineage and execution history. The project distinguishes itself through an adapter-based d
Extends the framework with user-defined logic for persisting data models in the warehouse.
This project is a collection of software engineering principles and architectural design patterns designed to minimize the mental effort required to understand and maintain source code. It serves as a guide for implementing clean code methodologies and architectural simplification to reduce the overall cognitive load on developers. The framework emphasizes aligning module boundaries and ubiquitous language with business stakeholders to prevent architectural ripple effects. It advocates for balancing service granularity to avoid the overhead of distributed monoliths and suggests favoring objec
Defines module boundaries based on the business person or user they serve to minimize side effects.
Harvester es una plataforma de infraestructura hiperconvergente que combina computación, almacenamiento y redes en un único sistema para gestionar entornos virtualizados en servidores bare metal. Funciona como una plataforma de gestión de virtualización y gestor de hipervisor KVM, proporcionando una interfaz centralizada para orquestar el ciclo de vida completo de las máquinas virtuales. El proyecto se distingue por integrar el almacenamiento en bloques distribuido Longhorn para ofrecer almacenamiento redundante definido por software, además de una herramienta de aprovisionamiento bare metal para despliegues automatizados. Esto permite orquestar la infraestructura en servidores físicos mediante arranque PXE, iPXE y UEFI HTTP. Las capacidades de la plataforma incluyen la orquestación de máquinas virtuales con migración en vivo y aprovisionamiento cloud-init, así como recuperación ante desastres empresarial mediante snapshots y copias de seguridad remotas. También abarca la configuración de redes virtuales para VLANs e IPs virtuales, junto con herramientas integrales de instalación del sistema para la asignación de roles de nodo y la ejecución de comandos post-instalación.
Implements software-defined storage by managing block storage volumes and physical disks for virtualized workloads.