4 repository-uri
Practical implementations and architectural patterns for common distributed system challenges.
Explore 4 awesome GitHub repositories matching part of an awesome list · System Design References. Refine with filters or upvote what's useful.
Snowflake este un framework RPC de înaltă concurență și un serviciu distribuit de generare a ID-urilor. Acesta oferă infrastructura pentru a crea identificatori unici, ordonați temporal, într-o rețea de servere și facilitează dezvoltarea serviciilor de rețea concepute pentru a gestiona volume masive de cereri simultane. Sistemul separă logica de transport de nivel scăzut de comportamentul aplicației, permițând implementarea de protocoale RPC personalizate. Include un instrument de tracing distribuit al cererilor pentru a vizualiza fluxul de execuție peste limitele rețelei și o interfață de gestionare a ciclului de viață al serverului pentru a ajusta nivelurile de logare și a controla stările procesului în timpul runtime-ului. Proiectul acoperă monitorizarea sistemului în timp real prin exportul de metrici bazat pe JSON și profilarea performanței aplicației pentru a analiza utilizarea heap-ului și contencția thread-urilor.
Reference for generating unique, time-ordered identifiers in distributed systems.
Acest proiect este o resursă educațională cuprinzătoare și un curriculum axat pe designul și implementarea întregului stack software și hardware de machine learning. Servește ca referință tehnică pentru arhitecturarea sistemelor de machine learning, pornind de la interfețe de programare de nivel scăzut până la infrastructura de deployment la scară largă. Proiectul oferă îndrumări instrucționale pe mai multe domenii specializate, inclusiv dezvoltarea compilatoarelor AI prin reprezentări intermediare și optimizări de grafuri. Acoperă tiparele arhitecturale necesare pentru antrenarea distribuită pe clustere GPU și programarea acceleratoarelor hardware pentru a optimiza sarcinile de lucru pe cipuri specializate. Resursa detaliază, de asemenea, implementarea framework-urilor de servire a modelelor pentru medii de producție și designul pipeline-urilor de reinforcement learning. Domeniul său de aplicare se extinde la componentele de bază ale sistemelor ML, cum ar fi diferențierea automată, abstracțiile de tensori și orchestrarea resurselor GPU.
Implements guidance on designing tensor abstractions, automatic differentiation, and computational graph execution patterns.
This is a reference guide for designing, deploying, and maintaining production-ready machine learning systems, grounded in MLOps best practices. It covers the complete machine learning lifecycle, from system design and workflow planning through to deployment and ongoing maintenance, with a focus on reliability, scalability, and maintainability as business requirements evolve. The guide provides an architecture reference for establishing shared ML infrastructure, including model registries and feature stores that standardize asset reuse across teams. It details pipeline automation through conf
Designs machine learning systems that stay reliable, scalable, and maintainable as business needs change over time.
Acest repository servește drept referință tehnică pentru proiectarea de software scalabil, rezilient și performant în medii cu servicii distribuite. Oferă o colecție de tipare arhitecturale și strategii structurale menite să ghideze dezvoltarea sistemelor complexe, decuplate, care mențin o disponibilitate ridicată și integritatea datelor sub sarcină intensă. Resursa se concentrează pe principiile fundamentale ale arhitecturii de microservicii, oferind îndrumări privind gestionarea comunicării între componente software independente prin mesagerie sincronă și asincronă. Detaliază strategii pentru menținerea consistenței distribuite și implementarea protocoalelor de coordonare pentru a asigura sincronizarea datelor între mai multe noduri de rețea. Documentația acoperă o gamă largă de capabilități de design de sistem, inclusiv tehnici de optimizare a performanței bazelor de date, cum ar fi indexarea, partiționarea și caching-ul. De asemenea, prezintă practici de design tolerante la erori, inclusiv echilibrarea sarcinii și strategii de recuperare automată, pentru a asigura fiabilitatea sistemului atunci când componente individuale eșuează.
Offers a technical reference for implementing structural patterns to solve common challenges in distributed system design and database performance.