1 repository
Automatically identifying and registering performance metrics emitted by models during active inference.
Distinct from Automatic Metric Interception: Focuses on discovery of metrics at runtime rather than intercepting calls to visualization libraries
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Runtime Metric Detection. Refine with filters or upvote what's useful.
Acest proiect este un framework de servire a modelelor PyTorch conceput pentru a deploya și scala modele de machine learning în producție prin endpoint-uri de rețea scalabile. Funcționează ca un server de inferență de înaltă performanță, optimizator și manager al ciclului de viață al modelelor care gestionează încărcarea modelelor, batching-ul cererilor și accelerarea hardware. Sistemul se distinge prin capabilități avansate de orchestrare și optimizare, cum ar fi înlănțuirea mai multor modele în fluxuri de lucru secvențiale folosind grafuri de execuție și utilizarea batching-ului dinamic pentru a îmbunătăți throughput-ul și latența. Oferă suport specializat pentru AI generativ și modele de limbaj mari (LLM) prin batching continuu și paralelism tensorial. Ariile largi de capabilități includ gestionarea resurselor GPU pe diverse hardware-uri precum NVIDIA, AMD și Apple Silicon, precum și gestionarea cuprinzătoare a ciclului de viață al modelelor pentru înregistrare, versionare și scalarea worker-ilor. De asemenea, integrează instrumente de observabilitate pentru urmărirea stării sistemului și a performanței modelului prin metrici compatibile cu Prometheus. Serverul este gestionat printr-o interfață de linie de comandă utilizată pentru controlul ciclului de viață și configurarea parametrilor de runtime.
Automatically identifies and registers performance metrics emitted by models during runtime.