3 repository-uri
Techniques for passing data directly to hardware accelerator buffers to avoid CPU memory copying.
Distinct from Zero-Copy Memory Mappings: Targets hardware accelerator (NPU/GPU) buffers specifically, whereas the parent refers to general file-to-memory mappings.
Explore 3 awesome GitHub repositories matching data & databases · Hardware Buffer Zero-Copy. Refine with filters or upvote what's useful.
NCCL este o bibliotecă de comunicare de înaltă performanță și un framework de calcul distribuit pe GPU, conceput pentru executarea schimburilor de date colective și punct-la-punct pe mai multe GPU-uri în sisteme cu un singur nod sau multi-nod. Servește ca strat de transport RDMA pentru GPU și orchestrator de memorie, facilitând sincronizarea cu lățime de bandă mare a datelor și a gradienților de model pentru antrenarea și inferența distribuită pe GPU. Biblioteca se distinge prin capacitatea sa de a executa primitive de comunicare direct din kernel-urile GPU, eliminând CPU-ul gazdă din calea critică. Utilizează selecția de căi conștientă de topologie pentru a optimiza mișcarea datelor și folosește transportul de rețea bazat pe RDMA, inclusiv InfiniBand și NVLink, pentru a permite accesul la memorie zero-copy între dispozitive pe diferite noduri fizice. Proiectul acoperă o gamă largă de tipare de comunicare colectivă, inclusiv reduceri, broadcast-uri, gather-uri și schimburi all-to-all, alături de accesul la memorie la distanță punct-la-punct. Oferă gestionare cuprinzătoare a comunicatorului pentru inițializarea, partiționarea și redimensionarea grupurilor GPU, precum și gestionarea specializată a memoriei pentru înregistrarea bufferelor și coordonarea memoriei partajate a dispozitivului. Sistemul include o suită de instrumente de monitorizare și observabilitate pentru urmărirea stării, logarea diagnostică și monitorizarea evenimentelor în timp real, precum și interfețe de integrare pentru framework-uri de machine learning, CUDA graphs, MPI și Python.
Maps user memory regions directly to network interfaces to eliminate intermediate CPU copies during data transfers.
QtAV este un motor media cross-platform și un framework multimedia care combină decodarea FFmpeg cu framework-ul Qt pentru randarea audio și video. Funcționează ca un player video accelerat hardware, un renderer video OpenGL și un transcoder de fluxuri multimedia. Proiectul se distinge printr-un strat de decodare cu abstractizare hardware care utilizează interfețe GPU precum VA-API și VideoToolbox pentru a decoda video de înaltă rezoluție. Utilizează o cale de transfer de memorie de tip zero-copy pentru a muta datele video decodate direct către API-urile grafice, reducând overhead-ul CPU și permițând randarea YUV de înaltă performanță. Motorul acoperă o gamă largă de capabilități, inclusiv controlul redării multimedia, sincronizarea fluxurilor și extragerea metadatelor. Oferă instrumente pentru procesarea video prin shadere și filtre personalizate, precum și transcodarea media și capturarea cadrelor. Suportul de randare se extinde la conținut HDR, subtitrări de înaltă fidelitate și afișarea coperților de albume. Framework-ul se integrează direct cu bucla de evenimente și sistemul de semnale Qt pentru a lega controalele de redare și suprafețele de ieșire video la interfața utilizator.
Employs zero-copy memory transfers to pass video data directly to hardware accelerator buffers.
LiteRT is a runtime and API for executing machine learning and generative AI models on mobile, desktop, and IoT hardware. It consists of an inference engine and a specialized environment for running quantized large language and diffusion models locally on edge hardware. The system includes an ahead-of-time model compiler that translates models into hardware-specific bytecode to reduce startup latency and memory overhead. It provides a unified interface for Neural Processing Units with automatic fallback routing to CPUs or GPUs when specific subgraph support is unavailable. An edge model conve
Eliminates expensive CPU memory copy operations by passing tensor data directly to the NPU hardware buffer.