3 مستودعات
Techniques for passing data directly to hardware accelerator buffers to avoid CPU memory copying.
Distinct from Zero-Copy Memory Mappings: Targets hardware accelerator (NPU/GPU) buffers specifically, whereas the parent refers to general file-to-memory mappings.
Explore 3 awesome GitHub repositories matching data & databases · Hardware Buffer Zero-Copy. Refine with filters or upvote what's useful.
NCCL هي مكتبة اتصالات عالية الأداء وإطار عمل حوسبة GPU موزع مصمم لتنفيذ تبادلات البيانات الجماعية ومن نقطة إلى نقطة عبر وحدات GPU متعددة في أنظمة أحادية أو متعددة العقد. تعمل كطبقة نقل GPU RDMA ومنسق ذاكرة، مما يسهل مزامنة البيانات وتدرجات النماذج ذات النطاق الترددي العالي للتدريب والاستدلال الموزع على GPU. تتميز المكتبة بقدرتها على تنفيذ بدائيات الاتصال مباشرة من نواة GPU، مما يزيل وحدة المعالجة المركزية المضيفة من المسار الحرج. وتستخدم اختيار المسار الواعي بالطوبولوجيا لتحسين حركة البيانات وتوظف نقل الشبكة القائم على RDMA، بما في ذلك InfiniBand و NVLink، لتمكين الوصول إلى الذاكرة بدون نسخ (Zero-copy) بين الأجهزة عبر عقد مادية مختلفة. يغطي المشروع مجموعة واسعة من أنماط الاتصال الجماعي، بما في ذلك الاختزالات، والبث، والتجميع، وتبادلات الكل إلى الكل، إلى جانب الوصول إلى الذاكرة عن بُعد من نقطة إلى نقطة. ويوفر إدارة شاملة للمتصلين لتهيئة وتقسيم وتغيير حجم مجموعات GPU، بالإضافة إلى إدارة ذاكرة متخصصة لتسجيل المخازن المؤقتة وتنسيق ذاكرة الجهاز المشتركة. يتضمن النظام مجموعة من أدوات المراقبة والقابلية للملاحظة لتتبع الصحة، وتسجيل التشخيص، ومراقبة الأحداث في الوقت الفعلي، بالإضافة إلى واجهات تكامل لإطارات عمل تعلم الآلة، و CUDA graphs، و MPI، و Python.
Maps user memory regions directly to network interfaces to eliminate intermediate CPU copies during data transfers.
QtAV هو محرك وسائط عبر المنصات وإطار عمل للوسائط المتعددة يجمع بين فك تشفير FFmpeg وإطار عمل Qt لعرض الصوت والفيديو. يعمل كمشغل فيديو معزز بالأجهزة، وعارض فيديو OpenGL، ومحول ترميز لتيارات الوسائط المتعددة. يتميز المشروع بطبقة فك تشفير تجريد الأجهزة التي تستخدم واجهات GPU مثل VA-API و VideoToolbox لفك تشفير الفيديو عالي الدقة. يستخدم مسار نقل ذاكرة بدون نسخ لنقل بيانات الفيديو التي تم فك تشفيرها مباشرة إلى واجهات برمجة تطبيقات الرسومات، مما يقلل من حمل CPU ويتيح عرض YUV عالي الأداء. يغطي المحرك نطاقاً واسعاً من القدرات، بما في ذلك التحكم في تشغيل الوسائط المتعددة، ومزامنة التيار، واستخراج البيانات الوصفية. يوفر أدوات لمعالجة الفيديو عبر تظليل وفلاتر مخصصة، بالإضافة إلى تحويل ترميز الوسائط والتقاط الإطارات. يمتد دعم العرض إلى محتوى النطاق الديناميكي العالي، والترجمات عالية الدقة، وعرض صور الألبوم. يتكامل إطار العمل مباشرة مع حلقة أحداث Qt ونظام الإشارات لربط عناصر التحكم في التشغيل وأسطح إخراج الفيديو بواجهة المستخدم.
Employs zero-copy memory transfers to pass video data directly to hardware accelerator buffers.
LiteRT is a runtime and API for executing machine learning and generative AI models on mobile, desktop, and IoT hardware. It consists of an inference engine and a specialized environment for running quantized large language and diffusion models locally on edge hardware. The system includes an ahead-of-time model compiler that translates models into hardware-specific bytecode to reduce startup latency and memory overhead. It provides a unified interface for Neural Processing Units with automatic fallback routing to CPUs or GPUs when specific subgraph support is unavailable. An edge model conve
Eliminates expensive CPU memory copy operations by passing tensor data directly to the NPU hardware buffer.