awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 dépôts

Awesome GitHub RepositoriesAccelerator Memory Registration

Configuration and registration of memory buffers on hardware accelerators via compilation and runtime options.

Distinct from Hardware Acceleration: Focuses on the memory setup and registration phase for accelerators rather than the execution of offloaded compute tasks.

Explore 2 awesome GitHub repositories matching operating systems & systems programming · Accelerator Memory Registration. Refine with filters or upvote what's useful.

Awesome Accelerator Memory Registration GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • kvcache-ai/mooncakeAvatar de kvcache-ai

    kvcache-ai/Mooncake

    5,594Voir sur GitHub↗

    Mooncake est une plateforme de service de modèles de langage (LLM) désagrégée et un magasin clé-valeur distribué conçu pour une infrastructure d'inférence haute performance. Il fonctionne comme un orchestrateur de mémoire GPU et un système de gestion de cache KV qui mutualise et transfère les caches clé-valeur à travers les clusters pour accélérer l'inférence. Le système se distingue en séparant les phases de pré-remplissage (prefill) et de décodage de l'inférence dans des clusters matériels distincts pour optimiser l'utilisation des ressources. Il utilise un cache distribué RDMA haute performance avec des transferts zéro-copie pour déplacer les données entre les nœuds de calcul, contournant le CPU pour réduire la latence et la surcharge. La plateforme couvre de vastes domaines de capacités, notamment la mutualisation de mémoire distribuée, le routage de mémoire d'accélérateur via CXL et le déchargement de stockage multi-niveaux vers des SSD. Il gère l'état du cluster via des services de coordination de métadonnées et implémente la gouvernance des ressources via une protection d'objets basée sur des baux et une éviction de cache basée sur des seuils. Le logiciel est packagé pour un déploiement conteneurisé avec prise en charge du réseau hôte et du mappage de périphériques matériels.

    Configures hardware accelerator memory support and registration through specific compilation options.

    C++
    Voir sur GitHub↗5,594
  • nvidia/ncclAvatar de NVIDIA

    NVIDIA/nccl

    4,816Voir sur GitHub↗

    NCCL est une bibliothèque de communication haute performance et un framework de calcul GPU distribué conçu pour exécuter des échanges de données collectifs et point à point sur plusieurs GPU dans des systèmes à un ou plusieurs nœuds. Il sert de couche de transport GPU RDMA et d'orchestrateur de mémoire, facilitant la synchronisation à large bande passante des données et des gradients de modèle pour l'entraînement et l'inférence GPU distribués. La bibliothèque se distingue par sa capacité à exécuter des primitives de communication directement depuis les noyaux (kernels) GPU, supprimant le CPU hôte du chemin critique. Elle utilise une sélection de chemin consciente de la topologie pour optimiser le mouvement des données et emploie un transport réseau basé sur RDMA, incluant InfiniBand et NVLink, pour permettre un accès mémoire zéro-copie entre les appareils sur différents nœuds physiques. Le projet couvre un large éventail de modèles de communication collective, notamment les réductions, les diffusions (broadcasts), les rassemblements (gathers) et les échanges tous-à-tous, ainsi que l'accès mémoire distant point à point. Il fournit une gestion complète des communicateurs pour initialiser, partitionner et redimensionner les groupes GPU, ainsi qu'une gestion spécialisée de la mémoire pour enregistrer les tampons (buffers) et coordonner la mémoire partagée des appareils. Le système inclut une suite d'outils de surveillance et d'observabilité pour le suivi de la santé, la journalisation diagnostique et la surveillance des événements en temps réel, ainsi que des interfaces d'intégration pour les frameworks de machine learning, les graphes CUDA, MPI et Python.

    NCCL creates a registered memory window to enable one-sided remote memory access and peer-to-peer mapping.

    C++
    Voir sur GitHub↗4,816
  1. Home
  2. Operating Systems & Systems Programming
  3. Hardware Interfacing and Drivers
  4. Hardware Acceleration
  5. Accelerator Memory Registration