awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

7 dépôts

Awesome GitHub RepositoriesHardware Optimization

Techniques for improving model execution efficiency by optimizing memory bandwidth and throughput on specific hardware.

Distinct from Deep Learning Optimization: Focuses on the physical hardware execution layer rather than computational graph or algorithm refinement

Explore 7 awesome GitHub repositories matching artificial intelligence & ml · Hardware Optimization. Refine with filters or upvote what's useful.

Awesome Hardware Optimization GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • oxford-cs-deepnlp-2017/lecturesAvatar de oxford-cs-deepnlp-2017

    oxford-cs-deepnlp-2017/lectures

    15,854Voir sur GitHub↗

    This repository is a deep learning for natural language processing course and curriculum. It provides educational material and guides focused on neural network architectures used for processing natural language, speech signals, and text classification. The content includes instructional tutorials on sequence modeling and neural language modeling, covering the implementation of n-gram and recurrent neural networks. It also provides a framework for studying word embeddings to map linguistic meanings into numerical representations. The curriculum covers a broad range of capabilities, including

    Offers technical guidance on maximizing memory bandwidth and throughput for deep learning hardware.

    deep-learningmachine-learningnatural-language-processing
    Voir sur GitHub↗15,854
  • antimatter15/alpaca.cppAvatar de antimatter15

    antimatter15/alpaca.cpp

    10,138Voir sur GitHub↗

    alpaca.cpp is a high-performance local inference engine implemented in C++ for executing instruction-tuned large language models. It serves as a quantized model runtime designed to load and run model tensors on local hardware with minimal dependencies, removing the requirement for a full Python environment. The project focuses on on-device text generation and the deployment of private AI chatbots. It utilizes model weight quantization to reduce memory requirements and increase inference speed on consumer-grade devices. The system covers hardware-optimized model execution through thread-pool

    Optimizes memory bandwidth and throughput on local hardware to maximize model execution efficiency.

    C
    Voir sur GitHub↗10,138
  • aphyr/distsys-classAvatar de aphyr

    aphyr/distsys-class

    9,717Voir sur GitHub↗

    This project provides educational materials and courseware focused on the theoretical and practical foundations of distributed systems design. It serves as a comprehensive curriculum covering the disciplines of consensus, data consistency, reliability engineering, and scalability. The instructional content focuses on achieving cluster agreement through consensus algorithms and managing system-wide state via coordination frameworks. It includes a dedicated guide to data theory, exploring replication strategies, consistency models, and data convergence. The courseware covers a broad capability

    Instructional material on improving performance by aligning memory barriers and pinning processors.

    Voir sur GitHub↗9,717
  • qiskit/qiskitAvatar de Qiskit

    Qiskit/qiskit

    7,522Voir sur GitHub↗

    Qiskit is a quantum computing software development kit used for designing, simulating, and executing quantum circuits on physical hardware and simulators. It functions as a quantum algorithm framework, a circuit simulator, and a vendor-agnostic hardware interface for dispatching workloads across diverse providers. The project features a quantum circuit transpiler that optimizes abstract designs to match the specific basis gates and qubit connectivity of target hardware. It employs a pass-based transpilation pipeline and symbolic instruction translation to convert high-level circuits into hard

    Reduces gate counts and improves processing speed by applying low-level optimizations tailored for specific hardware backends.

    Pythonpythonqiskitquantum
    Voir sur GitHub↗7,522
  • quantumlib/cirqAvatar de quantumlib

    quantumlib/Cirq

    4,990Voir sur GitHub↗

    Cirq est un framework de calcul quantique Python utilisé pour concevoir, simuler et exécuter des circuits quantiques sur du matériel quantique à échelle intermédiaire bruyant (NISQ). Il sert de simulateur de circuit quantique et de modeleur de bruit, ainsi que d'outil pour l'implémentation d'algorithmes quantiques. Le framework fournit une interface spécialisée pour le matériel NISQ, permettant aux utilisateurs de mapper des circuits quantiques logiques sur des topologies de périphériques physiques tout en validant la connectivité matérielle et les contraintes de porte. Il se distingue par une modélisation du bruit intégrée, appliquant des canaux de dépolarisation et d'amortissement pour imiter la décohérence et les erreurs trouvées dans les processeurs quantiques réels. Le projet couvre un large éventail de capacités, y compris la conception de circuits quantiques, l'intégration matérielle et la simulation d'état. Il inclut des outils pour la décomposition de portes, le mappage de topologie matérielle et l'exécution de procédures quantiques fondamentales telles que les transformées de Fourier et la recherche de données non structurées. De plus, il fournit des utilitaires analytiques pour le calcul de l'état fondamental moléculaire et l'analyse comparative de la fidélité matérielle.

    Evaluates approximate optimization algorithms through landscape analysis, optimization paths, and precomputed angles.

    Pythonalgorithmsapicirq
    Voir sur GitHub↗4,990
  • openmlsys/openmlsysAvatar de openmlsys

    openmlsys/openmlsys

    4,813Voir sur GitHub↗

    Ce projet est une ressource éducative complète et un programme axé sur la conception et l'implémentation de la pile logicielle et matérielle complète du machine learning. Il sert de référence technique pour l'architecture des systèmes de machine learning, allant des interfaces de programmation de bas niveau à l'infrastructure de déploiement à grande échelle. Le projet fournit des conseils pédagogiques sur plusieurs domaines spécialisés, notamment le développement de compilateurs IA via des représentations intermédiaires et des optimisations de graphes. Il couvre les modèles architecturaux requis pour l'entraînement distribué sur des clusters GPU et la programmation d'accélérateurs matériels pour optimiser les charges de travail sur des puces spécialisées. La ressource détaille également l'implémentation de frameworks de service de modèles pour les environnements de production et la conception de pipelines d'apprentissage par renforcement. Sa portée s'étend aux composants de base des systèmes ML, tels que la différenciation automatique, les abstractions de tenseurs et l'orchestration des ressources GPU.

    Optimizes machine learning workload performance by improving memory bandwidth and throughput on specialized hardware.

    TeXcomputer-systemsmachine-learningsoftware-architecture
    Voir sur GitHub↗4,813
  • mostlygeek/llama-swapAvatar de mostlygeek

    mostlygeek/llama-swap

    4,786Voir sur GitHub↗

    Llama-swap est un orchestrateur d'inférence locale et une passerelle API pour les grands modèles de langage (LLM). Il fonctionne comme un proxy API OpenAI qui gère le cycle de vie de plusieurs serveurs de modèles locaux, les démarrant et les arrêtant automatiquement pour basculer entre les modèles en fonction des identifiants de requête entrants. Le projet se distingue par son basculement dynamique de modèles et son optimisation matérielle. Il utilise un contrôle de concurrence spécialisé basé sur des matrices pour définir quels modèles peuvent s'exécuter simultanément et emploie une éviction basée sur les coûts pour supprimer les serveurs inactifs de la mémoire en fonction des ressources consommées. Le système fournit une gestion complète des modèles, incluant l'aliasing d'identifiants, le filtrage de requêtes et l'exécution de commandes de cycle de vie pour les conteneurs ou machines virtuelles. Il inclut également des outils d'observabilité tels qu'un playground de test visuel, une surveillance des performances système en temps réel et des fonctionnalités de sécurité comme la vérification de clés API et le chiffrement TLS. Les mises à jour de configuration sont gérées via un rechargement dynamique qui surveille les changements sur le système de fichiers sans nécessiter de redémarrage manuel.

    Maximizes GPU and CPU memory efficiency through automated model eviction and idle timeouts.

    Go
    Voir sur GitHub↗4,786
  1. Home
  2. Artificial Intelligence & ML
  3. Machine Learning
  4. Infrastructure
  5. Optimization & Inference
  6. Training Algorithms
  7. Deep Learning Optimization
  8. Hardware Optimization

Explorer les sous-tags

  • Graphics Hardware OptimizersInference engine optimizations for specific graphics hardware architectures including format compatibility and dependency management. **Distinct from Hardware Optimization:** Distinct from Hardware Optimization: focuses on inference engine-specific compatibility for newer graphics architectures rather than general hardware throughput.
  • Hardware-Aware Quantum Optimization1 sous-tagLow-level circuit optimizations tailored to the specific physical properties of quantum backends. **Distinct from Hardware Optimization:** Optimizes quantum gates for QPU properties rather than memory bandwidth for AI models.
  • Topology AlignmentTechniques for improving performance by aligning software execution with physical hardware interconnects and processor affinity. **Distinct from Hardware Optimization:** Distinct from general hardware optimization by focusing specifically on the alignment of memory barriers and processor pinning.
  • VRAM Efficiency StrategiesTechniques for maximizing GPU memory by managing model eviction and idle timeouts. **Distinct from Hardware Optimization:** Focuses on temporal eviction and timeout-based memory reclamation rather than low-level throughput optimizations