awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

7 repositorios

Awesome GitHub RepositoriesHardware Optimization

Techniques for improving model execution efficiency by optimizing memory bandwidth and throughput on specific hardware.

Distinct from Deep Learning Optimization: Focuses on the physical hardware execution layer rather than computational graph or algorithm refinement

Explore 7 awesome GitHub repositories matching artificial intelligence & ml · Hardware Optimization. Refine with filters or upvote what's useful.

Awesome Hardware Optimization GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • oxford-cs-deepnlp-2017/lecturesAvatar de oxford-cs-deepnlp-2017

    oxford-cs-deepnlp-2017/lectures

    15,854Ver en GitHub↗

    This repository is a deep learning for natural language processing course and curriculum. It provides educational material and guides focused on neural network architectures used for processing natural language, speech signals, and text classification. The content includes instructional tutorials on sequence modeling and neural language modeling, covering the implementation of n-gram and recurrent neural networks. It also provides a framework for studying word embeddings to map linguistic meanings into numerical representations. The curriculum covers a broad range of capabilities, including

    Offers technical guidance on maximizing memory bandwidth and throughput for deep learning hardware.

    deep-learningmachine-learningnatural-language-processing
    Ver en GitHub↗15,854
  • antimatter15/alpaca.cppAvatar de antimatter15

    antimatter15/alpaca.cpp

    10,138Ver en GitHub↗

    alpaca.cpp is a high-performance local inference engine implemented in C++ for executing instruction-tuned large language models. It serves as a quantized model runtime designed to load and run model tensors on local hardware with minimal dependencies, removing the requirement for a full Python environment. The project focuses on on-device text generation and the deployment of private AI chatbots. It utilizes model weight quantization to reduce memory requirements and increase inference speed on consumer-grade devices. The system covers hardware-optimized model execution through thread-pool

    Optimizes memory bandwidth and throughput on local hardware to maximize model execution efficiency.

    C
    Ver en GitHub↗10,138
  • aphyr/distsys-classAvatar de aphyr

    aphyr/distsys-class

    9,717Ver en GitHub↗

    This project provides educational materials and courseware focused on the theoretical and practical foundations of distributed systems design. It serves as a comprehensive curriculum covering the disciplines of consensus, data consistency, reliability engineering, and scalability. The instructional content focuses on achieving cluster agreement through consensus algorithms and managing system-wide state via coordination frameworks. It includes a dedicated guide to data theory, exploring replication strategies, consistency models, and data convergence. The courseware covers a broad capability

    Instructional material on improving performance by aligning memory barriers and pinning processors.

    Ver en GitHub↗9,717
  • qiskit/qiskitAvatar de Qiskit

    Qiskit/qiskit

    7,522Ver en GitHub↗

    Qiskit is a quantum computing software development kit used for designing, simulating, and executing quantum circuits on physical hardware and simulators. It functions as a quantum algorithm framework, a circuit simulator, and a vendor-agnostic hardware interface for dispatching workloads across diverse providers. The project features a quantum circuit transpiler that optimizes abstract designs to match the specific basis gates and qubit connectivity of target hardware. It employs a pass-based transpilation pipeline and symbolic instruction translation to convert high-level circuits into hard

    Reduces gate counts and improves processing speed by applying low-level optimizations tailored for specific hardware backends.

    Pythonpythonqiskitquantum
    Ver en GitHub↗7,522
  • quantumlib/cirqAvatar de quantumlib

    quantumlib/Cirq

    4,990Ver en GitHub↗

    Cirq es un framework de computación cuántica en Python utilizado para diseñar, simular y ejecutar circuitos cuánticos en hardware cuántico de escala intermedia ruidosa (NISQ). Sirve como simulador de circuitos cuánticos y modelador de ruido, así como una herramienta para la implementación de algoritmos cuánticos. El framework proporciona una interfaz especializada para hardware NISQ, permitiendo a los usuarios mapear circuitos cuánticos lógicos a topologías de dispositivos físicos mientras validan la conectividad del hardware y las restricciones de las puertas. Se distingue por su modelado de ruido integrado, aplicando canales de despolarización y amortiguación para imitar la decoherencia y los errores encontrados en procesadores cuánticos reales. El proyecto cubre una amplia gama de capacidades, incluyendo el diseño de circuitos cuánticos, la integración de hardware y la simulación de estados. Incluye herramientas para la descomposición de puertas, el mapeo de topología de hardware y la ejecución de procedimientos cuánticos fundamentales como transformadas de Fourier y búsqueda de datos no estructurados. Además, proporciona utilidades analíticas para el cálculo del estado fundamental molecular y la evaluación comparativa de la fidelidad del hardware.

    Evaluates approximate optimization algorithms through landscape analysis, optimization paths, and precomputed angles.

    Pythonalgorithmsapicirq
    Ver en GitHub↗4,990
  • openmlsys/openmlsysAvatar de openmlsys

    openmlsys/openmlsys

    4,813Ver en GitHub↗

    Este proyecto es un recurso educativo integral y un plan de estudios centrado en el diseño e implementación de todo el stack de software y hardware de aprendizaje automático. Sirve como referencia técnica para la arquitectura de sistemas de aprendizaje automático, abarcando desde interfaces de programación de bajo nivel hasta infraestructura de despliegue a gran escala. El proyecto proporciona orientación instructiva sobre varios dominios especializados, incluyendo el desarrollo de compiladores de IA a través de representaciones intermedias y optimizaciones de grafos. Cubre los patrones arquitectónicos necesarios para el entrenamiento distribuido a través de clústeres de GPU y la programación de aceleradores de hardware para optimizar cargas de trabajo en chips especializados. El recurso también detalla la implementación de frameworks de servicio de modelos para entornos de producción y el diseño de pipelines de aprendizaje por refuerzo. Su alcance se extiende a los componentes centrales de los sistemas de ML, como la diferenciación automática, abstracciones de tensores y la orquestación de recursos de GPU.

    Optimizes machine learning workload performance by improving memory bandwidth and throughput on specialized hardware.

    TeXcomputer-systemsmachine-learningsoftware-architecture
    Ver en GitHub↗4,813
  • mostlygeek/llama-swapAvatar de mostlygeek

    mostlygeek/llama-swap

    4,786Ver en GitHub↗

    Llama-swap es un orquestador de inferencia local y puerta de enlace API para modelos de lenguaje de gran tamaño. Funciona como un proxy de la API de OpenAI que gestiona el ciclo de vida de múltiples servidores de modelos locales, iniciándolos y deteniéndolos automáticamente para intercambiar modelos según los identificadores de las solicitudes entrantes. El proyecto destaca por su intercambio dinámico de modelos y optimización de hardware. Utiliza un control de concurrencia basado en matrices para definir qué modelos pueden ejecutarse simultáneamente y emplea una política de desalojo basada en costes para eliminar servidores inactivos de la memoria según los costes relativos de los recursos. El sistema proporciona una gestión integral de modelos, incluyendo alias de identificadores, filtrado de solicitudes y la ejecución de comandos de ciclo de vida para contenedores o máquinas virtuales. También incluye herramientas de observabilidad como un entorno de pruebas visual para modelos, monitorización del rendimiento del sistema en tiempo real y funciones de seguridad como verificación de claves API y cifrado TLS. Las actualizaciones de configuración se gestionan mediante recarga dinámica, que monitoriza el sistema de archivos en busca de cambios sin necesidad de reiniciar manualmente.

    Maximizes GPU and CPU memory efficiency through automated model eviction and idle timeouts.

    Go
    Ver en GitHub↗4,786
  1. Home
  2. Artificial Intelligence & ML
  3. Machine Learning
  4. Infrastructure
  5. Optimization & Inference
  6. Training Algorithms
  7. Deep Learning Optimization
  8. Hardware Optimization

Explorar subetiquetas

  • Graphics Hardware OptimizersInference engine optimizations for specific graphics hardware architectures including format compatibility and dependency management. **Distinct from Hardware Optimization:** Distinct from Hardware Optimization: focuses on inference engine-specific compatibility for newer graphics architectures rather than general hardware throughput.
  • Hardware-Aware Quantum Optimization1 sub-etiquetaLow-level circuit optimizations tailored to the specific physical properties of quantum backends. **Distinct from Hardware Optimization:** Optimizes quantum gates for QPU properties rather than memory bandwidth for AI models.
  • Topology AlignmentTechniques for improving performance by aligning software execution with physical hardware interconnects and processor affinity. **Distinct from Hardware Optimization:** Distinct from general hardware optimization by focusing specifically on the alignment of memory barriers and processor pinning.
  • VRAM Efficiency StrategiesTechniques for maximizing GPU memory by managing model eviction and idle timeouts. **Distinct from Hardware Optimization:** Focuses on temporal eviction and timeout-based memory reclamation rather than low-level throughput optimizations