21 repositorios
Optimizations that adapt machine learning models to utilize specific hardware accelerators and neural engines.
Distinct from ML Performance Profilers: Focuses on the conversion and wrapping of models for specific hardware (like Core ML for Apple Silicon) rather than general performance profiling.
Explore 21 awesome GitHub repositories matching artificial intelligence & ml · Hardware-Specific Model Optimizations. Refine with filters or upvote what's useful.
AISystem is a comprehensive AI full-stack infrastructure project covering the entire pipeline from AI chip architecture to high-level training frameworks. It encompasses the development of AI compiler frameworks, inference engines, and distributed training orchestrators designed to coordinate workloads across a heterogeneous compute stack of CPUs, GPUs, and NPUs. The project focuses on the deep integration of software and hardware, employing software-hardware co-design to align tensor layouts with physical memory structures. It provides specialized capabilities for accelerating Transformer mo
Optimizes model deployment for low latency and reduced power consumption on cloud and edge devices.
DiffusionBee is a Stable Diffusion desktop client for macOS that functions as an AI image generator and editor. It allows for the local generation of images from text prompts and the management of diffusion models without requiring external cloud services or technical setup. The application includes a local diffusion model manager for importing and switching between custom trained model files to achieve specific artistic styles. It also features a system for tracking generation history and uploading assets to a public gallery. The software covers several image synthesis and manipulation work
Optimizes Stable Diffusion models for Apple Silicon neural engines using Core ML integration.
TensorRT es un motor de inferencia de aprendizaje profundo y un kit de desarrollo de software diseñado para optimizar y desplegar redes neuronales para una ejecución de alto rendimiento en GPUs NVIDIA. Funciona como un framework de aceleración de GPU que reduce la latencia y aumenta el rendimiento de los modelos entrenados durante el despliegue en producción. El kit de herramientas importa modelos desde el formato Open Neural Network Exchange y los transforma en motores optimizados. Utiliza optimización de modelos basada en grafos, generación de kernels de fusión de capas y cuantización basada en precisión para convertir pesos de punto flotante a formatos de menor precisión. El framework proporciona capacidades para la serialización de motores específicos de hardware y admite la extensión de las capacidades de inferencia a través de complementos personalizados para capas de redes neuronales especializadas.
Compiles models into binary engines optimized for specific NVIDIA GPU architectures and memory limits.
YOLOv10 is a PyTorch computer vision library and real-time vision framework designed for locating and identifying multiple objects in images and video streams. It functions as an end-to-end object detector that optimizes for high-speed deployment and detection precision. The project is distinguished by an NMS-free detection architecture that predicts a single bounding box per object, eliminating the need for non-maximum suppression post-processing to reduce inference latency. It further optimizes for edge hardware through scalable weights and a quantization-friendly structure that facilitates
Provides edge hardware optimizations including quantization to ensure high-speed deployment on constrained devices.
This project is an AI-powered IDE extension and LLM coding assistant that provides a conversational interface for generating, refactoring, and debugging code. It functions as an AI agent framework and a Model Context Protocol client, connecting AI models to external data sources and tools to automate complex development tasks. The system is distinguished by its use of autonomous AI agents capable of multi-step task execution, including the ability to read files, modify code, and run terminal commands iteratively. It supports recursive agent orchestration through subagent delegation and employ
Optimizes machine learning models to utilize specific hardware accelerators and neural engines on Windows.
AI-on-the-edge-device is an edge AI meter digitizer and computer vision image processor designed to convert images of analog and digital utility meters into numeric values. It functions as an IoT gateway that runs neural network inference locally on hardware to monitor water, power, and gas readings. The system is distinguished by its ability to handle both analog pointers and digital digits through custom-trained neural networks. It includes specialized tools for image alignment, region-of-interest extraction, and hardware-level lighting control to minimize glare on glass surfaces. To mainta
Reduces file size and increases execution speed on edge hardware by substituting floating-point numbers with integers.
Nebullvm is an AI inference accelerator, GPU resource orchestrator, and performance optimization library for large language models. It functions as an optimization layer designed to lower operational costs by aligning model execution with underlying hardware architectures. The system maximizes cluster efficiency through real-time dynamic partitioning and elastic quotas for shared hardware resources. It employs alignment methods and techniques to reduce the hardware and data requirements necessary for tuning large language models. The project covers broad capability areas including AI infrast
Optimizes model execution paths to match the specific memory and compute layout of underlying GPU hardware.
This project is a vision language model framework and vision-to-text pipeline designed for deploying and optimizing models that process both images and text. It provides an on-device inference engine and a vision language model framework to run quantized models locally on mobile and desktop hardware accelerators. The framework features a model quantization toolkit to reduce weight precision for lower memory footprints and increased execution speed on specialized silicon. It also includes an efficient vision encoder utilizing a hybrid encoding system to compress image tokens, which reduces pro
Transforms model checkpoints into optimized formats and quantization levels compatible with specific hardware accelerators.
Este proyecto es un pipeline y framework de recomendación de extremo a extremo diseñado para construir motores de recomendación generativos. Utiliza modelos de lenguaje de gran tamaño y búsqueda vectorial para facilitar el descubrimiento personalizado de elementos y genera recomendaciones mediante tokenización y alineación semántica. El sistema integra un motor de recomendación generativo con un sistema de clasificación multiobjetivo y un pipeline de recuperación mediante búsqueda vectorial. Estos componentes permiten el uso de frameworks de razonamiento para realizar inferencias sobre elementos y la aplicación de algoritmos de re-ranking para optimizar la diversidad de los resultados. El framework cubre el ciclo de vida completo del desarrollo de recomendaciones, incluyendo la optimización de la recuperación de candidatos, el modelado de preferencias de usuario y la creación de divisiones de pipeline offline-online para el despliegue. También incorpora modelado de secuencias consciente del hardware para mantener el rendimiento en diferentes escalas de hardware.
Tailors sequence models to specific hardware constraints to optimize recommendation performance.
Corenet is a deep learning training framework and computer vision model library designed for developing neural networks across vision, text, and audio modalities. It functions as a distributed training orchestrator for scaling workloads across multiple compute nodes and provides a multimodal data pipeline for processing image, text, and video data. The project includes a model conversion toolkit for transforming weights and architectures between different machine learning frameworks. It also provides tools for optimizing model performance on Apple Silicon and reducing response latency in gene
Optimizes model performance for Apple Silicon to increase processing speed and reduce resource consumption.
YOLOv6 es un framework de aprendizaje profundo de una sola etapa diseñado para la detección industrial de objetos. Sirve como un entrenador de modelos de visión artificial para identificar y localizar objetos dentro de imágenes, así como una herramienta de segmentación de instancias que delinea límites precisos de objetos utilizando máscaras. El proyecto incluye un optimizador de inferencia móvil especializado y un kit de herramientas de cuantización de modelos. Estos componentes se centran en reducir el tamaño y la resolución del modelo para mejorar la velocidad de ejecución en chipsets basados en ARM y convertir modelos a formatos de baja precisión para disminuir el tamaño del archivo. El framework cubre una amplia gama de capacidades, incluyendo entrenamiento de modelos personalizados, segmentación de instancias en tiempo real y conversión de tiempo de ejecución de modelos para ejecución multiplataforma. También admite la optimización de inferencia en dispositivos de borde para mantener el rendimiento en varios tiempos de ejecución de hardware.
Applies quantization and graph optimizations to reduce latency and memory footprint on resource-constrained edge devices.
coremltools es un kit de herramientas de conversión y traductor diseñado para transformar modelos de machine learning de varios frameworks al formato Core ML para su ejecución en hardware de Apple. Proporciona un conjunto de herramientas para migrar pesos y arquitecturas de librerías externas a un formato de modelo desplegable. El proyecto incluye una herramienta de optimización y una interfaz programática para editar grafos de modelos y modificar metadatos con el fin de mejorar el rendimiento en el hardware de destino. También cuenta con una suite de validación utilizada para verificar las especificaciones del modelo y la compatibilidad de las operaciones para asegurar una ejecución correcta dentro del runtime. El kit de herramientas cubre una amplia gama de capacidades de despliegue, incluyendo la edición de grafos de modelos, configuración de metadatos y verificación de compatibilidad con especificaciones formales de formato.
Optimizes model graphs and metadata specifically to leverage Apple hardware accelerators and neural engines.
Este proyecto es una guía arquitectónica de MLOps y framework para diseñar y desplegar sistemas de deep learning en entornos de producción. Proporciona un enfoque estructurado para el despliegue de inferencia de modelos, orquestación de pipelines de ML y la creación de arquitecturas de machine learning a nivel de producción. El proyecto se distingue por un enfoque en deep learning distribuido y edge AI. Cubre metodologías para paralelizar el entrenamiento de modelos a través de múltiples GPUs para manejar grandes datasets y aplica técnicas como cuantización y destilación para reducir el tamaño del modelo para hardware embebido. La superficie de capacidad se extiende al monitoreo y observabilidad, incluyendo el seguimiento del rendimiento del modelo, deriva de datos (data drift) y métricas de experimentos. También aborda la orquestación de flujos de trabajo de datos, versionado de datasets mediante almacenes de objetos y la gestión de solicitudes de inferencia de alto volumen utilizando procesamiento por lotes adaptativo y orquestación basada en contenedores.
Applies quantization and distillation to reduce model memory and compute footprints for embedded hardware.
Efficient-AI-Backbones es una librería de redes neuronales ligera y zoo de modelos de visión artificial. Proporciona una colección de backbones de deep learning optimizados diseñados para minimizar la sobrecarga computacional y el uso de memoria para tareas de inteligencia artificial. El proyecto implementa arquitecturas especializadas como GhostNet y MLP para reducir los requisitos de procesamiento. Cuenta con un diseño de backbone modular y la distribución de pesos preentrenados para acelerar el desarrollo y despliegue de modelos de visión. La librería cubre el diseño eficiente de redes neuronales y la optimización de IA para dispositivos de borde (edge devices). Sus capacidades incluyen la implementación de arquitecturas ligeras y el despliegue de backbones preentrenados para aplicaciones de visión artificial.
Optimizes model architectures to reduce inference latency and memory footprint for resource-constrained edge devices.
MODNet is a deep learning image segmenter and portrait matting model designed to isolate human subjects from backgrounds. It generates high-quality alpha mattes for images and video using only standard RGB input, removing the requirement for manual trimap guides. The framework is optimized for real-time inference and provides utilities to export pre-trained model weights into specialized formats for deployment on target hardware. The project covers the full workflow for portrait isolation, including supervised matting model training on labeled datasets, real-time video background removal, an
Optimizes model weights and formats to reduce inference latency and memory footprint on resource-constrained edge devices.
ExecuTorch is a lightweight C++ runtime for deploying PyTorch models on mobile, embedded, and edge hardware. It provides an ahead-of-time compilation pipeline that exports, quantizes, and lowers model graphs into compact serialized programs, then executes them through a minimal runtime with hardware acceleration and on-device large language model inference capabilities. The project distinguishes itself through a hardware accelerator delegate system that partitions model subgraphs and offloads computation to specialized backends including NPUs, GPUs, and DSPs from Apple, Arm, Intel, MediaTek,
Optimizes and lowers models for specific hardware backends, producing specialized files for efficient device execution.
Este proyecto es una suite de plugins de optimización para Blender diseñada para procesar mallas, rigs y texturas para plataformas de renderizado en tiempo real y avatares. Funciona como un optimizador de mallas y rigs que simplifica modelos 3D y proporciona herramientas especializadas para importar y limpiar activos de formatos como MMD, Mixamo y DAZ. El kit de herramientas cuenta con un pipeline dedicado para preparar personajes para VRChat y otros entornos de realidad virtual social. Incluye un generador de atlas de texturas para fusionar múltiples imágenes en una sola hoja para reducir las llamadas de dibujo (draw calls), así como servicios de traducción basados en diccionarios para convertir nombres de entidades de japonés a inglés. El plugin cubre una amplia gama de capacidades técnicas, incluyendo la decimación de polígonos que preserva las claves de forma (shape keys), la simplificación esquelética mediante la fusión de huesos y la limpieza de jerarquías, y la configuración de animación facial para sincronización labial y seguimiento ocular. También proporciona herramientas de manipulación de geometría para ajustar las normales de las caras y hornear (bake) transformaciones de objetos directamente en los datos de la malla. El proyecto está implementado como un add-on de Blender basado en Python.
Creates simplified versions of models to maintain performance on lower-specification hardware.
This project is a containerized local AI infrastructure stack designed to deploy large language models and vector databases on private hardware. It functions as an orchestration platform that combines AI runners, knowledge graphs, and a visual workflow builder for creating agentic chatflows and automating tasks via tool integration. The platform distinguishes itself through a low-code approach to agent orchestration, utilizing a visual interface to design complex sequences and connect agents to external tools and search engines. It includes a dedicated local observability stack to track promp
Leverages specific hardware profiles for GPUs and CPUs to maximize the inference efficiency of local models.
DeepCamera is an open-source AI video surveillance and network video recorder platform powered by local vision language models and hardware-accelerated processing. It integrates live feeds from network cameras, webcams, and mobile devices to monitor physical spaces while running local edge vision inference without relying on cloud servers. The platform incorporates privacy-preserving video anonymization that converts raw video frames into abstract depth maps in real time, retaining motion tracking while protecting personal identity. Its modular architecture supports pluggable AI scripts and
Converts deep learning models into optimized formats tailored for specific hardware accelerators.
Neural Compressor is a deep learning model compression toolkit and AI inference acceleration engine. It functions as an automated model quantization tool and hardware-aware model compiler designed to reduce the memory footprint of neural networks and decrease execution latency. The project provides specialized frameworks for optimizing large language models, utilizing weight-only quantization and hardware-specific kernels to improve the operational efficiency of generative AI workloads. It maps neural network operators to specialized CPU and GPU vector instructions to accelerate model executi
Adapts models to utilize specific hardware accelerators by dispatching operators to vector and matrix instructions.