14 repositorios
Utilities that improve generation latency by reducing the number of model forward passes.
Distinct from Token Optimization Utilities: Distinct from Token Optimization Utilities: targets GPU pass reduction for speed rather than just token count reduction for cost.
Explore 14 awesome GitHub repositories matching artificial intelligence & ml · Generation Speed Optimizers. Refine with filters or upvote what's useful.
Guidance is a control framework and generation orchestrator for large language models. It provides a programming layer to steer model outputs through structured templates, schema enforcement, and logical flow management. The framework distinguishes itself by interleaving model generation with local code execution, enabling the use of loops and conditional branching within a single session. It employs grammar-based token constraints and regular expressions to force models to sample only from tokens that satisfy a specific structural format, ensuring strict adherence to predefined data models.
Improves generation speed by inserting known tokens directly into the output stream to reduce GPU passes.
This project is a systematic framework for English language acquisition that applies structured workflows and cognitive strategies to build linguistic proficiency. It focuses on the construction of a linguistic knowledge base, enabling learners to master vocabulary and grammar through methodical training. The methodology is distinguished by its use of computer science concepts, such as mental-model-based learning and memory buffers, to organize progression. It emphasizes a cognitive-translation bypass to develop target language thinking, reducing mental latency by processing information direc
Removes the need for mental translation to improve real-time interaction efficiency.
StreamDiffusion is an interactive generative AI framework and inference engine designed for the low-latency delivery of image and video streams. It provides a real-time Stable Diffusion pipeline for text-to-image and image-to-image generation, enabling the creation of continuous generative image streams with minimized computational delay. The framework optimizes throughput using a pre-computed cache engine and residual-based guidance approximation to reduce the number of required model passes. It further manages GPU load through similarity-based frame skipping, which avoids redundant computat
Accelerates image generation by reducing the number of required model forward passes.
This project is a framework for training and sampling generative models designed to produce high-quality images in few steps. It provides implementations for image generation models that transform random noise into structured visual data through an optimized sampling process. The system specializes in accelerating image generation through consistency distillation and consistency training. It includes tools to transform pre-trained diffusion models into faster versions by distilling knowledge from a teacher model into a student model, as well as methods to train consistency models from scratch
Optimizes inference speed by reducing the number of sampling steps required for image generation.
Chooses model size and compute precision to balance transcription accuracy against inference speed on available hardware.
Mace es un framework de inferencia de deep learning móvil y motor de aceleración de hardware. Funciona como un runtime para ejecutar modelos de redes neuronales en dispositivos móviles, distribuyendo cálculos a través de CPUs, GPUs y NPUs. El proyecto incluye un convertidor de modelos multiplataforma para transformar redes neuronales pre-entrenadas de varios formatos de la industria en representaciones optimizadas para móviles. También proporciona un ofuscador de redes neuronales que convierte los pesos del modelo en código fuente para proteger la propiedad intelectual contra la ingeniería inversa. El framework gestiona los recursos del dispositivo optimizando la asignación de memoria y ajustando la configuración de energía del chip. Además, aborda el rendimiento de ejecución mediante la optimización de algoritmos matemáticos y la división de cálculos para mantener la capacidad de respuesta de la interfaz.
Increases operation speed by applying hardware acceleration and optimized mathematical algorithms to complex calculations.
LightGlue is a deep learning framework designed for local feature matching and high-speed correspondence estimation between pairs of images. It functions as a computer vision matching model that identifies corresponding keypoints across different viewpoints. The system utilizes an adaptive neural network architecture that dynamically optimizes inference speed by pruning its own depth and width based on the input image pairs. This approach employs a transformer-style attention mechanism and cross-image attention to compute correlations between feature descriptors. The matching process include
Reduces computational cost and increases processing speed through adaptive network pruning during inference.
Este proyecto es un recurso educativo integral y un curso para construir redes neuronales usando PyTorch. Cubre los bloques de construcción fundamentales del deep learning, incluyendo la manipulación de tensores, la diferenciación automática y la construcción de componentes modulares de redes neuronales. El repositorio sirve como guía técnica para varios dominios especializados. Proporciona detalles de implementación para tareas de visión artificial como clasificación de imágenes, detección de objetos y segmentación semántica, así como flujos de trabajo de procesamiento de lenguaje natural que involucran transformers, redes recurrentes y modelos generativos. Además, incluye una referencia para IA generativa, centrándose específicamente en la síntesis de imágenes mediante modelos de difusión y redes adversarias. El material se extiende a pipelines de optimización y despliegue de modelos. Cubre técnicas para reducir el tamaño del modelo y aumentar la velocidad de inferencia mediante cuantización y la exportación de modelos a formatos como ONNX y TensorRT. Otras áreas de capacidad incluyen ingeniería de datos para carga paralela, evaluación de modelos mediante métricas personalizadas y el despliegue de modelos de lenguaje grandes (LLM) de código abierto. El proyecto se entrega principalmente como una serie de Jupyter Notebooks.
Adjusts image size and confidence thresholds to balance execution speed and accuracy.
GhostNet ofrece un conjunto de arquitecturas de modelos de IA eficientes y patrones de diseño de redes neuronales creados para reducir el consumo de cómputo y memoria. Funciona como un backbone de visión artificial y un vision transformer ligero, optimizando el equilibrio entre la precisión predictiva y la velocidad de inferencia. El proyecto se centra en reducir el consumo de recursos para el despliegue en dispositivos móviles y hardware de borde (edge). Esto se logra mediante implementaciones de vision transformers ligeros y arquitecturas que minimizan el número total de parámetros. El código base cubre una amplia gama de capacidades para la optimización de inferencia, incluyendo la reducción de costes computacionales y el uso de memoria. Implementa patrones de diseño estructurales como bloques convolucionales de profundidad separable (depthwise-separable), convoluciones de profundidad con cuello de botella lineal y bloques de transformer con pesos vinculados para reducir la latencia de inferencia.
Optimizes the execution speed and memory usage of neural network inference for faster live predictions.
Este proyecto es una traducción al chino de las guías técnicas y referencias de API para el framework de aprendizaje profundo PyTorch. Sirve como una base de conocimientos localizada y material de referencia para hacer que la documentación de aprendizaje profundo sea accesible para hablantes no angloparlantes. La documentación cubre una gama completa de capacidades de PyTorch, incluyendo el desarrollo de modelos de redes neuronales, diferenciación automática y la implementación de kernels de backend. Proporciona orientación detallada sobre estrategias de entrenamiento distribuido, despliegue de modelos a través de formatos como ONNX y C++, y diversas técnicas de optimización y cuantización de modelos. El proyecto utiliza un pipeline de traducción impulsado por la comunidad y un modelo de contribución distribuido para mantener el contenido sincronizado con las versiones. Los materiales técnicos se organizan utilizando markdown y se renderizan en un sitio web navegable mediante generación de sitios estáticos.
Offers methods to reduce memory footprint and execution time by converting models to quantized formats.
Este proyecto es un modelo base de texto a voz expresivo y un sistema de clonación de voz diseñado para sintetizar voz humana con matices emocionales y alta fidelidad. Funciona como un modelo de voz ajustable que puede generar audio imitando a una persona específica utilizando una muestra de voz de referencia. El sistema se distingue por un motor de inferencia de alto rendimiento que utiliza caché de memoria y compilación de hardware para reducir la latencia durante el proceso de generación de audio. Además, permite mejoras en la calidad de la síntesis mediante el entrenamiento del modelo de lenguaje en conjuntos de datos personalizados que consisten en archivos de audio y subtítulos coincidentes. El framework cubre los dominios más amplios de clonación de voz personalizada, síntesis de voz expresiva y ajuste fino de modelos de voz.
Optimizes the execution speed of neural network inference via hardware compilation and memory caching.
OmniGen2 es un modelo de generación de imágenes unificado y un modelo de lenguaje grande multimodal diseñado para manejar la generación de texto a imagen, tareas de imagen a imagen y edición de imágenes dentro de un único framework. Funciona como un motor visual de modelo de lenguaje causal capaz de generar y editar imágenes basadas en entradas combinadas de texto y visuales. El sistema cuenta con composición visual en contexto y generación impulsada por sujetos, permitiéndole extraer sujetos de imágenes de referencia y colocarlos en nuevas escenas. También admite la edición de imágenes basada en instrucciones, donde objetos o estilos específicos se modifican mediante comandos de lenguaje natural mientras se preserva el resto de la imagen. Las capacidades del modelo se extienden al análisis y razonamiento de contenido visual, permitiendo el reconocimiento de objetos a través de entradas combinadas de texto y visión. Para mejorar la calidad de salida, emplea un proceso de refinamiento visual iterativo con un mecanismo de autocorrección. El rendimiento se gestiona mediante la optimización del uso de VRAM a través de la descarga dinámica de pesos y la aceleración de la velocidad de inferencia utilizando técnicas de caché.
Increases generation throughput using caching techniques and adjusted guidance ranges to accelerate model inference.
MAGI-1 is an autoregressive video generation model designed to synthesize high-resolution video sequences from text prompts and image references. It functions as a generative system for text-to-video, image-to-video, and video-to-video transformations. The model utilizes an autoregressive architecture that treats spatio-temporal patches as a sequence of discrete tokens to maintain temporal motion. It employs a variational autoencoder to compress the spatial and temporal dimensions of video data and uses distillation-based step scaling to allow for inference budget control. The system integra
Provides inference budget control to balance output quality and processing speed via distillation-based step sizes.
Paper2Slides is an AI-driven presentation generator and content extractor designed to transform academic papers and scientific documents into structured slides and posters. It utilizes retrieval-augmented generation to distill key data points and identify critical figures while maintaining direct traceability to the original source text. The system functions as an AI slide designer that applies professional themes or custom visual styles defined through natural language. It integrates with external image generation services to produce high-quality visuals and research visualizations for acade
Optimizes processing speed by allowing a choice between deep semantic indexing for complex papers and a fast mode for short files.