22 repositorios
Techniques for reducing model storage size by converting weights to 16-bit floating-point formats.
Distinct from Model Compression Suites: Focuses specifically on FP16-based storage reduction, distinct from general multi-technique compression suites.
Explore 22 awesome GitHub repositories matching artificial intelligence & ml · Half-Precision Compression. Refine with filters or upvote what's useful.
This project is a singing voice conversion tool based on VITS generative modeling. It transforms the identity of a singing voice to a target speaker while preserving the original melody, lyrics, and intonation. The system distinguishes itself through hybrid voice synthesis, allowing for the blending of multiple speaker identities via linear model interpolation. It utilizes cluster-based feature retrieval to increase target voice similarity and employs a diffusion probabilistic model as a post-processor to remove electronic artifacts and improve vocal clarity. The software covers a broad rang
Reduces model disk footprint by converting weights to float16 and stripping optimizer states for deployment.
MNN is a high-performance inference engine and framework designed for on-device machine learning. It provides a comprehensive environment for executing, optimizing, and deploying neural network models directly on mobile and resource-constrained edge devices. The framework distinguishes itself through a robust model optimization toolkit that supports quantization, compression, and structural graph manipulation to minimize memory footprint and maximize execution speed. It features a modular architecture that abstracts hardware-specific backends, allowing models to run efficiently across diverse
Reduces model storage size by half while maintaining precision for hardware supporting half-precision operations.
Open CLIP is an open source framework for training and deploying Contrastive Language-Image Pre-training models. It serves as a vision-language training framework and multimodal embedding engine that maps images and text into a shared vector space for similarity searches and zero-shot classification. The project provides a toolkit for distributed training of contrastive models and includes an image-to-text generative model for producing natural language descriptions. It supports custom text encoder integration and utilizes teacher-student model distillation to transfer knowledge from large pr
Utilizes mixed-precision weight quantization and 8-bit linear layers to reduce memory usage during training.
PaddleNLP is a development library and toolkit for training, fine-tuning, and deploying large and small language models using the PaddlePaddle framework. It provides a comprehensive suite for the entire natural language processing lifecycle, from model development to high-performance inference. The project features a standardized model zoo for loading and managing pre-trained models and tokenizers through a unified interface. It distinguishes itself with a specialized model compression framework that reduces memory footprints via weight precision conversion and lossless size optimization, alo
Compresses model memory footprints by converting high-precision weights into smaller numerical formats.
Intel XPU LLM Acceleration Library is a toolkit designed to accelerate large language model inference and finetuning on Intel CPUs, GPUs, and NPUs. It provides a distributed inference engine for scaling models across multiple accelerators, a multimodal model runtime for vision and speech tasks, and a low-bit model quantization tool for converting weights into INT4, FP8, and GGUF formats. The project features a parameter-efficient finetuning framework that enables model adaptation using QLoRA and DPO on Intel hardware. It distinguishes itself by providing specialized optimizations for Intel XP
Transforms linear layers into low-bit integers during the model loading phase to accelerate execution.
This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene
Reduces model size and improves throughput by converting float32 weights to lower-precision formats.
StoryDiffusion is a generative AI system designed for consistent character image and video generation. It utilizes a pluggable cross-attention module to inject shared character representations into pretrained diffusion models, allowing for visual identity stability across multiple images and scenes without retraining the base model. The project features a video generation pipeline that produces temporally coherent sequences from text prompts or condition images. It employs a latent space motion interpolator to predict intermediate frames and semantic motion, enabling long-range video generati
Reduces GPU memory footprint by converting model weights to lower numerical precision.
Este proyecto es un framework de transformers basado en JAX y un entrenador de modelos de lenguaje a gran escala diseñado para construir y entrenar modelos distribuidos en aceleradores de hardware TPU. Proporciona un sistema para el preentrenamiento y ajuste fino (fine-tuning) de modelos autorregresivos dividiendo pesos y cálculos a través de una malla de dispositivos para reducir la sobrecarga de memoria y aumentar la velocidad de procesamiento. El framework incluye un orquestador de cómputo TPU para aprovisionar recursos y automatizar la instalación de dependencias en nodos distribuidos remotos. También cuenta con un convertidor de pesos de modelos capaz de transformar y redistribuir (resharding) checkpoints entre diferentes configuraciones de hardware y precisiones numéricas. El proyecto cubre capacidades más amplias, incluyendo la gestión de checkpoints fragmentados para almacenamiento en la nube, carga de datos basada en flujos con restauración de estado y generación de texto basada en núcleos para la inferencia de modelos. Además, admite aceleración de hardware compilada con XLA para clusters de TPU y GPU, y proporciona herramientas para benchmarking de rendimiento frente a tareas de lenguaje estandarizadas.
Transforms the numerical precision of model parameters to optimize memory footprint and execution speed on specific hardware.
Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a configurable training pipeline orchestrated through YAML recipes, with CLI overrides and component swapping, distributed training via FSDP2, memory optimizations, and parameter-efficient fine-tuning methods like LoRA, DoRA, and QLoRA. The library distinguishes itself through its YAML-driven configuration system that defines all training parameters and instantiates components from config files, with full CLI override capability for any field or component at launch time. It suppo
Trains models in bfloat16 half-precision to halve memory usage per parameter and speed up computation.
Super-Gradients es un framework de visión artificial de PyTorch y biblioteca de entrenamiento diseñada para el ciclo de vida completo de los modelos de visión. Funciona como un optimizador de modelos de deep learning y un kit de herramientas de despliegue para entrenar y ajustar modelos en tareas de clasificación de imágenes, detección de objetos, segmentación semántica y estimación de pose. El proyecto proporciona herramientas específicas para la optimización de modelos, incluyendo destilación de conocimiento profesor-estudiante y compresión de precisión numérica para reducir los requisitos de memoria y computación. También incluye la implementación de la arquitectura Yolo-NAS para detección de objetos de alto rendimiento. El framework cubre una amplia superficie de capacidades, incluyendo entrenamiento distribuido en GPU, pipelines de visión modulares y la automatización de ejecuciones de entrenamiento mediante configuraciones de recetas estructuradas. Además, gestiona la carga de datos, la aumentación de imágenes y la exportación de pesos entrenados a formatos universales para aceleradores de hardware de producción.
Reduces memory and computational requirements by implementing numerical precision compression for deployment on resource-constrained hardware.
TNN es un framework de inferencia de deep learning diseñado para ejecutar redes neuronales preentrenadas en hardware móvil, de escritorio y servidor. Funciona como un runtime acelerado por hardware y un kit de herramientas de compresión de modelos, proporcionando una interfaz unificada para desplegar modelos en diversos entornos. El framework incluye un convertidor de modelos ONNX para transformar modelos de varios frameworks de entrenamiento a un formato interno estandarizado. Se distingue por una combinación de herramientas de compresión de modelos —incluyendo cuantización de pesos y poda de código estático— y un sistema de gestión de memoria que reutiliza buffers entre nodos no dependientes para reducir el uso de RAM. El sistema optimiza el rendimiento mediante la fusión de operadores para minimizar el acceso a la memoria y emplea backends específicos de plataforma para aprovechar procesadores especializados y GPUs. Aumenta aún más la velocidad de ejecución mediante cálculos de baja precisión y ajustes específicos de hardware.
Increases execution speed and reduces memory consumption using low-precision calculations.
Este proyecto es un recurso educativo integral y un curso para construir redes neuronales usando PyTorch. Cubre los bloques de construcción fundamentales del deep learning, incluyendo la manipulación de tensores, la diferenciación automática y la construcción de componentes modulares de redes neuronales. El repositorio sirve como guía técnica para varios dominios especializados. Proporciona detalles de implementación para tareas de visión artificial como clasificación de imágenes, detección de objetos y segmentación semántica, así como flujos de trabajo de procesamiento de lenguaje natural que involucran transformers, redes recurrentes y modelos generativos. Además, incluye una referencia para IA generativa, centrándose específicamente en la síntesis de imágenes mediante modelos de difusión y redes adversarias. El material se extiende a pipelines de optimización y despliegue de modelos. Cubre técnicas para reducir el tamaño del modelo y aumentar la velocidad de inferencia mediante cuantización y la exportación de modelos a formatos como ONNX y TensorRT. Otras áreas de capacidad incluyen ingeniería de datos para carga paralela, evaluación de modelos mediante métricas personalizadas y el despliegue de modelos de lenguaje grandes (LLM) de código abierto. El proyecto se entrega principalmente como una serie de Jupyter Notebooks.
Transforms network layers into low-bit formats to reduce latency and increase throughput.
exllamav2 es una librería de inferencia de alto rendimiento diseñada para ejecutar modelos de lenguaje grandes localmente en GPUs de grado consumidor. Proporciona un runner acelerado por GPU y herramientas de cuantización para permitir la ejecución de modelos sin depender de servicios de computación en la nube. El proyecto cuenta con una utilidad de cuantización que comprime modelos en bitrates mixtos de entre dos y ocho bits para reducir los requisitos de VRAM. Se distingue por un generador de texto por lotes que maneja solicitudes agrupadas y deduplica datos de caché para aumentar el rendimiento. La librería cubre una amplia superficie de capacidades, incluyendo streaming de tokens asíncrono para salida en tiempo real, ejecución de kernels de GPU personalizados para operaciones de álgebra lineal y mapeo de memoria local para acceso de baja latencia a los pesos del modelo.
Compresses model weights into varying bit-widths between two and eight bits to reduce memory footprint.
exllamav2 es un motor de inferencia de alto rendimiento y framework para ejecutar modelos de lenguaje grandes localmente en GPUs de clase consumidor. Proporciona un sistema completo para el despliegue de modelos locales, incluyendo un motor de inferencia especializado y herramientas para la cuantización de modelos. El proyecto cuenta con un framework de inferencia multi-GPU que distribuye las cargas de trabajo entre múltiples tarjetas gráficas para ejecutar modelos que exceden la capacidad de memoria de un solo dispositivo. Incluye un cuantizador de modelos de GPU capaz de convertir modelos a formatos de precisión mixta de entre 2 y 8 bits para equilibrar el uso de memoria y la precisión. El motor admite la generación de texto de alto rendimiento mediante inferencia paralela basada en lotes y streaming de salida asíncrono. Estas capacidades están respaldadas por kernels CUDA personalizados y deduplicación de caché para optimizar el uso del hardware y reducir la latencia durante la generación de tokens.
Balances model size and accuracy using mixed-precision quantization between two and eight bits.
VisualGLM-6B es un modelo de lenguaje grande multimodal bilingüe y modelo de visión-lenguaje diseñado para tareas conversacionales y comprensión visual. Funciona como un modelo de IA bilingüe capaz de procesar y generar respuestas tanto en chino como en inglés. El sistema es un modelo de lenguaje grande cuantizado que admite precisión de 4 y 8 bits para reducir el uso de memoria y los requisitos de hardware durante el despliegue local. También es un modelo de ajuste fino (fine-tuning) eficiente en parámetros, lo que permite realizar ajustes de peso para adaptar el sistema a tareas específicas sin necesidad de reentrenamiento completo. El proyecto cubre IA conversacional multimodal y diálogo basado en imágenes, permitiendo el análisis de contenido visual para realizar tareas de comprensión visual en múltiples idiomas. Sus capacidades incluyen cuantización de precisión del modelo y ajuste fino específico de dominio para aplicaciones especializadas.
Converts model weights to 4-bit or 8-bit precision to lower memory requirements.
Chinese-Vicuna es un modelo de lenguaje grande chino e IA que sigue instrucciones basado en la arquitectura LLaMA. Está diseñado específicamente para la comprensión y generación de lenguaje natural en el idioma chino, utilizando un modelo ajustado por instrucciones para seguir prompts complejos de usuario a través de conversaciones. El proyecto proporciona un framework de ajuste fino LoRA y sistemas de cuantización para permitir la adaptación del modelo y la inferencia en hardware de consumo. Implementa inferencia cuantizada para reducir el uso de memoria tanto en CPUs como en GPUs, soportado por una implementación de bajo nivel en C++ para minimizar los requisitos de recursos del sistema. El sistema cubre una amplia gama de capacidades de procesamiento de lenguaje natural, incluyendo gestión de conversaciones multivuelta, traducción multilingüe y generación de código de programación. También incluye herramientas para entrenamiento específico de dominio, conversión de formato de modelo y una interfaz de chat interactiva con salida de texto en streaming.
Reduces model precision to enable efficient inference on hardware with limited graphics memory.
oneDNN es una biblioteca para la aceleración del aprendizaje profundo que proporciona bloques de construcción optimizados para el entrenamiento e inferencia de redes neuronales. Gestiona la computación de tensores a través de hardware CPU y GPU, permitiendo la ejecución de primitivas de alto rendimiento para el entrenamiento de modelos y la optimización de la inferencia de redes neuronales. El proyecto se distingue por la optimización de kernels específica para el hardware y el uso de compilación just-in-time para apuntar a conjuntos de instrucciones de procesador específicos. Soporta la ejecución de redes neuronales cuantizadas utilizando cuantización estática y dinámica para reducir el uso de memoria y aumentar el rendimiento. La biblioteca cubre una amplia gama de capacidades, incluyendo primitivas de aprendizaje profundo como convoluciones, multiplicación de matrices y ejecución de redes neuronales recurrentes. Implementa optimizaciones de rendimiento avanzadas, incluyendo fusión de operaciones, optimización de grafos de computación y gestión de formatos de memoria. La integración se proporciona a través de una ABI C estable y un wrapper C++, con soporte para SYCL, OpenCL y bibliotecas de álgebra lineal externas. El sistema incluye herramientas de observabilidad para la creación de perfiles de rendimiento de hardware, benchmarking de primitivas y registro de ejecución detallado.
Executes deep learning operations using reduced-precision numerical types to increase throughput and reduce memory usage.
VILA is a vision-language model integration that combines a visual encoder with a large language model to process images and text in a shared space. Its primary purpose is to enable the generation of natural language explanations and detailed text summaries of images and videos based on user prompts. The project utilizes a multi-stage alignment pipeline to synchronize visual and textual embeddings through sequential pretraining and supervised fine-tuning. To support deployment on desktop and edge hardware, it employs quantized low-precision inference to reduce model weights to 4-bit precision
Employs low-precision inference by reducing model weights to 4-bit precision for faster execution on edge hardware.
This project is a collection of scripts and workflows for training, fine-tuning, and deploying large language models using the Hugging Face Transformers toolkit. It functions as a distributed training framework, a library for natural language processing task implementations, and a system for building retrieval-augmented generation chatbots. The repository includes specialized tools for model optimization, such as a Bayesian hyperparameter optimizer for automatically tuning model settings. It provides implementations for scaling model training across multiple graphics processors using data par
Employs mixed-precision quantization to reduce memory usage and accelerate training speed.
ChatGLM-Efficient-Tuning is a fine-tuning framework and toolkit designed to optimize large language models using parameter-efficient fine-tuning techniques. It provides a pipeline for adjusting model behavior and reducing the memory and compute requirements necessary for training. The project features a web-based trainer and orchestration interface for configuring and executing the fine-tuning process on a single GPU. It supports quantized training in lower precision formats to enable fine-tuning on hardware with limited memory, as well as reinforcement learning from human feedback for model
Supports reducing the bit-width of model weights to enable training on hardware with limited memory.