3 repositorios
Libraries implementing the GPTQ algorithm for post-training weight quantization.
Distinct from 4-Bit Quantization Tools: Specifically implements the GPTQ algorithm, whereas the parent is a general tool for 4-bit quantization
Explore 3 awesome GitHub repositories matching devops & infrastructure · GPTQ Quantization Libraries. Refine with filters or upvote what's useful.
Lit-llama es un framework de implementación basado en PyTorch para el modelo de lenguaje LLaMA, que proporciona un sistema para pre-entrenamiento, ajuste fino e inferencia de alto rendimiento. Incluye un pipeline de pre-entrenamiento para crear modelos de lenguaje fundamentales desde cero y herramientas para ejecutar pesos pre-entrenados para generar texto natural y predecir secuencias. El proyecto proporciona toolkits especializados para el ajuste fino eficiente en parámetros utilizando adaptación de bajo rango (LoRA) y adaptadores ligeros. También incluye una librería de cuantización que reduce las huellas de memoria del modelo a través de precisión de cuatro y ocho bits para permitir la ejecución en hardware con recursos limitados. El framework incorpora un diseño de transformador simplificado y emplea flash attention para optimizar la memoria y la velocidad. Además, gestiona datasets a gran escala a través de formatos de datos en streaming para evitar cargar corpora completos en la memoria del sistema.
Ships a quantization library that reduces memory footprints via GPTQ-based 4-bit and 8-bit precision.
AutoGPTQ es un framework de compresión de modelos diseñado para reducir la huella de memoria y aumentar la velocidad de inferencia de modelos de lenguaje grandes (LLM). Utiliza el algoritmo GPTQ para comprimir los pesos del modelo, permitiendo que estos modelos se ejecuten en hardware con VRAM limitada. El kit de herramientas proporciona una tubería de cuantización de arquitectura que admite la integración de clases de modelos personalizados para diversas arquitecturas de redes neuronales. Incluye un motor de inferencia de precisión mixta con kernels optimizados para acelerar la multiplicación de matrices durante el despliegue. El framework cubre el flujo de trabajo completo de compresión de pesos, desde la calibración y cuantización hasta la evaluación de precisión posterior. Estas herramientas miden la pérdida de rendimiento comparando la salida de los modelos cuantizados contra los pesos originales en tareas de referencia.
Implements the GPTQ algorithm for post-training weight quantization to reduce model size.
AutoGPTQ es un kit de herramientas de compresión de modelos y un framework de cuantización post-entrenamiento diseñado para reducir la huella de memoria de modelos de lenguaje grandes. Utiliza el algoritmo GPTQ para comprimir los pesos de las redes neuronales, reduciendo los requisitos de hardware y el uso de VRAM. El proyecto sirve como un acelerador de inferencia al proporcionar kernels optimizados que aumentan la velocidad de generación de tokens. Cuenta con extensibilidad de arquitectura de modelo, permitiendo que las capacidades de cuantización se añadan a nuevas estructuras de modelos mediante patrones configurables. El framework cubre una tubería de cuantización integral, incluyendo compresión de pesos por capa, estimación de escala basada en calibración y mapeo de memoria específico de precisión. También incluye sistemas para la evaluación del rendimiento del modelo para medir el impacto de la cuantización en la precisión en tareas de lenguaje y resumen.
Implements the GPTQ algorithm for high-efficiency post-training weight quantization of large language models.