awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 repositorios

Awesome GitHub Repositories4-Bit Quantization Tools

Tools that reduce model weight memory by approximately 70% using 4-bit quantization with minimal accuracy loss.

Distinct from Low-Bit Weight Quantization: Distinct from Low-Bit Weight Quantization: focuses specifically on 4-bit precision rather than general low-bit formats like INT4 and FP8.

Explore 6 awesome GitHub repositories matching devops & infrastructure · 4-Bit Quantization Tools. Refine with filters or upvote what's useful.

Awesome 4-Bit Quantization Tools GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • fminference/flexllmgenAvatar de FMInference

    FMInference/FlexLLMGen

    9,362Ver en GitHub↗

    FlexLLMGen is an inference engine and runtime designed to run large language models on a single GPU by combining weight compression with tensor offloading. It reduces model weight memory usage by approximately 70% through 4-bit quantization, and stores model parameters, attention cache, and hidden states across GPU, CPU, and disk to fit models larger than available GPU memory. The project distinguishes itself through a throughput-oriented batching approach that processes multiple generation requests together in large batches to maximize throughput on a single GPU. It also supports distributed

    Reduces model weight memory by approximately 70% using 4-bit quantization with minimal accuracy loss.

    Pythondeep-learninggpt-3high-throughput
    Ver en GitHub↗9,362
  • lightning-ai/lit-llamaAvatar de Lightning-AI

    Lightning-AI/lit-llama

    6,081Ver en GitHub↗

    Lit-llama es un framework de implementación basado en PyTorch para el modelo de lenguaje LLaMA, que proporciona un sistema para pre-entrenamiento, ajuste fino e inferencia de alto rendimiento. Incluye un pipeline de pre-entrenamiento para crear modelos de lenguaje fundamentales desde cero y herramientas para ejecutar pesos pre-entrenados para generar texto natural y predecir secuencias. El proyecto proporciona toolkits especializados para el ajuste fino eficiente en parámetros utilizando adaptación de bajo rango (LoRA) y adaptadores ligeros. También incluye una librería de cuantización que reduce las huellas de memoria del modelo a través de precisión de cuatro y ocho bits para permitir la ejecución en hardware con recursos limitados. El framework incorpora un diseño de transformador simplificado y emplea flash attention para optimizar la memoria y la velocidad. Además, gestiona datasets a gran escala a través de formatos de datos en streaming para evitar cargar corpora completos en la memoria del sistema.

    Ships a quantization library that reduces memory footprints via GPTQ-based 4-bit and 8-bit precision.

    Python
    Ver en GitHub↗6,081
  • baichuan-inc/baichuan-7bAvatar de baichuan-inc

    baichuan-inc/Baichuan-7B

    5,654Ver en GitHub↗

    Baichuan-7B is an open-source 7 billion parameter bilingual Transformer model designed for text generation and few-shot learning across Chinese and English. It is built on a large Transformer architecture trained on a bilingual corpus, enabling it to produce coherent text in both languages from a single model. The model incorporates several optimization techniques that distinguish it from standard large language models. It uses rotary position embeddings that can extrapolate to longer sequences than seen during training, allowing context extension beyond the original 4096-token training lengt

    Reduces model memory by approximately 70% using 4-bit weight quantization with minimal accuracy loss.

    Pythonartificial-intelligencecevalchatgpt
    Ver en GitHub↗5,654
  • panqiwei/autogptqAvatar de PanQiWei

    PanQiWei/AutoGPTQ

    5,073Ver en GitHub↗

    AutoGPTQ es un framework de compresión de modelos diseñado para reducir la huella de memoria y aumentar la velocidad de inferencia de modelos de lenguaje grandes (LLM). Utiliza el algoritmo GPTQ para comprimir los pesos del modelo, permitiendo que estos modelos se ejecuten en hardware con VRAM limitada. El kit de herramientas proporciona una tubería de cuantización de arquitectura que admite la integración de clases de modelos personalizados para diversas arquitecturas de redes neuronales. Incluye un motor de inferencia de precisión mixta con kernels optimizados para acelerar la multiplicación de matrices durante el despliegue. El framework cubre el flujo de trabajo completo de compresión de pesos, desde la calibración y cuantización hasta la evaluación de precisión posterior. Estas herramientas miden la pérdida de rendimiento comparando la salida de los modelos cuantizados contra los pesos originales en tareas de referencia.

    Implements the GPTQ algorithm for post-training weight quantization to reduce model size.

    Python
    Ver en GitHub↗5,073
  • autogptq/autogptqAvatar de AutoGPTQ

    AutoGPTQ/AutoGPTQ

    5,070Ver en GitHub↗

    AutoGPTQ es un kit de herramientas de compresión de modelos y un framework de cuantización post-entrenamiento diseñado para reducir la huella de memoria de modelos de lenguaje grandes. Utiliza el algoritmo GPTQ para comprimir los pesos de las redes neuronales, reduciendo los requisitos de hardware y el uso de VRAM. El proyecto sirve como un acelerador de inferencia al proporcionar kernels optimizados que aumentan la velocidad de generación de tokens. Cuenta con extensibilidad de arquitectura de modelo, permitiendo que las capacidades de cuantización se añadan a nuevas estructuras de modelos mediante patrones configurables. El framework cubre una tubería de cuantización integral, incluyendo compresión de pesos por capa, estimación de escala basada en calibración y mapeo de memoria específico de precisión. También incluye sistemas para la evaluación del rendimiento del modelo para medir el impacto de la cuantización en la precisión en tareas de lenguaje y resumen.

    Implements the GPTQ algorithm for high-efficiency post-training weight quantization of large language models.

    Python
    Ver en GitHub↗5,070
  • nunchaku-ai/nunchakuAvatar de nunchaku-ai

    nunchaku-ai/nunchaku

    3,883Ver en GitHub↗

    Nunchaku is a 4-bit model quantization library and diffusion model inference engine designed to run large-scale neural networks on consumer GPUs. It functions as a GPU-accelerated optimizer that reduces VRAM usage and increases inference speed through weight compression and memory management. The project utilizes low-rank weight decomposition and SVD weight quantization to compress models to four-bit precision while maintaining visual fidelity. It employs kernel-level operator fusion to minimize data movement and hardware-aware precision mapping to adjust numerical precision based on the unde

    Provides a toolkit for compressing neural network weights into four-bit precision to reduce VRAM usage.

    Pythoncomfyuidiffusion-modelsflux
    Ver en GitHub↗3,883
  1. Home
  2. DevOps & Infrastructure
  3. Intel Hardware Acceleration
  4. Low-Bit Weight Quantization
  5. 4-Bit Quantization Tools

Explorar subetiquetas

  • GPTQ Quantization LibrariesLibraries implementing the GPTQ algorithm for post-training weight quantization. **Distinct from 4-Bit Quantization Tools:** Specifically implements the GPTQ algorithm, whereas the parent is a general tool for 4-bit quantization
  • Quantized Model RuntimesRuntimes specifically optimized to execute models that have undergone low-bit weight quantization. **Distinct from 4-Bit Quantization Tools:** Focuses on the execution/runtime phase of 4-bit models rather than the tools used to perform the quantization.