awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 repository-uri

Awesome GitHub Repositories4-Bit Quantization Tools

Tools that reduce model weight memory by approximately 70% using 4-bit quantization with minimal accuracy loss.

Distinct from Low-Bit Weight Quantization: Distinct from Low-Bit Weight Quantization: focuses specifically on 4-bit precision rather than general low-bit formats like INT4 and FP8.

Explore 6 awesome GitHub repositories matching devops & infrastructure · 4-Bit Quantization Tools. Refine with filters or upvote what's useful.

Awesome 4-Bit Quantization Tools GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • fminference/flexllmgenAvatar FMInference

    FMInference/FlexLLMGen

    9,362Vezi pe GitHub↗

    FlexLLMGen is an inference engine and runtime designed to run large language models on a single GPU by combining weight compression with tensor offloading. It reduces model weight memory usage by approximately 70% through 4-bit quantization, and stores model parameters, attention cache, and hidden states across GPU, CPU, and disk to fit models larger than available GPU memory. The project distinguishes itself through a throughput-oriented batching approach that processes multiple generation requests together in large batches to maximize throughput on a single GPU. It also supports distributed

    Reduces model weight memory by approximately 70% using 4-bit quantization with minimal accuracy loss.

    Pythondeep-learninggpt-3high-throughput
    Vezi pe GitHub↗9,362
  • lightning-ai/lit-llamaAvatar Lightning-AI

    Lightning-AI/lit-llama

    6,081Vezi pe GitHub↗

    Lit-llama este un framework de implementare bazat pe PyTorch pentru modelul de limbaj LLaMA, oferind un sistem pentru pre-antrenare, fine-tuning și inferență de înaltă performanță. Include un pipeline de pre-antrenare pentru crearea de modele de limbaj fundamentale de la zero și instrumente pentru rularea ponderilor preantrenate pentru a genera text natural și a prezice secvențe. Proiectul oferă toolkit-uri specializate pentru fine-tuning eficient din punct de vedere al parametrilor, folosind adaptarea low-rank (LoRA) și adaptoare ușoare. Include, de asemenea, o bibliotecă de cuantizare care reduce amprenta de memorie a modelelor prin precizie pe patru și opt biți pentru a permite execuția pe hardware cu resurse limitate. Framework-ul încorporează un design simplificat de transformer și utilizează flash attention pentru a optimiza memoria și viteza. Mai mult, gestionează seturi de date la scară largă prin formate de date streaming pentru a evita încărcarea întregilor corpora în memoria sistemului.

    Ships a quantization library that reduces memory footprints via GPTQ-based 4-bit and 8-bit precision.

    Python
    Vezi pe GitHub↗6,081
  • baichuan-inc/baichuan-7bAvatar baichuan-inc

    baichuan-inc/Baichuan-7B

    5,654Vezi pe GitHub↗

    Baichuan-7B is an open-source 7 billion parameter bilingual Transformer model designed for text generation and few-shot learning across Chinese and English. It is built on a large Transformer architecture trained on a bilingual corpus, enabling it to produce coherent text in both languages from a single model. The model incorporates several optimization techniques that distinguish it from standard large language models. It uses rotary position embeddings that can extrapolate to longer sequences than seen during training, allowing context extension beyond the original 4096-token training lengt

    Reduces model memory by approximately 70% using 4-bit weight quantization with minimal accuracy loss.

    Pythonartificial-intelligencecevalchatgpt
    Vezi pe GitHub↗5,654
  • panqiwei/autogptqAvatar PanQiWei

    PanQiWei/AutoGPTQ

    5,073Vezi pe GitHub↗

    AutoGPTQ este un framework de compresie a modelelor conceput pentru a reduce amprenta de memorie și a crește viteza de inferență a modelelor de limbaj mari (LLM). Utilizează algoritmul GPTQ pentru a comprima ponderile modelului, permițând acestor modele să ruleze pe hardware cu VRAM limitat. Setul de instrumente oferă un pipeline de cuantizare a arhitecturii care suportă integrarea claselor de modele personalizate pentru diverse arhitecturi de rețele neuronale. Include un motor de inferență cu precizie mixtă cu nuclee optimizate pentru a accelera înmulțirea matricelor în timpul implementării. Framework-ul acoperă întregul flux de lucru de compresie a ponderilor, de la calibrare și cuantizare până la evaluarea acurateței ulterioare. Aceste instrumente măsoară pierderea de performanță prin compararea output-ului modelelor cuantizate cu ponderile originale pe sarcini de benchmark.

    Implements the GPTQ algorithm for post-training weight quantization to reduce model size.

    Python
    Vezi pe GitHub↗5,073
  • autogptq/autogptqAvatar AutoGPTQ

    AutoGPTQ/AutoGPTQ

    5,070Vezi pe GitHub↗

    AutoGPTQ este un set de instrumente de compresie a modelelor și un framework de cuantizare post-antrenare conceput pentru a reduce amprenta de memorie a modelelor de limbaj mari. Utilizează algoritmul GPTQ pentru a comprima ponderile rețelelor neuronale, reducând cerințele hardware și utilizarea VRAM. Proiectul servește drept accelerator de inferență prin furnizarea de nuclee optimizate care cresc viteza de generare a token-urilor. Dispune de extensibilitate a arhitecturii modelului, permițând adăugarea capabilităților de cuantizare la noi structuri de modele prin modele configurabile. Framework-ul acoperă un pipeline cuprinzător de cuantizare, incluzând compresia ponderilor pe niveluri, estimarea scalei bazată pe calibrare și maparea memoriei specifică preciziei. Include, de asemenea, sisteme pentru evaluarea performanței modelului pentru a măsura impactul cuantizării asupra acurateței în sarcini de limbaj și sumarizare.

    Implements the GPTQ algorithm for high-efficiency post-training weight quantization of large language models.

    Python
    Vezi pe GitHub↗5,070
  • nunchaku-ai/nunchakuAvatar nunchaku-ai

    nunchaku-ai/nunchaku

    3,883Vezi pe GitHub↗

    Nunchaku is a 4-bit model quantization library and diffusion model inference engine designed to run large-scale neural networks on consumer GPUs. It functions as a GPU-accelerated optimizer that reduces VRAM usage and increases inference speed through weight compression and memory management. The project utilizes low-rank weight decomposition and SVD weight quantization to compress models to four-bit precision while maintaining visual fidelity. It employs kernel-level operator fusion to minimize data movement and hardware-aware precision mapping to adjust numerical precision based on the unde

    Provides a toolkit for compressing neural network weights into four-bit precision to reduce VRAM usage.

    Pythoncomfyuidiffusion-modelsflux
    Vezi pe GitHub↗3,883
  1. Home
  2. DevOps & Infrastructure
  3. Intel Hardware Acceleration
  4. Low-Bit Weight Quantization
  5. 4-Bit Quantization Tools

Explorează sub-etichetele

  • GPTQ Quantization LibrariesLibraries implementing the GPTQ algorithm for post-training weight quantization. **Distinct from 4-Bit Quantization Tools:** Specifically implements the GPTQ algorithm, whereas the parent is a general tool for 4-bit quantization
  • Quantized Model RuntimesRuntimes specifically optimized to execute models that have undergone low-bit weight quantization. **Distinct from 4-Bit Quantization Tools:** Focuses on the execution/runtime phase of 4-bit models rather than the tools used to perform the quantization.