awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 repository-uri

Awesome GitHub RepositoriesGPTQ Quantization Libraries

Libraries implementing the GPTQ algorithm for post-training weight quantization.

Distinct from 4-Bit Quantization Tools: Specifically implements the GPTQ algorithm, whereas the parent is a general tool for 4-bit quantization

Explore 3 awesome GitHub repositories matching devops & infrastructure · GPTQ Quantization Libraries. Refine with filters or upvote what's useful.

Awesome GPTQ Quantization Libraries GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • lightning-ai/lit-llamaAvatar Lightning-AI

    Lightning-AI/lit-llama

    6,081Vezi pe GitHub↗

    Lit-llama este un framework de implementare bazat pe PyTorch pentru modelul de limbaj LLaMA, oferind un sistem pentru pre-antrenare, fine-tuning și inferență de înaltă performanță. Include un pipeline de pre-antrenare pentru crearea de modele de limbaj fundamentale de la zero și instrumente pentru rularea ponderilor preantrenate pentru a genera text natural și a prezice secvențe. Proiectul oferă toolkit-uri specializate pentru fine-tuning eficient din punct de vedere al parametrilor, folosind adaptarea low-rank (LoRA) și adaptoare ușoare. Include, de asemenea, o bibliotecă de cuantizare care reduce amprenta de memorie a modelelor prin precizie pe patru și opt biți pentru a permite execuția pe hardware cu resurse limitate. Framework-ul încorporează un design simplificat de transformer și utilizează flash attention pentru a optimiza memoria și viteza. Mai mult, gestionează seturi de date la scară largă prin formate de date streaming pentru a evita încărcarea întregilor corpora în memoria sistemului.

    Ships a quantization library that reduces memory footprints via GPTQ-based 4-bit and 8-bit precision.

    Python
    Vezi pe GitHub↗6,081
  • panqiwei/autogptqAvatar PanQiWei

    PanQiWei/AutoGPTQ

    5,073Vezi pe GitHub↗

    AutoGPTQ este un framework de compresie a modelelor conceput pentru a reduce amprenta de memorie și a crește viteza de inferență a modelelor de limbaj mari (LLM). Utilizează algoritmul GPTQ pentru a comprima ponderile modelului, permițând acestor modele să ruleze pe hardware cu VRAM limitat. Setul de instrumente oferă un pipeline de cuantizare a arhitecturii care suportă integrarea claselor de modele personalizate pentru diverse arhitecturi de rețele neuronale. Include un motor de inferență cu precizie mixtă cu nuclee optimizate pentru a accelera înmulțirea matricelor în timpul implementării. Framework-ul acoperă întregul flux de lucru de compresie a ponderilor, de la calibrare și cuantizare până la evaluarea acurateței ulterioare. Aceste instrumente măsoară pierderea de performanță prin compararea output-ului modelelor cuantizate cu ponderile originale pe sarcini de benchmark.

    Implements the GPTQ algorithm for post-training weight quantization to reduce model size.

    Python
    Vezi pe GitHub↗5,073
  • autogptq/autogptqAvatar AutoGPTQ

    AutoGPTQ/AutoGPTQ

    5,070Vezi pe GitHub↗

    AutoGPTQ este un set de instrumente de compresie a modelelor și un framework de cuantizare post-antrenare conceput pentru a reduce amprenta de memorie a modelelor de limbaj mari. Utilizează algoritmul GPTQ pentru a comprima ponderile rețelelor neuronale, reducând cerințele hardware și utilizarea VRAM. Proiectul servește drept accelerator de inferență prin furnizarea de nuclee optimizate care cresc viteza de generare a token-urilor. Dispune de extensibilitate a arhitecturii modelului, permițând adăugarea capabilităților de cuantizare la noi structuri de modele prin modele configurabile. Framework-ul acoperă un pipeline cuprinzător de cuantizare, incluzând compresia ponderilor pe niveluri, estimarea scalei bazată pe calibrare și maparea memoriei specifică preciziei. Include, de asemenea, sisteme pentru evaluarea performanței modelului pentru a măsura impactul cuantizării asupra acurateței în sarcini de limbaj și sumarizare.

    Implements the GPTQ algorithm for high-efficiency post-training weight quantization of large language models.

    Python
    Vezi pe GitHub↗5,070
  1. Home
  2. DevOps & Infrastructure
  3. Intel Hardware Acceleration
  4. Low-Bit Weight Quantization
  5. 4-Bit Quantization Tools
  6. GPTQ Quantization Libraries