3 repository-uri
Libraries implementing the GPTQ algorithm for post-training weight quantization.
Distinct from 4-Bit Quantization Tools: Specifically implements the GPTQ algorithm, whereas the parent is a general tool for 4-bit quantization
Explore 3 awesome GitHub repositories matching devops & infrastructure · GPTQ Quantization Libraries. Refine with filters or upvote what's useful.
Lit-llama este un framework de implementare bazat pe PyTorch pentru modelul de limbaj LLaMA, oferind un sistem pentru pre-antrenare, fine-tuning și inferență de înaltă performanță. Include un pipeline de pre-antrenare pentru crearea de modele de limbaj fundamentale de la zero și instrumente pentru rularea ponderilor preantrenate pentru a genera text natural și a prezice secvențe. Proiectul oferă toolkit-uri specializate pentru fine-tuning eficient din punct de vedere al parametrilor, folosind adaptarea low-rank (LoRA) și adaptoare ușoare. Include, de asemenea, o bibliotecă de cuantizare care reduce amprenta de memorie a modelelor prin precizie pe patru și opt biți pentru a permite execuția pe hardware cu resurse limitate. Framework-ul încorporează un design simplificat de transformer și utilizează flash attention pentru a optimiza memoria și viteza. Mai mult, gestionează seturi de date la scară largă prin formate de date streaming pentru a evita încărcarea întregilor corpora în memoria sistemului.
Ships a quantization library that reduces memory footprints via GPTQ-based 4-bit and 8-bit precision.
AutoGPTQ este un framework de compresie a modelelor conceput pentru a reduce amprenta de memorie și a crește viteza de inferență a modelelor de limbaj mari (LLM). Utilizează algoritmul GPTQ pentru a comprima ponderile modelului, permițând acestor modele să ruleze pe hardware cu VRAM limitat. Setul de instrumente oferă un pipeline de cuantizare a arhitecturii care suportă integrarea claselor de modele personalizate pentru diverse arhitecturi de rețele neuronale. Include un motor de inferență cu precizie mixtă cu nuclee optimizate pentru a accelera înmulțirea matricelor în timpul implementării. Framework-ul acoperă întregul flux de lucru de compresie a ponderilor, de la calibrare și cuantizare până la evaluarea acurateței ulterioare. Aceste instrumente măsoară pierderea de performanță prin compararea output-ului modelelor cuantizate cu ponderile originale pe sarcini de benchmark.
Implements the GPTQ algorithm for post-training weight quantization to reduce model size.
AutoGPTQ este un set de instrumente de compresie a modelelor și un framework de cuantizare post-antrenare conceput pentru a reduce amprenta de memorie a modelelor de limbaj mari. Utilizează algoritmul GPTQ pentru a comprima ponderile rețelelor neuronale, reducând cerințele hardware și utilizarea VRAM. Proiectul servește drept accelerator de inferență prin furnizarea de nuclee optimizate care cresc viteza de generare a token-urilor. Dispune de extensibilitate a arhitecturii modelului, permițând adăugarea capabilităților de cuantizare la noi structuri de modele prin modele configurabile. Framework-ul acoperă un pipeline cuprinzător de cuantizare, incluzând compresia ponderilor pe niveluri, estimarea scalei bazată pe calibrare și maparea memoriei specifică preciziei. Include, de asemenea, sisteme pentru evaluarea performanței modelului pentru a măsura impactul cuantizării asupra acurateței în sarcini de limbaj și sumarizare.
Implements the GPTQ algorithm for high-efficiency post-training weight quantization of large language models.