awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

1 repository

Awesome GitHub RepositoriesMixed-Precision Quantizers

Tools that convert model weights into mixed-precision formats to reduce memory footprint.

Distinct from Mixed-Precision Quantization: Focuses on the tool/utility for converting models, whereas the parent is the general technique.

Explore 1 awesome GitHub repository matching artificial intelligence & ml · Mixed-Precision Quantizers. Refine with filters or upvote what's useful.

Awesome Mixed-Precision Quantizers GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • turboderp-org/exllamav2Avatar turboderp-org

    turboderp-org/exllamav2

    4,552Vezi pe GitHub↗

    exllamav2 este un motor de inferență și framework de înaltă performanță pentru executarea modelelor de limbaj mari local pe GPU-uri de clasă consumer. Oferă un sistem complet pentru deployment-ul local al modelelor, incluzând un motor de inferență specializat și instrumente pentru cuantizarea modelelor. Proiectul dispune de un framework de inferență multi-GPU care distribuie sarcinile de lucru pe mai multe plăci grafice pentru a rula modele care depășesc capacitatea de memorie a unui singur dispozitiv. Include un cuantizator de modele GPU capabil să convertească modelele în formate de precizie mixtă între 2 și 8 biți pentru a echilibra utilizarea memoriei și acuratețea. Motorul suportă generarea de text cu throughput ridicat prin inferență paralelă bazată pe batch-uri și streaming asincron de output. Aceste capabilități sunt susținute de kernel-uri CUDA personalizate și deduplicarea cache-ului pentru a optimiza utilizarea hardware-ului și a reduce latența în timpul generării de token-uri.

    Provides a GPU model quantizer for converting models into flexible mixed-precision formats between 2 and 8 bits.

    Python
    Vezi pe GitHub↗4,552
  1. Home
  2. Artificial Intelligence & ML
  3. Model Optimization
  4. Compression Techniques
  5. Model Pruning
  6. Model Compression Suites
  7. Half-Precision Compression
  8. Mixed-Precision Quantization
  9. Mixed-Precision Quantizers