awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 dépôts

Awesome GitHub RepositoriesWeight Dequantization

Real-time recovery of original precision from quantized weights during model inference.

Distinct from On-the-Fly Decryption: Focuses on ML weight precision recovery during inference, not decryption of data stores.

Explore 2 awesome GitHub repositories matching data & databases · Weight Dequantization. Refine with filters or upvote what's useful.

Awesome Weight Dequantization GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • skyzh/tiny-llmAvatar de skyzh

    skyzh/tiny-llm

    4,304Voir sur GitHub↗

    tiny-llm est un moteur d'inférence de grands modèles de langage et une implémentation de modèle transformer. Il sert de runtime pour modèles quantifiés et de gestionnaire de cache clé-valeur paginé, fournissant une pile d'inférence spécialisée optimisée pour Apple Silicon. Le système se distingue par des techniques d'exécution à haut débit, incluant le batching continu et l'attention paginée. Il utilise un système de mémoire paginée pour éliminer la fragmentation lors de la génération de jetons et emploie une déquantification à la volée des poids compressés pour réduire l'empreinte mémoire lors de la multiplication matricielle. Le projet couvre un large éventail de capacités d'architecture de modèle et de performance, telles que le routage par mélange d'experts (MoE), l'attention par groupes de requêtes (GQA) et l'attention flash. Il inclut la prise en charge d'une logique de décodage avancée, incluant le décodage glouton (greedy) et l'échantillonnage via des méthodes de température, top-k et top-p. L'implémentation est écrite en Python et inclut des noyaux bas niveau personnalisés pour accélérer le traitement des tenseurs sur le matériel.

    Performs on-the-fly recovery of original precision from compressed weights during model inference.

    Pythoncourselarge-language-modelllm
    Voir sur GitHub↗4,304
  • city96/comfyui-ggufAvatar de city96

    city96/ComfyUI-GGUF

    3,291Voir sur GitHub↗

    ComfyUI-GGUF is a memory optimizer and model loader for ComfyUI that enables the execution of large transformer-based generative models using quantized weights. It provides a system for loading GGUF formatted weights within a node-based diffusion interface to reduce GPU memory consumption. The project includes a quantization tool for converting standard model checkpoints into compressed binary formats and a tensor fixer to restore missing keys and correct architectures in binary model files. These utilities ensure that compressed models remain functional during inference on hardware with limi

    Enables high-performance inference by recovering weight precision on-the-fly from compressed memory footprints.

    Python
    Voir sur GitHub↗3,291
  1. Home
  2. Data & Databases
  3. In-Memory Data Stores
  4. Memory-Isolated Decryption
  5. On-the-Fly Decryption
  6. Weight Dequantization