awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

20 repository-uri

Awesome GitHub RepositoriesMixed-Precision Quantization

Converting model weights to lower numerical precision to reduce memory footprint.

Distinct from Half-Precision Compression: Extends beyond half-precision to cover various numerical format conversions for weight compression.

Explore 20 awesome GitHub repositories matching artificial intelligence & ml · Mixed-Precision Quantization. Refine with filters or upvote what's useful.

Awesome Mixed-Precision Quantization GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • mlfoundations/open_clipAvatar mlfoundations

    mlfoundations/open_clip

    13,935Vezi pe GitHub↗

    Open CLIP is an open source framework for training and deploying Contrastive Language-Image Pre-training models. It serves as a vision-language training framework and multimodal embedding engine that maps images and text into a shared vector space for similarity searches and zero-shot classification. The project provides a toolkit for distributed training of contrastive models and includes an image-to-text generative model for producing natural language descriptions. It supports custom text encoder integration and utilizes teacher-student model distillation to transfer knowledge from large pr

    Utilizes mixed-precision weight quantization and 8-bit linear layers to reduce memory usage during training.

    Pythoncomputer-visioncontrastive-lossdeep-learning
    Vezi pe GitHub↗13,935
  • paddlepaddle/paddlenlpAvatar PaddlePaddle

    PaddlePaddle/PaddleNLP

    12,953Vezi pe GitHub↗

    PaddleNLP is a development library and toolkit for training, fine-tuning, and deploying large and small language models using the PaddlePaddle framework. It provides a comprehensive suite for the entire natural language processing lifecycle, from model development to high-performance inference. The project features a standardized model zoo for loading and managing pre-trained models and tokenizers through a unified interface. It distinguishes itself with a specialized model compression framework that reduces memory footprints via weight precision conversion and lossless size optimization, alo

    Compresses model memory footprints by converting high-precision weights into smaller numerical formats.

    Python
    Vezi pe GitHub↗12,953
  • intel/ipex-llmAvatar intel

    intel/ipex-llm

    8,836Vezi pe GitHub↗

    Intel XPU LLM Acceleration Library is a toolkit designed to accelerate large language model inference and finetuning on Intel CPUs, GPUs, and NPUs. It provides a distributed inference engine for scaling models across multiple accelerators, a multimodal model runtime for vision and speech tasks, and a low-bit model quantization tool for converting weights into INT4, FP8, and GGUF formats. The project features a parameter-efficient finetuning framework that enables model adaptation using QLoRA and DPO on Intel hardware. It distinguishes itself by providing specialized optimizations for Intel XP

    Transforms linear layers into low-bit integers during the model loading phase to accelerate execution.

    Python
    Vezi pe GitHub↗8,836
  • tingsongyu/pytorch_tutorialAvatar TingsongYu

    TingsongYu/PyTorch_Tutorial

    8,018Vezi pe GitHub↗

    This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene

    Reduces model size and improves throughput by converting float32 weights to lower-precision formats.

    Python
    Vezi pe GitHub↗8,018
  • hvision-nku/storydiffusionAvatar HVision-NKU

    HVision-NKU/StoryDiffusion

    6,430Vezi pe GitHub↗

    StoryDiffusion is a generative AI system designed for consistent character image and video generation. It utilizes a pluggable cross-attention module to inject shared character representations into pretrained diffusion models, allowing for visual identity stability across multiple images and scenes without retraining the base model. The project features a video generation pipeline that produces temporally coherent sequences from text prompts or condition images. It employs a latent space motion interpolator to predict intermediate frames and semantic motion, enabling long-range video generati

    Reduces GPU memory footprint by converting model weights to lower numerical precision.

    Jupyter Notebook
    Vezi pe GitHub↗6,430
  • kingoflolz/mesh-transformer-jaxAvatar kingoflolz

    kingoflolz/mesh-transformer-jax

    6,376Vezi pe GitHub↗

    Acest proiect este un framework de transformatoare bazat pe JAX și un antrenor de modele de limbaj mari, conceput pentru construirea și antrenarea modelelor distribuite pe acceleratoare hardware TPU. Oferă un sistem pentru pre-antrenare și fine-tuning-ul modelelor autoregresive prin împărțirea ponderilor și a calculelor pe o rețea de dispozitive pentru a reduce overhead-ul de memorie și a crește viteza de procesare. Framework-ul include un orchestrator de calcul TPU pentru provizionarea resurselor și automatizarea instalării dependențelor pe noduri distribuite la distanță. De asemenea, dispune de un convertor de ponderi de model capabil să transforme și să redistribuie checkpoint-urile între diferite configurații hardware și precizii numerice. Proiectul acoperă capabilități mai largi, inclusiv gestionarea checkpoint-urilor partajate pentru stocarea în cloud, încărcarea datelor bazată pe flux cu restaurarea stării și generarea de text bazată pe nucleu pentru inferența modelului. De asemenea, suportă accelerarea hardware compilată XLA pentru clustere TPU și GPU și oferă instrumente pentru benchmarking-ul performanței față de sarcini lingvistice standardizate.

    Transforms the numerical precision of model parameters to optimize memory footprint and execution speed on specific hardware.

    Python
    Vezi pe GitHub↗6,376
  • pytorch/torchtuneAvatar pytorch

    pytorch/torchtune

    5,774Vezi pe GitHub↗

    Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a configurable training pipeline orchestrated through YAML recipes, with CLI overrides and component swapping, distributed training via FSDP2, memory optimizations, and parameter-efficient fine-tuning methods like LoRA, DoRA, and QLoRA. The library distinguishes itself through its YAML-driven configuration system that defines all training parameters and instantiates components from config files, with full CLI override capability for any field or component at launch time. It suppo

    Trains models in bfloat16 half-precision to halve memory usage per parameter and speed up computation.

    Python
    Vezi pe GitHub↗5,774
  • deci-ai/super-gradientsAvatar Deci-AI

    Deci-AI/super-gradients

    5,041Vezi pe GitHub↗

    Super-Gradients este un framework de computer vision PyTorch și o bibliotecă de antrenare concepută pentru întregul ciclu de viață al modelelor de viziune. Funcționează ca un optimizator de modele deep learning și un toolkit de implementare pentru antrenarea și fine-tuning-ul modelelor în sarcini de clasificare a imaginilor, detectare a obiectelor, segmentare semantică și estimare a posturii. Proiectul oferă instrumente specifice pentru optimizarea modelelor, inclusiv distilarea cunoștințelor teacher-student și compresia preciziei numerice pentru a reduce cerințele de memorie și calcul. Include, de asemenea, implementarea arhitecturii Yolo-NAS pentru detectarea obiectelor de înaltă performanță. Framework-ul acoperă o suprafață largă de capabilități, inclusiv antrenarea distribuită pe GPU, pipeline-uri de viziune modulare și automatizarea rulărilor de antrenare prin configurații de rețetă structurate. Mai mult, gestionează încărcarea datelor, augmentarea imaginilor și exportul ponderilor antrenate în formate universale pentru acceleratoare hardware de producție.

    Reduces memory and computational requirements by implementing numerical precision compression for deployment on resource-constrained hardware.

    Jupyter Notebook
    Vezi pe GitHub↗5,041
  • tencent/tnnAvatar Tencent

    Tencent/TNN

    4,641Vezi pe GitHub↗

    TNN este un framework de inferență deep learning conceput pentru a executa rețele neuronale pre-antrenate pe hardware mobil, desktop și server. Acesta funcționează ca un runtime accelerat hardware și un toolkit de compresie a modelelor, oferind o interfață unificată pentru implementarea modelelor în medii diverse. Framework-ul include un convertor de modele ONNX pentru a transforma modelele din diverse framework-uri de antrenament într-un format intern standardizat. Se distinge printr-o combinație de instrumente de compresie a modelelor—inclusiv cuantizarea ponderilor și pruning-ul codului static—și un sistem de gestionare a memoriei care reutilizează bufferele între nodurile independente pentru a reduce utilizarea RAM. Sistemul optimizează performanța prin fuziunea operatorilor pentru a minimiza accesul la memorie și utilizează backend-uri specifice platformei pentru a profita de procesoare specializate și GPU-uri. De asemenea, crește viteza de execuție prin calcule de precizie scăzută și ajustări specifice hardware-ului.

    Increases execution speed and reduces memory consumption using low-precision calculations.

    C++
    Vezi pe GitHub↗4,641
  • tingsongyu/pytorch-tutorial-2ndAvatar TingsongYu

    TingsongYu/PyTorch-Tutorial-2nd

    4,555Vezi pe GitHub↗

    Acest proiect este o resursă educațională cuprinzătoare și un curs pentru construirea de rețele neuronale folosind PyTorch. Acoperă elementele fundamentale ale deep learning-ului, inclusiv manipularea tensorilor, diferențierea automată și construcția componentelor modulare de rețele neuronale. Repository-ul servește drept ghid tehnic pentru mai multe domenii specializate. Oferă detalii de implementare pentru sarcini de computer vision, cum ar fi clasificarea imaginilor, detecția obiectelor și segmentarea semantică, precum și fluxuri de lucru de procesare a limbajului natural (NLP) care implică transformatoare, rețele recurente și modele generative. În plus, include o referință pentru AI generativ, concentrându-se în mod specific pe sinteza de imagini prin modele de difuzie și rețele adversariale. Materialul se extinde către optimizarea modelelor și pipeline-uri de deployment. Acoperă tehnici pentru reducerea dimensiunii modelelor și creșterea vitezei de inferență prin cuantizare și exportul modelelor în formate precum ONNX și TensorRT. Alte domenii de capabilitate includ ingineria datelor pentru încărcarea paralelă, evaluarea modelelor folosind metrici personalizate și deployment-ul modelelor de limbaj mari (LLM) open-source. Proiectul este livrat în principal sub formă de serie de Jupyter Notebooks.

    Converts model weights to lower numerical precision to reduce memory footprint.

    Jupyter Notebookcomputer-visiondeepsortdiffusion-models
    Vezi pe GitHub↗4,555
  • turboderp/exllamav2Avatar turboderp

    turboderp/exllamav2

    4,553Vezi pe GitHub↗

    exllamav2 este o bibliotecă de inferență de înaltă performanță concepută pentru a rula modele de limbaj mari local pe GPU-uri de consum. Oferă un runner accelerat prin GPU și instrumente de cuantizare pentru a permite execuția modelelor fără a depinde de servicii de calcul bazate pe cloud. Proiectul dispune de un utilitar de cuantizare care comprimă modelele în bitrate-uri mixte între doi și opt biți pentru a reduce cerințele de memorie video (VRAM). Se distinge printr-un generator de text batch care gestionează cererile grupate și deduplică datele din cache pentru a crește throughput-ul. Biblioteca acoperă o suprafață largă de capabilități, inclusiv streaming asincron de token-uri pentru output în timp real, execuție de kernel-uri GPU personalizate pentru operații de algebră liniară și maparea memoriei locale pentru acces cu latență scăzută la ponderile modelului.

    Compresses model weights into varying bit-widths between two and eight bits to reduce memory footprint.

    Python
    Vezi pe GitHub↗4,553
  • turboderp-org/exllamav2Avatar turboderp-org

    turboderp-org/exllamav2

    4,552Vezi pe GitHub↗

    exllamav2 este un motor de inferență și framework de înaltă performanță pentru executarea modelelor de limbaj mari local pe GPU-uri de clasă consumer. Oferă un sistem complet pentru deployment-ul local al modelelor, incluzând un motor de inferență specializat și instrumente pentru cuantizarea modelelor. Proiectul dispune de un framework de inferență multi-GPU care distribuie sarcinile de lucru pe mai multe plăci grafice pentru a rula modele care depășesc capacitatea de memorie a unui singur dispozitiv. Include un cuantizator de modele GPU capabil să convertească modelele în formate de precizie mixtă între 2 și 8 biți pentru a echilibra utilizarea memoriei și acuratețea. Motorul suportă generarea de text cu throughput ridicat prin inferență paralelă bazată pe batch-uri și streaming asincron de output. Aceste capabilități sunt susținute de kernel-uri CUDA personalizate și deduplicarea cache-ului pentru a optimiza utilizarea hardware-ului și a reduce latența în timpul generării de token-uri.

    Balances model size and accuracy using mixed-precision quantization between two and eight bits.

    Python
    Vezi pe GitHub↗4,552
  • thudm/visualglm-6bAvatar THUDM

    THUDM/VisualGLM-6B

    4,157Vezi pe GitHub↗

    VisualGLM-6B este un model de limbaj multimodal bilingv și model viziune-limbaj conceput pentru sarcini conversaționale și înțelegere vizuală. Funcționează ca un model AI bilingv capabil să proceseze și să genereze răspunsuri atât în chineză, cât și în engleză. Sistemul este un model de limbaj mare cuantizat care suportă precizie pe 4 și 8 biți pentru a reduce utilizarea memoriei și cerințele hardware în timpul implementării locale. Este, de asemenea, un model de fine-tuning eficient din punct de vedere al parametrilor, permițând ajustări ale ponderilor pentru a adapta sistemul la sarcini specifice fără a fi nevoie de o reantrenare completă. Proiectul acoperă AI conversațional multimodal și dialog bazat pe imagini, permițând analiza conținutului vizual pentru a efectua sarcini de înțelegere vizuală în mai multe limbi. Capabilitățile sale includ cuantizarea preciziei modelului și fine-tuning specific domeniului pentru aplicații specializate.

    Converts model weights to 4-bit or 8-bit precision to lower memory requirements.

    Python
    Vezi pe GitHub↗4,157
  • facico/chinese-vicunaAvatar Facico

    Facico/Chinese-Vicuna

    4,121Vezi pe GitHub↗

    Chinese-Vicuna este un model de limbaj mare (LLM) chinezesc și o AI care urmează instrucțiuni, bazată pe arhitectura LLaMA. Este concepută special pentru înțelegerea și generarea limbajului natural în limba chineză, utilizând un model ajustat prin instrucțiuni pentru a urma prompt-urile complexe ale utilizatorilor în timpul conversațiilor. Proiectul oferă un framework de fine-tuning LoRA și sisteme de cuantizare pentru a permite adaptarea modelului și inferența pe hardware de consum. Implementează inferența cuantizată pentru a reduce utilizarea memoriei atât pe CPU, cât și pe GPU, susținută de o implementare C++ de nivel scăzut pentru a minimiza cerințele de resurse ale sistemului. Sistemul acoperă o gamă largă de capabilități de procesare a limbajului natural, inclusiv gestionarea conversațiilor multi-turn, traducerea multilingvă și generarea de cod de programare. Include, de asemenea, instrumente pentru antrenarea specifică domeniului, conversia formatului modelului și o interfață de chat interactivă cu output de text în streaming.

    Reduces model precision to enable efficient inference on hardware with limited graphics memory.

    Calpacachinesellama
    Vezi pe GitHub↗4,121
  • uxlfoundation/onednnAvatar uxlfoundation

    uxlfoundation/oneDNN

    4,009Vezi pe GitHub↗

    oneDNN este o bibliotecă pentru accelerarea deep learning-ului care oferă blocuri de construcție optimizate pentru antrenarea și inferența rețelelor neuronale. Aceasta gestionează calculul tensorial pe hardware CPU și GPU, permițând execuția de primitive de înaltă performanță pentru antrenarea modelelor și optimizarea inferenței rețelelor neuronale. Proiectul se distinge prin optimizarea kernel-ului specifică hardware-ului și utilizarea compilării „just-in-time” pentru a viza seturi de instrucțiuni specifice ale procesorului. Suportă execuția rețelelor neuronale cuantizate folosind cuantizarea statică și dinamică pentru a reduce utilizarea memoriei și a crește throughput-ul. Biblioteca acoperă o gamă largă de capabilități, inclusiv primitive de deep learning precum convoluții, înmulțirea matricelor și execuția rețelelor neuronale recurente. Implementează optimizări avansate de performanță, inclusiv fuziunea operațiunilor, optimizarea grafului de calcul și gestionarea formatului memoriei. Integrarea este oferită printr-un ABI C stabil și un wrapper C++, cu suport pentru SYCL, OpenCL și biblioteci externe de algebră liniară. Sistemul include instrumente de observabilitate pentru profilarea performanței hardware, benchmarking-ul primitivelor și log-uri detaliate de execuție.

    Executes deep learning operations using reduced-precision numerical types to increase throughput and reduce memory usage.

    C++aarch64amxavx512
    Vezi pe GitHub↗4,009
  • nvlabs/vilaAvatar NVlabs

    NVlabs/VILA

    3,819Vezi pe GitHub↗

    VILA is a vision-language model integration that combines a visual encoder with a large language model to process images and text in a shared space. Its primary purpose is to enable the generation of natural language explanations and detailed text summaries of images and videos based on user prompts. The project utilizes a multi-stage alignment pipeline to synchronize visual and textual embeddings through sequential pretraining and supervised fine-tuning. To support deployment on desktop and edge hardware, it employs quantized low-precision inference to reduce model weights to 4-bit precision

    Employs low-precision inference by reducing model weights to 4-bit precision for faster execution on edge hardware.

    Python
    Vezi pe GitHub↗3,819
  • zyds/transformers-codeAvatar zyds

    zyds/transformers-code

    3,782Vezi pe GitHub↗

    This project is a collection of scripts and workflows for training, fine-tuning, and deploying large language models using the Hugging Face Transformers toolkit. It functions as a distributed training framework, a library for natural language processing task implementations, and a system for building retrieval-augmented generation chatbots. The repository includes specialized tools for model optimization, such as a Bayesian hyperparameter optimizer for automatically tuning model settings. It provides implementations for scaling model training across multiple graphics processors using data par

    Employs mixed-precision quantization to reduce memory usage and accelerate training speed.

    Jupyter Notebookhuggingfacepefttransformers
    Vezi pe GitHub↗3,782
  • hiyouga/chatglm-efficient-tuningAvatar hiyouga

    hiyouga/ChatGLM-Efficient-Tuning

    3,720Vezi pe GitHub↗

    ChatGLM-Efficient-Tuning is a fine-tuning framework and toolkit designed to optimize large language models using parameter-efficient fine-tuning techniques. It provides a pipeline for adjusting model behavior and reducing the memory and compute requirements necessary for training. The project features a web-based trainer and orchestration interface for configuring and executing the fine-tuning process on a single GPU. It supports quantized training in lower precision formats to enable fine-tuning on hardware with limited memory, as well as reinforcement learning from human feedback for model

    Supports reducing the bit-width of model weights to enable training on hardware with limited memory.

    Pythonalpacachatglmchatglm2
    Vezi pe GitHub↗3,720
  • intel/neural-compressorAvatar intel

    intel/neural-compressor

    2,585Vezi pe GitHub↗

    Neural Compressor is a deep learning model compression toolkit and AI inference acceleration engine. It functions as an automated model quantization tool and hardware-aware model compiler designed to reduce the memory footprint of neural networks and decrease execution latency. The project provides specialized frameworks for optimizing large language models, utilizing weight-only quantization and hardware-specific kernels to improve the operational efficiency of generative AI workloads. It maps neural network operators to specialized CPU and GPU vector instructions to accelerate model executi

    Assigns different bit-depths to individual layers to maintain accuracy while minimizing the total memory footprint.

    Pythonauto-tuningawqfp4
    Vezi pe GitHub↗2,585
  • xlang-ai/instructor-embeddingAvatar xlang-ai

    xlang-ai/instructor-embedding

    2,024Vezi pe GitHub↗

    Instructor-embedding este un framework de procesare a limbajului natural (NLP) conceput pentru a transforma textul nestructurat în vectori numerici de înaltă dimensiune. Prin utilizarea unei arhitecturi de encoder bazată pe transformatoare, sistemul facilitează recuperarea semantică, clasificarea datelor și analiza de similaritate în seturi mari de date. Framework-ul se distinge prin proiecția vectorială condiționată de instrucțiuni, care încorporează instrucțiunile în limbaj natural direct în procesul de embedding pentru a îmbunătăți performanța pentru sarcini specifice fără a necesita antrenament suplimentar. Funcționează ca o bibliotecă de învățare contrastivă, permițând utilizatorilor să fine-tuneze modele de limbaj pre-antrenate pe seturi de date personalizate pentru a crea embedding-uri specializate pentru domenii de nișă. Proiectul oferă o suită cuprinzătoare de instrumente pentru gestionarea reprezentărilor vectoriale, inclusiv capabilități pentru benchmarking-ul acurateței modelului față de metrici standardizate și indexarea embedding-urilor pentru căutarea rapidă de similaritate. Pentru a susține deployment-ul în medii cu resurse limitate, framework-ul include funcționalități de optimizare, cum ar fi cuantizarea modelului cu precizie mixtă, pentru a reduce utilizarea memoriei și a accelera viteza de inferență.

    Reduces the bit-width of neural network parameters to decrease memory usage and accelerate inference speed on standard hardware.

    Pythonembeddingsinformation-retrievallanguage-model
    Vezi pe GitHub↗2,024
  1. Home
  2. Artificial Intelligence & ML
  3. Model Optimization
  4. Compression Techniques
  5. Model Pruning
  6. Model Compression Suites
  7. Half-Precision Compression
  8. Mixed-Precision Quantization

Explorează sub-etichetele

  • Low Precision ConversionThe process of transforming model weights and layers into low-bit formats for optimized execution. **Distinct from Low Precision Inference:** Focuses on the offline conversion of the model to low precision, whereas low precision inference focuses on the runtime execution.
  • Low Precision InferenceExecuting models using reduced-precision data formats to increase throughput and reduce memory usage. **Distinct from Mixed-Precision Quantization:** Focuses on the runtime execution using low precision, whereas mixed-precision quantization focuses on the weight conversion process.
  • Mixed-Precision QuantizersTools that convert model weights into mixed-precision formats to reduce memory footprint. **Distinct from Mixed-Precision Quantization:** Focuses on the tool/utility for converting models, whereas the parent is the general technique.
  • Runtime Precision ConversionConversion of linear layers into low-bit integers during the model loading phase. **Distinct from Mixed-Precision Quantization:** Focuses specifically on the timing and mechanism of conversion during runtime loading rather than general quantization strategies.
  • Weight Synchronization QuantizationProcesses that apply quantization to high-precision training weights during their transfer to inference checkpoints. **Distinct from Mixed-Precision Quantization:** Focuses on the synchronization act of quantizing weights during updates, rather than static model compression.