20 repository-uri
Converting model weights to lower numerical precision to reduce memory footprint.
Distinct from Half-Precision Compression: Extends beyond half-precision to cover various numerical format conversions for weight compression.
Explore 20 awesome GitHub repositories matching artificial intelligence & ml · Mixed-Precision Quantization. Refine with filters or upvote what's useful.
Open CLIP is an open source framework for training and deploying Contrastive Language-Image Pre-training models. It serves as a vision-language training framework and multimodal embedding engine that maps images and text into a shared vector space for similarity searches and zero-shot classification. The project provides a toolkit for distributed training of contrastive models and includes an image-to-text generative model for producing natural language descriptions. It supports custom text encoder integration and utilizes teacher-student model distillation to transfer knowledge from large pr
Utilizes mixed-precision weight quantization and 8-bit linear layers to reduce memory usage during training.
PaddleNLP is a development library and toolkit for training, fine-tuning, and deploying large and small language models using the PaddlePaddle framework. It provides a comprehensive suite for the entire natural language processing lifecycle, from model development to high-performance inference. The project features a standardized model zoo for loading and managing pre-trained models and tokenizers through a unified interface. It distinguishes itself with a specialized model compression framework that reduces memory footprints via weight precision conversion and lossless size optimization, alo
Compresses model memory footprints by converting high-precision weights into smaller numerical formats.
Intel XPU LLM Acceleration Library is a toolkit designed to accelerate large language model inference and finetuning on Intel CPUs, GPUs, and NPUs. It provides a distributed inference engine for scaling models across multiple accelerators, a multimodal model runtime for vision and speech tasks, and a low-bit model quantization tool for converting weights into INT4, FP8, and GGUF formats. The project features a parameter-efficient finetuning framework that enables model adaptation using QLoRA and DPO on Intel hardware. It distinguishes itself by providing specialized optimizations for Intel XP
Transforms linear layers into low-bit integers during the model loading phase to accelerate execution.
This project is a comprehensive collection of educational examples and reference implementations for building vision and language models using PyTorch. It serves as a deep learning tutorial covering the end-to-end process of developing neural networks, from initial architecture definition to final production deployment. The repository provides detailed guides on implementing a wide range of domain-specific models, including convolutional neural networks for object detection and segmentation, as well as transformer and recurrent architectures for natural language processing. It emphasizes gene
Reduces model size and improves throughput by converting float32 weights to lower-precision formats.
StoryDiffusion is a generative AI system designed for consistent character image and video generation. It utilizes a pluggable cross-attention module to inject shared character representations into pretrained diffusion models, allowing for visual identity stability across multiple images and scenes without retraining the base model. The project features a video generation pipeline that produces temporally coherent sequences from text prompts or condition images. It employs a latent space motion interpolator to predict intermediate frames and semantic motion, enabling long-range video generati
Reduces GPU memory footprint by converting model weights to lower numerical precision.
Acest proiect este un framework de transformatoare bazat pe JAX și un antrenor de modele de limbaj mari, conceput pentru construirea și antrenarea modelelor distribuite pe acceleratoare hardware TPU. Oferă un sistem pentru pre-antrenare și fine-tuning-ul modelelor autoregresive prin împărțirea ponderilor și a calculelor pe o rețea de dispozitive pentru a reduce overhead-ul de memorie și a crește viteza de procesare. Framework-ul include un orchestrator de calcul TPU pentru provizionarea resurselor și automatizarea instalării dependențelor pe noduri distribuite la distanță. De asemenea, dispune de un convertor de ponderi de model capabil să transforme și să redistribuie checkpoint-urile între diferite configurații hardware și precizii numerice. Proiectul acoperă capabilități mai largi, inclusiv gestionarea checkpoint-urilor partajate pentru stocarea în cloud, încărcarea datelor bazată pe flux cu restaurarea stării și generarea de text bazată pe nucleu pentru inferența modelului. De asemenea, suportă accelerarea hardware compilată XLA pentru clustere TPU și GPU și oferă instrumente pentru benchmarking-ul performanței față de sarcini lingvistice standardizate.
Transforms the numerical precision of model parameters to optimize memory footprint and execution speed on specific hardware.
Torchtune is a PyTorch-native library for fine-tuning, aligning, and quantizing large language models. It provides a configurable training pipeline orchestrated through YAML recipes, with CLI overrides and component swapping, distributed training via FSDP2, memory optimizations, and parameter-efficient fine-tuning methods like LoRA, DoRA, and QLoRA. The library distinguishes itself through its YAML-driven configuration system that defines all training parameters and instantiates components from config files, with full CLI override capability for any field or component at launch time. It suppo
Trains models in bfloat16 half-precision to halve memory usage per parameter and speed up computation.
Super-Gradients este un framework de computer vision PyTorch și o bibliotecă de antrenare concepută pentru întregul ciclu de viață al modelelor de viziune. Funcționează ca un optimizator de modele deep learning și un toolkit de implementare pentru antrenarea și fine-tuning-ul modelelor în sarcini de clasificare a imaginilor, detectare a obiectelor, segmentare semantică și estimare a posturii. Proiectul oferă instrumente specifice pentru optimizarea modelelor, inclusiv distilarea cunoștințelor teacher-student și compresia preciziei numerice pentru a reduce cerințele de memorie și calcul. Include, de asemenea, implementarea arhitecturii Yolo-NAS pentru detectarea obiectelor de înaltă performanță. Framework-ul acoperă o suprafață largă de capabilități, inclusiv antrenarea distribuită pe GPU, pipeline-uri de viziune modulare și automatizarea rulărilor de antrenare prin configurații de rețetă structurate. Mai mult, gestionează încărcarea datelor, augmentarea imaginilor și exportul ponderilor antrenate în formate universale pentru acceleratoare hardware de producție.
Reduces memory and computational requirements by implementing numerical precision compression for deployment on resource-constrained hardware.
TNN este un framework de inferență deep learning conceput pentru a executa rețele neuronale pre-antrenate pe hardware mobil, desktop și server. Acesta funcționează ca un runtime accelerat hardware și un toolkit de compresie a modelelor, oferind o interfață unificată pentru implementarea modelelor în medii diverse. Framework-ul include un convertor de modele ONNX pentru a transforma modelele din diverse framework-uri de antrenament într-un format intern standardizat. Se distinge printr-o combinație de instrumente de compresie a modelelor—inclusiv cuantizarea ponderilor și pruning-ul codului static—și un sistem de gestionare a memoriei care reutilizează bufferele între nodurile independente pentru a reduce utilizarea RAM. Sistemul optimizează performanța prin fuziunea operatorilor pentru a minimiza accesul la memorie și utilizează backend-uri specifice platformei pentru a profita de procesoare specializate și GPU-uri. De asemenea, crește viteza de execuție prin calcule de precizie scăzută și ajustări specifice hardware-ului.
Increases execution speed and reduces memory consumption using low-precision calculations.
Acest proiect este o resursă educațională cuprinzătoare și un curs pentru construirea de rețele neuronale folosind PyTorch. Acoperă elementele fundamentale ale deep learning-ului, inclusiv manipularea tensorilor, diferențierea automată și construcția componentelor modulare de rețele neuronale. Repository-ul servește drept ghid tehnic pentru mai multe domenii specializate. Oferă detalii de implementare pentru sarcini de computer vision, cum ar fi clasificarea imaginilor, detecția obiectelor și segmentarea semantică, precum și fluxuri de lucru de procesare a limbajului natural (NLP) care implică transformatoare, rețele recurente și modele generative. În plus, include o referință pentru AI generativ, concentrându-se în mod specific pe sinteza de imagini prin modele de difuzie și rețele adversariale. Materialul se extinde către optimizarea modelelor și pipeline-uri de deployment. Acoperă tehnici pentru reducerea dimensiunii modelelor și creșterea vitezei de inferență prin cuantizare și exportul modelelor în formate precum ONNX și TensorRT. Alte domenii de capabilitate includ ingineria datelor pentru încărcarea paralelă, evaluarea modelelor folosind metrici personalizate și deployment-ul modelelor de limbaj mari (LLM) open-source. Proiectul este livrat în principal sub formă de serie de Jupyter Notebooks.
Converts model weights to lower numerical precision to reduce memory footprint.
exllamav2 este o bibliotecă de inferență de înaltă performanță concepută pentru a rula modele de limbaj mari local pe GPU-uri de consum. Oferă un runner accelerat prin GPU și instrumente de cuantizare pentru a permite execuția modelelor fără a depinde de servicii de calcul bazate pe cloud. Proiectul dispune de un utilitar de cuantizare care comprimă modelele în bitrate-uri mixte între doi și opt biți pentru a reduce cerințele de memorie video (VRAM). Se distinge printr-un generator de text batch care gestionează cererile grupate și deduplică datele din cache pentru a crește throughput-ul. Biblioteca acoperă o suprafață largă de capabilități, inclusiv streaming asincron de token-uri pentru output în timp real, execuție de kernel-uri GPU personalizate pentru operații de algebră liniară și maparea memoriei locale pentru acces cu latență scăzută la ponderile modelului.
Compresses model weights into varying bit-widths between two and eight bits to reduce memory footprint.
exllamav2 este un motor de inferență și framework de înaltă performanță pentru executarea modelelor de limbaj mari local pe GPU-uri de clasă consumer. Oferă un sistem complet pentru deployment-ul local al modelelor, incluzând un motor de inferență specializat și instrumente pentru cuantizarea modelelor. Proiectul dispune de un framework de inferență multi-GPU care distribuie sarcinile de lucru pe mai multe plăci grafice pentru a rula modele care depășesc capacitatea de memorie a unui singur dispozitiv. Include un cuantizator de modele GPU capabil să convertească modelele în formate de precizie mixtă între 2 și 8 biți pentru a echilibra utilizarea memoriei și acuratețea. Motorul suportă generarea de text cu throughput ridicat prin inferență paralelă bazată pe batch-uri și streaming asincron de output. Aceste capabilități sunt susținute de kernel-uri CUDA personalizate și deduplicarea cache-ului pentru a optimiza utilizarea hardware-ului și a reduce latența în timpul generării de token-uri.
Balances model size and accuracy using mixed-precision quantization between two and eight bits.
VisualGLM-6B este un model de limbaj multimodal bilingv și model viziune-limbaj conceput pentru sarcini conversaționale și înțelegere vizuală. Funcționează ca un model AI bilingv capabil să proceseze și să genereze răspunsuri atât în chineză, cât și în engleză. Sistemul este un model de limbaj mare cuantizat care suportă precizie pe 4 și 8 biți pentru a reduce utilizarea memoriei și cerințele hardware în timpul implementării locale. Este, de asemenea, un model de fine-tuning eficient din punct de vedere al parametrilor, permițând ajustări ale ponderilor pentru a adapta sistemul la sarcini specifice fără a fi nevoie de o reantrenare completă. Proiectul acoperă AI conversațional multimodal și dialog bazat pe imagini, permițând analiza conținutului vizual pentru a efectua sarcini de înțelegere vizuală în mai multe limbi. Capabilitățile sale includ cuantizarea preciziei modelului și fine-tuning specific domeniului pentru aplicații specializate.
Converts model weights to 4-bit or 8-bit precision to lower memory requirements.
Chinese-Vicuna este un model de limbaj mare (LLM) chinezesc și o AI care urmează instrucțiuni, bazată pe arhitectura LLaMA. Este concepută special pentru înțelegerea și generarea limbajului natural în limba chineză, utilizând un model ajustat prin instrucțiuni pentru a urma prompt-urile complexe ale utilizatorilor în timpul conversațiilor. Proiectul oferă un framework de fine-tuning LoRA și sisteme de cuantizare pentru a permite adaptarea modelului și inferența pe hardware de consum. Implementează inferența cuantizată pentru a reduce utilizarea memoriei atât pe CPU, cât și pe GPU, susținută de o implementare C++ de nivel scăzut pentru a minimiza cerințele de resurse ale sistemului. Sistemul acoperă o gamă largă de capabilități de procesare a limbajului natural, inclusiv gestionarea conversațiilor multi-turn, traducerea multilingvă și generarea de cod de programare. Include, de asemenea, instrumente pentru antrenarea specifică domeniului, conversia formatului modelului și o interfață de chat interactivă cu output de text în streaming.
Reduces model precision to enable efficient inference on hardware with limited graphics memory.
oneDNN este o bibliotecă pentru accelerarea deep learning-ului care oferă blocuri de construcție optimizate pentru antrenarea și inferența rețelelor neuronale. Aceasta gestionează calculul tensorial pe hardware CPU și GPU, permițând execuția de primitive de înaltă performanță pentru antrenarea modelelor și optimizarea inferenței rețelelor neuronale. Proiectul se distinge prin optimizarea kernel-ului specifică hardware-ului și utilizarea compilării „just-in-time” pentru a viza seturi de instrucțiuni specifice ale procesorului. Suportă execuția rețelelor neuronale cuantizate folosind cuantizarea statică și dinamică pentru a reduce utilizarea memoriei și a crește throughput-ul. Biblioteca acoperă o gamă largă de capabilități, inclusiv primitive de deep learning precum convoluții, înmulțirea matricelor și execuția rețelelor neuronale recurente. Implementează optimizări avansate de performanță, inclusiv fuziunea operațiunilor, optimizarea grafului de calcul și gestionarea formatului memoriei. Integrarea este oferită printr-un ABI C stabil și un wrapper C++, cu suport pentru SYCL, OpenCL și biblioteci externe de algebră liniară. Sistemul include instrumente de observabilitate pentru profilarea performanței hardware, benchmarking-ul primitivelor și log-uri detaliate de execuție.
Executes deep learning operations using reduced-precision numerical types to increase throughput and reduce memory usage.
VILA is a vision-language model integration that combines a visual encoder with a large language model to process images and text in a shared space. Its primary purpose is to enable the generation of natural language explanations and detailed text summaries of images and videos based on user prompts. The project utilizes a multi-stage alignment pipeline to synchronize visual and textual embeddings through sequential pretraining and supervised fine-tuning. To support deployment on desktop and edge hardware, it employs quantized low-precision inference to reduce model weights to 4-bit precision
Employs low-precision inference by reducing model weights to 4-bit precision for faster execution on edge hardware.
This project is a collection of scripts and workflows for training, fine-tuning, and deploying large language models using the Hugging Face Transformers toolkit. It functions as a distributed training framework, a library for natural language processing task implementations, and a system for building retrieval-augmented generation chatbots. The repository includes specialized tools for model optimization, such as a Bayesian hyperparameter optimizer for automatically tuning model settings. It provides implementations for scaling model training across multiple graphics processors using data par
Employs mixed-precision quantization to reduce memory usage and accelerate training speed.
ChatGLM-Efficient-Tuning is a fine-tuning framework and toolkit designed to optimize large language models using parameter-efficient fine-tuning techniques. It provides a pipeline for adjusting model behavior and reducing the memory and compute requirements necessary for training. The project features a web-based trainer and orchestration interface for configuring and executing the fine-tuning process on a single GPU. It supports quantized training in lower precision formats to enable fine-tuning on hardware with limited memory, as well as reinforcement learning from human feedback for model
Supports reducing the bit-width of model weights to enable training on hardware with limited memory.
Neural Compressor is a deep learning model compression toolkit and AI inference acceleration engine. It functions as an automated model quantization tool and hardware-aware model compiler designed to reduce the memory footprint of neural networks and decrease execution latency. The project provides specialized frameworks for optimizing large language models, utilizing weight-only quantization and hardware-specific kernels to improve the operational efficiency of generative AI workloads. It maps neural network operators to specialized CPU and GPU vector instructions to accelerate model executi
Assigns different bit-depths to individual layers to maintain accuracy while minimizing the total memory footprint.
Instructor-embedding este un framework de procesare a limbajului natural (NLP) conceput pentru a transforma textul nestructurat în vectori numerici de înaltă dimensiune. Prin utilizarea unei arhitecturi de encoder bazată pe transformatoare, sistemul facilitează recuperarea semantică, clasificarea datelor și analiza de similaritate în seturi mari de date. Framework-ul se distinge prin proiecția vectorială condiționată de instrucțiuni, care încorporează instrucțiunile în limbaj natural direct în procesul de embedding pentru a îmbunătăți performanța pentru sarcini specifice fără a necesita antrenament suplimentar. Funcționează ca o bibliotecă de învățare contrastivă, permițând utilizatorilor să fine-tuneze modele de limbaj pre-antrenate pe seturi de date personalizate pentru a crea embedding-uri specializate pentru domenii de nișă. Proiectul oferă o suită cuprinzătoare de instrumente pentru gestionarea reprezentărilor vectoriale, inclusiv capabilități pentru benchmarking-ul acurateței modelului față de metrici standardizate și indexarea embedding-urilor pentru căutarea rapidă de similaritate. Pentru a susține deployment-ul în medii cu resurse limitate, framework-ul include funcționalități de optimizare, cum ar fi cuantizarea modelului cu precizie mixtă, pentru a reduce utilizarea memoriei și a accelera viteza de inferență.
Reduces the bit-width of neural network parameters to decrease memory usage and accelerate inference speed on standard hardware.