6 repository-uri
Runtimes that distribute model execution across multiple GPUs using tensor parallelism to handle large models.
Distinct from Model Inference Runtimes: Distinct from Model Inference Runtimes: focuses on multi-GPU distribution via tensor parallelism, not single-device execution.
Explore 6 awesome GitHub repositories matching artificial intelligence & ml · Multi-GPU Inference Runtimes. Refine with filters or upvote what's useful.
Acest proiect este o bibliotecă și un framework de inferență pentru modele de limbaj mari, conceput pentru a rula modele pentru generarea de text, rezolvarea problemelor și asistența în programare. Include un framework multimodal pentru procesarea intrărilor combinate de imagine și text și o implementare de tip tool-use care permite execuția funcțiilor externe bazată pe raționamentul modelului. Sistemul dispune de un motor de inferență GPU distribuit care distribuie sarcinile de lucru ale modelelor mari pe mai multe procesoare grafice pentru a crește viteza de procesare și a îndeplini cerințele de memorie. De asemenea, oferă implementarea containerizată a modelelor prin imagini pre-pachetate și dependențe pentru servirea motoarelor de inferență în medii izolate. Biblioteca acoperă o gamă de capabilități, inclusiv analiza intrărilor multimodale, integrarea apelurilor de funcții și completarea codului (fill-in-the-middle) pentru prezicerea segmentelor de cod lipsă. De asemenea, suportă chat-ul interactiv cu modelul printr-o interfață în linie de comandă pentru menținerea sesiunilor conversaționale.
Implements a runtime that distributes model execution across multiple GPUs using tensor parallelism to handle large model weights.
This project is an object detection framework implementing the YOLOv3 architecture using Keras and TensorFlow. It functions as a deep learning vision model and computer vision toolset designed to locate and classify multiple entities within images and video streams using bounding boxes. The system includes a multi-GPU inference engine to distribute computational loads across several graphics processing units. It also provides a pipeline for creating custom object detectors by retraining pre-trained weights on annotated datasets to recognize user-defined object classes. The framework covers m
Distributes the computational load of deep learning predictions across multiple graphics processing units.
CogVLM is a multimodal large language model designed to integrate visual and textual data for reasoning about images and generating natural language. It functions as a visual question answering system that analyzes image content to provide detailed descriptions or answer specific questions. The project includes a visual grounding model capable of mapping text descriptions to precise bounding box coordinates within an image. It also features a vision-based automation agent that analyzes screen captures to generate execution plans and interaction coordinates for software interfaces. The system
Optimizes GPU inference through weight quantization and distributed execution across multiple graphics processors.
gpt-fast este un motor de inferență pentru transformatoare PyTorch conceput pentru generarea de text cu latență scăzută. Acesta funcționează ca o bibliotecă de inferență GPU distribuită, un runner de modele cuantizate și un framework de decodare speculativă. Sistemul utilizează un flux de lucru de decodare speculativă unde un model draft mic prezice secvențe de token-uri pentru verificare de către un model mai mare, pentru a accelera generarea. Suportă execuția modelelor cuantizate pentru a reduce amprenta de memorie și implementează paralelismul tensorial pentru a împărți calculele pe mai multe GPU-uri. Proiectul include un harness de evaluare standardizat pentru a măsura acuratețea și performanța modelelor transformatoare. Gestionează eficiența inferenței prin gestionarea cache-ului key-value și utilizarea operațiunilor tensoriale native PyTorch.
Acts as a multi-GPU inference runtime that utilizes tensor parallelism for large transformer models.
exllamav2 este un motor de inferență și framework de înaltă performanță pentru executarea modelelor de limbaj mari local pe GPU-uri de clasă consumer. Oferă un sistem complet pentru deployment-ul local al modelelor, incluzând un motor de inferență specializat și instrumente pentru cuantizarea modelelor. Proiectul dispune de un framework de inferență multi-GPU care distribuie sarcinile de lucru pe mai multe plăci grafice pentru a rula modele care depășesc capacitatea de memorie a unui singur dispozitiv. Include un cuantizator de modele GPU capabil să convertească modelele în formate de precizie mixtă între 2 și 8 biți pentru a echilibra utilizarea memoriei și acuratețea. Motorul suportă generarea de text cu throughput ridicat prin inferență paralelă bazată pe batch-uri și streaming asincron de output. Aceste capabilități sunt susținute de kernel-uri CUDA personalizate și deduplicarea cache-ului pentru a optimiza utilizarea hardware-ului și a reduce latența în timpul generării de token-uri.
Provides a framework for distributing large language model workloads across multiple GPUs to bypass memory limits.
CTranslate2 is a C++ inference engine and runtime for Transformer models, designed to execute models on both CPU and GPU with optimizations for speed and memory efficiency. It functions as a model format converter, quantization tool, and REST API server, enabling deployment of neural machine translation, automatic speech recognition, and text generation models. The engine distinguishes itself through a suite of runtime optimizations including layer fusion, weight-matrix quantization, batch-by-length grouping, and a caching allocator that reuses GPU memory. It supports tensor-parallel model di
Distributing model execution across multiple GPUs using tensor parallelism to handle large models that exceed single-device memory.