20 repository-uri
Utilities for executing single model predictions directly from a terminal interface.
Distinct from Command Line: Candidates focus on shell completions or general task management; this is specifically for running ML model inference via CLI.
Explore 20 awesome GitHub repositories matching development tools & productivity · Command Line Model Inferences. Refine with filters or upvote what's useful.
TensorFlow.js is a JavaScript machine learning library used for training and deploying models in web browsers and server-side environments. It functions as a browser-based model trainer, a WebAssembly inference engine, and a WebGPU accelerated tensor library for low-level linear algebra. The project also includes a model converter to transform Python-based models into optimized formats for JavaScript execution. The library distinguishes itself through a pluggable backend architecture that allows mathematical operations to be executed via CPU, WebGL, or WebGPU. It supports the conversion of Py
Provides command-line utilities to process input tensors and perform model inference.
The simplest way to run LLaMA on your local machine
Manages language models through terminal commands for local use.
Mistral Inference is a library for running Mistral large language models on a GPU, generating text from prompts with token streaming. It loads pretrained model weights from local disk or a remote registry into GPU memory, then produces output tokens one by one for real-time display in interactive applications. The library supports multimodal prompts that accept image URLs alongside text, enabling visual description and reasoning. It includes content safety guardrails that scan generated text against predefined policies to block or flag policy violations. For structured interactions, it provid
Starts a command-line session that accepts user prompts and streams model responses conversationally.
Acest proiect este o bibliotecă și un framework de inferență pentru modele de limbaj mari, conceput pentru a rula modele pentru generarea de text, rezolvarea problemelor și asistența în programare. Include un framework multimodal pentru procesarea intrărilor combinate de imagine și text și o implementare de tip tool-use care permite execuția funcțiilor externe bazată pe raționamentul modelului. Sistemul dispune de un motor de inferență GPU distribuit care distribuie sarcinile de lucru ale modelelor mari pe mai multe procesoare grafice pentru a crește viteza de procesare și a îndeplini cerințele de memorie. De asemenea, oferă implementarea containerizată a modelelor prin imagini pre-pachetate și dependențe pentru servirea motoarelor de inferență în medii izolate. Biblioteca acoperă o gamă de capabilități, inclusiv analiza intrărilor multimodale, integrarea apelurilor de funcții și completarea codului (fill-in-the-middle) pentru prezicerea segmentelor de cod lipsă. De asemenea, suportă chat-ul interactiv cu modelul printr-o interfață în linie de comandă pentru menținerea sesiunilor conversaționale.
Provides a command-line interface for maintaining interactive conversational sessions with models.
WhisperLiveKit is a real-time speech-to-text server that transcribes streaming audio into text with ultra-low latency using Whisper models. It serves transcription capabilities through REST endpoints and WebSocket connections, enabling external applications to send audio and receive transcriptions as words are spoken, making it suitable for live captioning or voice interfaces. The project distinguishes itself by combining real-time transcription with speaker diarization, assigning transcribed words to individual speakers during live audio streams for meeting or interview transcripts. It also
Manages model lifecycle through CLI commands for listing, downloading, and deleting speech recognition models.
Cog is a machine learning packaging tool and containerized model wrapper that bundles models and their dependencies into standardized Docker containers. It functions as an environment manager and inference server, ensuring consistent model execution across different hardware systems by resolving GPU drivers, system libraries, and Python dependencies. The project distinguishes itself by automatically generating RESTful HTTP servers and OpenAPI schemas based on defined model input and output types. It manages large model weights as external fixtures to optimize image size and utilizes a slot-ba
Provides a command-line interface to execute a single prediction through a containerized model.
PrusaSlicer is a G-code generator that converts 3D models into machine instructions for FFF and mSLA printers, handling slicing, infill, and support generation. It provides a command-line slicing interface for processing models and profiles via terminal commands without a graphical user interface, and includes a G-code customization engine that inserts user-defined macros, variables, and post-processing scripts into generated G-code for tailored machine control. The software also manages multi-material prints by coordinating multiple extruders and filament colors, assigning materials to model
Processes 3D models and profiles via terminal commands to produce printable G-code without a graphical user interface.
Intel XPU LLM Acceleration Library is a toolkit designed to accelerate large language model inference and finetuning on Intel CPUs, GPUs, and NPUs. It provides a distributed inference engine for scaling models across multiple accelerators, a multimodal model runtime for vision and speech tasks, and a low-bit model quantization tool for converting weights into INT4, FP8, and GGUF formats. The project features a parameter-efficient finetuning framework that enables model adaptation using QLoRA and DPO on Intel hardware. It distinguishes itself by providing specialized optimizations for Intel XP
Provides a command-line interface for executing model inferences with configurable sampling parameters.
Vowpal Wabbit is an open-source machine learning system designed for online learning, where models update incrementally from streaming data without requiring full retraining. It provides a reduction-based learning framework that composes complex tasks from simpler algorithms, and includes a feature hashing trick that maps unbounded feature names into a fixed-size vector space to keep memory usage constant regardless of dataset size. The system supports distributed training across a cluster using an allreduce protocol for synchronized updates, and offers an active learning query strategy that s
Trains and evaluates machine learning models directly from the terminal using compact argument syntax.
Metaseq este un toolkit de modelare a secvențelor de tip transformer conceput pentru antrenarea, ajustarea fină și implementarea modelelor sequence-to-sequence folosind ponderi pre-antrenate open-source. Oferă un framework cuprinzător pentru antrenarea modelelor de limbaj mari, incluzând instrumente dedicate pentru procesarea seturilor de date de secvențe și un server de inferență standalone pentru generarea de text prin cereri API. Proiectul dispune de utilitare specializate pentru cuantizarea modelelor pentru a reduce precizia parametrilor la opt biți, ceea ce scade utilizarea memoriei și crește viteza de inferență. Include, de asemenea, un pipeline de conversie a checkpoint-urilor pentru a transforma ponderile modelelor în structuri optimizate pentru motoare de inferență de înaltă performanță. Framework-ul susține antrenarea la scară largă pe clustere GPU prin utilizarea paralelismului tensorial și a paralelismului de date sharded. Capabilitățile suplimentare acoperă pregătirea seturilor de date NLP, încărcarea ponderilor pre-antrenate pentru transfer learning și urmărirea metricilor de antrenament pentru vizualizarea progresului.
Supports interactive command-line sessions for loading models and generating text with configurable sampling parameters.
The TensorFlow Cookbook is a collection of code examples and recipes for building, training, and deploying machine learning models using TensorFlow. It covers the full model lifecycle, from constructing neural networks and training them with configurable parameters to packaging trained models for production deployment with unit tests and multi-device support. The project also integrates TensorBoard for logging and visualizing computational graphs, scalar summaries, and histograms during training. The cookbook demonstrates a wide range of machine learning techniques, including convolutional ne
Manages model training and inference through explicit session creation, variable initialization, and cleanup.
Acest proiect este o bibliotecă și o interfață de linie de comandă pentru inferența locală a modelelor de limbaj mari (LLM). Permite generarea de completări de text și răspunsuri de chat din diverse arhitecturi de modele. Proiectul oferă instrumente pentru cuantificarea ponderilor pentru a reduce amprenta de memorie și încorporează accelerarea hardware prin offloading GPU pentru a crește viteza de calcul. Include, de asemenea, utilitare pentru evaluarea modelului prin măsurarea perplexității pe seturi de date specifice. Capabilitățile acoperă întregul ciclu de viață al inferenței, inclusiv încărcarea binară a modelului, structurarea prompt-urilor bazată pe șabloane și persistența sesiunii pentru menținerea contextului conversațional. Suportă, de asemenea, orchestrarea sarcinilor, permițând secvențierea mai multor apeluri de model în pipeline-uri pentru operațiuni în mai mulți pași.
Allows saving and loading the state of an interaction to maintain context across sessions.
SAHI este un framework de inferență prin tăiere (sliced inference) și un pipeline de computer vision conceput pentru a detecta obiecte mici în imagini de înaltă rezoluție. Acesta oferă un sistem pentru divizarea imaginilor mari în patch-uri suprapuse pentru a preveni pierderea detaliilor care apare de obicei în timpul downscaling-ului standard al modelelor, alături de un utilitar de tiling al imaginilor și un toolkit pentru seturi de date COCO. Proiectul se distinge prin oferirea unui wrapper de predicție model-agnostic care standardizează diferite framework-uri de machine learning într-o interfață unificată. Acest lucru îi permite să implementeze inferența prin tăiere și detectarea obiectelor pe diverse backend-uri de modele, menținând în același timp un format de output consistent. Dincolo de inferență, framework-ul acoperă gestionarea seturilor de date pentru formatele COCO și YOLO, inclusiv instrumente pentru tăierea imaginilor adnotate, remaparea categoriilor și fuziunea seturilor de date. Include, de asemenea, o suită pentru evaluarea și monitorizarea performanței modelelor, având calculul metricilor pentru precizie și recall, analiza erorilor de detecție și vizualizarea rezultatelor. Toolkit-ul este accesibil printr-o interfață în linie de comandă pentru automatizarea fluxurilor de lucru de inferență pe directoare de imagini și fluxuri video.
Provides a command-line interface for executing object detection predictions and dataset operations.
Acest proiect este un stack de dezvoltare containerizat și un framework de aplicație pentru construirea sistemelor de generare augmentată prin recuperare (RAG). Oferă un sandbox AI dockerizat care integrează runtime-uri de modele locale, grafuri de cunoștințe și vector stores pentru a permite crearea de chatbot-uri contextuale. Stack-ul se distinge prin vector store-ul bazat pe grafuri, care combină grafuri de cunoștințe structurate cu indici vectoriali pentru recuperarea datelor atât semantice, cât și structurale. Permite găzduirea locală a modelelor cu accelerare CPU sau GPU, permițând sarcini generative fără dependența de API-uri cloud externe. Framework-ul acoperă o gamă largă de capabilități, inclusiv procesarea și indexarea documentelor PDF, orchestrarea serviciilor AI bazate pe containere și implementarea generării de răspunsuri fundamentate. Include o interfață de chat web cu streaming incremental al răspunsurilor și o interfață standardizată pentru comutarea între diferiți furnizori de modele de limbaj. Mediul este inițializat folosind orchestrarea containerelor pentru a implementa rapid un stack preconfigurat de modele și baze de date.
Automates the download and installation of local language model runtimes and system services.
xtuner este un motor de antrenare cuprinzător pentru modele de limbaj mari (LLM), oferind un toolkit pentru pre-antrenare, fine-tuning supervizat și optimizarea modelelor multimodale vision-language. Servește ca un accelerator de antrenare distribuită și un framework specializat pentru scalarea modelelor Mixture-of-Experts și alinierea comportamentului modelului prin învățare prin consolidare din feedback uman (RLHF). Proiectul se distinge prin optimizări avansate de memorie și calcul, cum ar fi paralelismul de secvență pentru ferestre de context ultra-lungi și paralelismul de pipeline intercalat pentru a reduce timpul de inactivitate al GPU-ului. Oferă o suită dedicată pentru optimizarea preferințelor, implementând tehnici precum Group Relative Policy Optimization și Direct Preference Optimization pentru a rafina politicile modelului și sistemele de recompensă. Zonele largi de capabilități acoperă antrenarea distribuită a modelelor pe mai multe noduri, pregătirea seturilor de date multimodale și gestionarea fine-tuning-ului bazat pe adaptoare. Motorul include, de asemenea, instrumente pentru evaluarea modelului, fuziunea ponderilor (weight merging) și exportul parametrilor antrenați către motoarele de inferență. Antrenarea este gestionată prin fișiere de configurare standardizate și launchere distribuite pentru a asigura rezultate consistente pe clusterele de calcul.
Executes interactive chat sessions using specific prompt templates and optional adapter weights.
MedicalGPT is an open-source framework for fine-tuning large language models, with a dedicated focus on adapting general models to the medical domain. It provides a complete pipeline that covers continued pretraining on domain-specific corpora, supervised instruction tuning, tokenizer vocabulary extension with medical terminology, and alignment to clinician preferences through direct preference optimization, reinforcement learning, or knowledge distillation. The framework also supports training models to invoke external tools and functions in multi-turn clinical conversations. The platform di
Loads the fine‑tuned model weights and supports interactive chat or batch text generation from a command‑line session within the framework
Aigcpanel is a visual workflow automation tool and model lifecycle manager designed for generative AI media pipelines. It provides a unified interface to install, launch, and configure both local and remote AI model endpoints, acting as an orchestration platform for large language models and AI tools. The system features a drag-and-drop node editor for chaining AI models and scripts into automated processing pipelines. It distinguishes itself with a breakpoint-aware execution model that allows users to pause and resume long media tasks from specific points in the workflow. Additionally, it in
Provides a command line interface for executing model functions and querying available models for script integration.
ExecuTorch is a lightweight C++ runtime for deploying PyTorch models on mobile, embedded, and edge hardware. It provides an ahead-of-time compilation pipeline that exports, quantizes, and lowers model graphs into compact serialized programs, then executes them through a minimal runtime with hardware acceleration and on-device large language model inference capabilities. The project distinguishes itself through a hardware accelerator delegate system that partitions model subgraphs and offloads computation to specialized backends including NPUs, GPUs, and DSPs from Apple, Arm, Intel, MediaTek,
ExecuTorch loads and executes a language model on-device, wrapping the runtime for text generation tasks.
Distributed-llama is a distributed inference engine and command line tool for running large language models across multiple networked machines. It functions as a compute cluster manager that coordinates worker nodes to share the computational load of a single model. The system utilizes tensor parallelism to shard model weights across different hosts, allowing the execution of models that exceed the memory capacity of a single piece of hardware. It includes a dedicated format converter to transform standard model files into a compatible binary layout optimized for distributed loading. The eng
Provides a command-line interface and server for interactive chat sessions and batch text generation.
Foundry-Local este un instrument de dezvoltare machine learning conceput pentru a facilita inferența privată, pe dispozitiv, și gestionarea modelelor. Oferă un mediu de server local care găzduiește modele de machine learning direct pe hardware-ul utilizatorului, asigurându-se că toată procesarea datelor, inclusiv gestionarea prompt-urilor și transcrierea audio, rămâne în mediul local fără a necesita conectivitate externă la cloud. Proiectul se distinge prin automatizarea întregului ciclu de viață al modelului, inclusiv descoperirea, descărcarea și versionarea activelor pentru a menține compatibilitatea cu hardware-ul gazdă. Dispune de un strat de abstractizare hardware care detectează și selectează automat cel mai eficient procesor disponibil pentru sarcini intensive de calcul, permițând execuția accelerată hardware fără configurare manuală. Dincolo de inferența de bază, instrumentul include o interfață CLI pentru explorarea interactivă a modelelor și verificarea performanței. De asemenea, oferă proxy-ing API standardizat, care mapează cererile primite către endpoint-urile modelelor locale folosind protocoale standard din industrie pentru a susține integrarea cu framework-uri software externe.
Provides an interactive command-line interface for developers to test inference performance and verify model outputs directly.