awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

20 repository-uri

Awesome GitHub RepositoriesCommand Line Model Inferences

Utilities for executing single model predictions directly from a terminal interface.

Distinct from Command Line: Candidates focus on shell completions or general task management; this is specifically for running ML model inference via CLI.

Explore 20 awesome GitHub repositories matching development tools & productivity · Command Line Model Inferences. Refine with filters or upvote what's useful.

Awesome Command Line Model Inferences GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • tensorflow/tfjsAvatar tensorflow

    tensorflow/tfjs

    19,134Vezi pe GitHub↗

    TensorFlow.js is a JavaScript machine learning library used for training and deploying models in web browsers and server-side environments. It functions as a browser-based model trainer, a WebAssembly inference engine, and a WebGPU accelerated tensor library for low-level linear algebra. The project also includes a model converter to transform Python-based models into optimized formats for JavaScript execution. The library distinguishes itself through a pluggable backend architecture that allows mathematical operations to be executed via CPU, WebGL, or WebGPU. It supports the conversion of Py

    Provides command-line utilities to process input tensors and perform model inference.

    TypeScript
    Vezi pe GitHub↗19,134
  • cocktailpeanut/dalaiAvatar cocktailpeanut

    cocktailpeanut/dalai

    12,920Vezi pe GitHub↗

    The simplest way to run LLaMA on your local machine

    Manages language models through terminal commands for local use.

    CSSaillamallm
    Vezi pe GitHub↗12,920
  • mistralai/mistral-inferenceAvatar mistralai

    mistralai/mistral-inference

    10,819Vezi pe GitHub↗

    Mistral Inference is a library for running Mistral large language models on a GPU, generating text from prompts with token streaming. It loads pretrained model weights from local disk or a remote registry into GPU memory, then produces output tokens one by one for real-time display in interactive applications. The library supports multimodal prompts that accept image URLs alongside text, enabling visual description and reasoning. It includes content safety guardrails that scan generated text against predefined policies to block or flag policy violations. For structured interactions, it provid

    Starts a command-line session that accepts user prompts and streams model responses conversationally.

    Jupyter Notebookllmllm-inferencemistralai
    Vezi pe GitHub↗10,819
  • mistralai/mistral-srcAvatar mistralai

    mistralai/mistral-src

    10,821Vezi pe GitHub↗

    Acest proiect este o bibliotecă și un framework de inferență pentru modele de limbaj mari, conceput pentru a rula modele pentru generarea de text, rezolvarea problemelor și asistența în programare. Include un framework multimodal pentru procesarea intrărilor combinate de imagine și text și o implementare de tip tool-use care permite execuția funcțiilor externe bazată pe raționamentul modelului. Sistemul dispune de un motor de inferență GPU distribuit care distribuie sarcinile de lucru ale modelelor mari pe mai multe procesoare grafice pentru a crește viteza de procesare și a îndeplini cerințele de memorie. De asemenea, oferă implementarea containerizată a modelelor prin imagini pre-pachetate și dependențe pentru servirea motoarelor de inferență în medii izolate. Biblioteca acoperă o gamă de capabilități, inclusiv analiza intrărilor multimodale, integrarea apelurilor de funcții și completarea codului (fill-in-the-middle) pentru prezicerea segmentelor de cod lipsă. De asemenea, suportă chat-ul interactiv cu modelul printr-o interfață în linie de comandă pentru menținerea sesiunilor conversaționale.

    Provides a command-line interface for maintaining interactive conversational sessions with models.

    Jupyter Notebook
    Vezi pe GitHub↗10,821
  • quentinfuxa/whisperlivekitAvatar QuentinFuxa

    QuentinFuxa/WhisperLiveKit

    10,475Vezi pe GitHub↗

    WhisperLiveKit is a real-time speech-to-text server that transcribes streaming audio into text with ultra-low latency using Whisper models. It serves transcription capabilities through REST endpoints and WebSocket connections, enabling external applications to send audio and receive transcriptions as words are spoken, making it suitable for live captioning or voice interfaces. The project distinguishes itself by combining real-time transcription with speaker diarization, assigning transcribed words to individual speakers during live audio streams for meeting or interview transcripts. It also

    Manages model lifecycle through CLI commands for listing, downloading, and deleting speech recognition models.

    Python
    Vezi pe GitHub↗10,475
  • replicate/cogAvatar replicate

    replicate/cog

    9,424Vezi pe GitHub↗

    Cog is a machine learning packaging tool and containerized model wrapper that bundles models and their dependencies into standardized Docker containers. It functions as an environment manager and inference server, ensuring consistent model execution across different hardware systems by resolving GPU drivers, system libraries, and Python dependencies. The project distinguishes itself by automatically generating RESTful HTTP servers and OpenAPI schemas based on defined model input and output types. It manages large model weights as external fixtures to optimize image size and utilizes a slot-ba

    Provides a command-line interface to execute a single prediction through a containerized model.

    Go
    Vezi pe GitHub↗9,424
  • prusa3d/prusaslicerAvatar prusa3d

    prusa3d/PrusaSlicer

    9,146Vezi pe GitHub↗

    PrusaSlicer is a G-code generator that converts 3D models into machine instructions for FFF and mSLA printers, handling slicing, infill, and support generation. It provides a command-line slicing interface for processing models and profiles via terminal commands without a graphical user interface, and includes a G-code customization engine that inserts user-defined macros, variables, and post-processing scripts into generated G-code for tailored machine control. The software also manages multi-material prints by coordinating multiple extruders and filament colors, assigning materials to model

    Processes 3D models and profiles via terminal commands to produce printable G-code without a graphical user interface.

    C++
    Vezi pe GitHub↗9,146
  • intel/ipex-llmAvatar intel

    intel/ipex-llm

    8,836Vezi pe GitHub↗

    Intel XPU LLM Acceleration Library is a toolkit designed to accelerate large language model inference and finetuning on Intel CPUs, GPUs, and NPUs. It provides a distributed inference engine for scaling models across multiple accelerators, a multimodal model runtime for vision and speech tasks, and a low-bit model quantization tool for converting weights into INT4, FP8, and GGUF formats. The project features a parameter-efficient finetuning framework that enables model adaptation using QLoRA and DPO on Intel hardware. It distinguishes itself by providing specialized optimizations for Intel XP

    Provides a command-line interface for executing model inferences with configurable sampling parameters.

    Python
    Vezi pe GitHub↗8,836
  • vowpalwabbit/vowpal_wabbitAvatar VowpalWabbit

    VowpalWabbit/vowpal_wabbit

    8,683Vezi pe GitHub↗

    Vowpal Wabbit is an open-source machine learning system designed for online learning, where models update incrementally from streaming data without requiring full retraining. It provides a reduction-based learning framework that composes complex tasks from simpler algorithms, and includes a feature hashing trick that maps unbounded feature names into a fixed-size vector space to keep memory usage constant regardless of dataset size. The system supports distributed training across a cluster using an allreduce protocol for synchronized updates, and offers an active learning query strategy that s

    Trains and evaluates machine learning models directly from the terminal using compact argument syntax.

    C++active-learningc-plus-pluscontextual-bandits
    Vezi pe GitHub↗8,683
  • facebookresearch/metaseqAvatar facebookresearch

    facebookresearch/metaseq

    6,546Vezi pe GitHub↗

    Metaseq este un toolkit de modelare a secvențelor de tip transformer conceput pentru antrenarea, ajustarea fină și implementarea modelelor sequence-to-sequence folosind ponderi pre-antrenate open-source. Oferă un framework cuprinzător pentru antrenarea modelelor de limbaj mari, incluzând instrumente dedicate pentru procesarea seturilor de date de secvențe și un server de inferență standalone pentru generarea de text prin cereri API. Proiectul dispune de utilitare specializate pentru cuantizarea modelelor pentru a reduce precizia parametrilor la opt biți, ceea ce scade utilizarea memoriei și crește viteza de inferență. Include, de asemenea, un pipeline de conversie a checkpoint-urilor pentru a transforma ponderile modelelor în structuri optimizate pentru motoare de inferență de înaltă performanță. Framework-ul susține antrenarea la scară largă pe clustere GPU prin utilizarea paralelismului tensorial și a paralelismului de date sharded. Capabilitățile suplimentare acoperă pregătirea seturilor de date NLP, încărcarea ponderilor pre-antrenate pentru transfer learning și urmărirea metricilor de antrenament pentru vizualizarea progresului.

    Supports interactive command-line sessions for loading models and generating text with configurable sampling parameters.

    Python
    Vezi pe GitHub↗6,546
  • nfmcclure/tensorflow_cookbookAvatar nfmcclure

    nfmcclure/tensorflow_cookbook

    6,239Vezi pe GitHub↗

    The TensorFlow Cookbook is a collection of code examples and recipes for building, training, and deploying machine learning models using TensorFlow. It covers the full model lifecycle, from constructing neural networks and training them with configurable parameters to packaging trained models for production deployment with unit tests and multi-device support. The project also integrates TensorBoard for logging and visualizing computational graphs, scalar summaries, and histograms during training. The cookbook demonstrates a wide range of machine learning techniques, including convolutional ne

    Manages model training and inference through explicit session creation, variable initialization, and cleanup.

    Jupyter Notebookclassificationcnngenetic-algorithm
    Vezi pe GitHub↗6,239
  • rustformers/llmAvatar rustformers

    rustformers/llm

    6,151Vezi pe GitHub↗

    Acest proiect este o bibliotecă și o interfață de linie de comandă pentru inferența locală a modelelor de limbaj mari (LLM). Permite generarea de completări de text și răspunsuri de chat din diverse arhitecturi de modele. Proiectul oferă instrumente pentru cuantificarea ponderilor pentru a reduce amprenta de memorie și încorporează accelerarea hardware prin offloading GPU pentru a crește viteza de calcul. Include, de asemenea, utilitare pentru evaluarea modelului prin măsurarea perplexității pe seturi de date specifice. Capabilitățile acoperă întregul ciclu de viață al inferenței, inclusiv încărcarea binară a modelului, structurarea prompt-urilor bazată pe șabloane și persistența sesiunii pentru menținerea contextului conversațional. Suportă, de asemenea, orchestrarea sarcinilor, permițând secvențierea mai multor apeluri de model în pipeline-uri pentru operațiuni în mai mulți pași.

    Allows saving and loading the state of an interaction to maintain context across sessions.

    Rustaiggmlllm
    Vezi pe GitHub↗6,151
  • obss/sahiAvatar obss

    obss/sahi

    5,372Vezi pe GitHub↗

    SAHI este un framework de inferență prin tăiere (sliced inference) și un pipeline de computer vision conceput pentru a detecta obiecte mici în imagini de înaltă rezoluție. Acesta oferă un sistem pentru divizarea imaginilor mari în patch-uri suprapuse pentru a preveni pierderea detaliilor care apare de obicei în timpul downscaling-ului standard al modelelor, alături de un utilitar de tiling al imaginilor și un toolkit pentru seturi de date COCO. Proiectul se distinge prin oferirea unui wrapper de predicție model-agnostic care standardizează diferite framework-uri de machine learning într-o interfață unificată. Acest lucru îi permite să implementeze inferența prin tăiere și detectarea obiectelor pe diverse backend-uri de modele, menținând în același timp un format de output consistent. Dincolo de inferență, framework-ul acoperă gestionarea seturilor de date pentru formatele COCO și YOLO, inclusiv instrumente pentru tăierea imaginilor adnotate, remaparea categoriilor și fuziunea seturilor de date. Include, de asemenea, o suită pentru evaluarea și monitorizarea performanței modelelor, având calculul metricilor pentru precizie și recall, analiza erorilor de detecție și vizualizarea rezultatelor. Toolkit-ul este accesibil printr-o interfață în linie de comandă pentru automatizarea fluxurilor de lucru de inferență pe directoare de imagini și fluxuri video.

    Provides a command-line interface for executing object detection predictions and dataset operations.

    Python
    Vezi pe GitHub↗5,372
  • docker/genai-stackAvatar docker

    docker/genai-stack

    5,333Vezi pe GitHub↗

    Acest proiect este un stack de dezvoltare containerizat și un framework de aplicație pentru construirea sistemelor de generare augmentată prin recuperare (RAG). Oferă un sandbox AI dockerizat care integrează runtime-uri de modele locale, grafuri de cunoștințe și vector stores pentru a permite crearea de chatbot-uri contextuale. Stack-ul se distinge prin vector store-ul bazat pe grafuri, care combină grafuri de cunoștințe structurate cu indici vectoriali pentru recuperarea datelor atât semantice, cât și structurale. Permite găzduirea locală a modelelor cu accelerare CPU sau GPU, permițând sarcini generative fără dependența de API-uri cloud externe. Framework-ul acoperă o gamă largă de capabilități, inclusiv procesarea și indexarea documentelor PDF, orchestrarea serviciilor AI bazate pe containere și implementarea generării de răspunsuri fundamentate. Include o interfață de chat web cu streaming incremental al răspunsurilor și o interfață standardizată pentru comutarea între diferiți furnizori de modele de limbaj. Mediul este inițializat folosind orchestrarea containerelor pentru a implementa rapid un stack preconfigurat de modele și baze de date.

    Automates the download and installation of local language model runtimes and system services.

    Python
    Vezi pe GitHub↗5,333
  • internlm/xtunerAvatar InternLM

    InternLM/xtuner

    5,150Vezi pe GitHub↗

    xtuner este un motor de antrenare cuprinzător pentru modele de limbaj mari (LLM), oferind un toolkit pentru pre-antrenare, fine-tuning supervizat și optimizarea modelelor multimodale vision-language. Servește ca un accelerator de antrenare distribuită și un framework specializat pentru scalarea modelelor Mixture-of-Experts și alinierea comportamentului modelului prin învățare prin consolidare din feedback uman (RLHF). Proiectul se distinge prin optimizări avansate de memorie și calcul, cum ar fi paralelismul de secvență pentru ferestre de context ultra-lungi și paralelismul de pipeline intercalat pentru a reduce timpul de inactivitate al GPU-ului. Oferă o suită dedicată pentru optimizarea preferințelor, implementând tehnici precum Group Relative Policy Optimization și Direct Preference Optimization pentru a rafina politicile modelului și sistemele de recompensă. Zonele largi de capabilități acoperă antrenarea distribuită a modelelor pe mai multe noduri, pregătirea seturilor de date multimodale și gestionarea fine-tuning-ului bazat pe adaptoare. Motorul include, de asemenea, instrumente pentru evaluarea modelului, fuziunea ponderilor (weight merging) și exportul parametrilor antrenați către motoarele de inferență. Antrenarea este gestionată prin fișiere de configurare standardizate și launchere distribuite pentru a asigura rezultate consistente pe clusterele de calcul.

    Executes interactive chat sessions using specific prompt templates and optional adapter weights.

    Pythonagentdeepseek-v3gpt-oss
    Vezi pe GitHub↗5,150
  • shibing624/medicalgptAvatar shibing624

    shibing624/MedicalGPT

    4,774Vezi pe GitHub↗

    MedicalGPT is an open-source framework for fine-tuning large language models, with a dedicated focus on adapting general models to the medical domain. It provides a complete pipeline that covers continued pretraining on domain-specific corpora, supervised instruction tuning, tokenizer vocabulary extension with medical terminology, and alignment to clinician preferences through direct preference optimization, reinforcement learning, or knowledge distillation. The framework also supports training models to invoke external tools and functions in multi-turn clinical conversations. The platform di

    Loads the fine‑tuned model weights and supports interactive chat or batch text generation from a command‑line session within the framework

    Pythonchatgptdpogpt
    Vezi pe GitHub↗4,774
  • modstart-lib/aigcpanelAvatar modstart-lib

    modstart-lib/aigcpanel

    4,576Vezi pe GitHub↗

    Aigcpanel is a visual workflow automation tool and model lifecycle manager designed for generative AI media pipelines. It provides a unified interface to install, launch, and configure both local and remote AI model endpoints, acting as an orchestration platform for large language models and AI tools. The system features a drag-and-drop node editor for chaining AI models and scripts into automated processing pipelines. It distinguishes itself with a breakpoint-aware execution model that allows users to pause and resume long media tasks from specific points in the workflow. Additionally, it in

    Provides a command line interface for executing model functions and querying available models for script integration.

    TypeScriptaiaigccosyvoice
    Vezi pe GitHub↗4,576
  • pytorch/executorchAvatar pytorch

    pytorch/executorch

    4,296Vezi pe GitHub↗

    ExecuTorch is a lightweight C++ runtime for deploying PyTorch models on mobile, embedded, and edge hardware. It provides an ahead-of-time compilation pipeline that exports, quantizes, and lowers model graphs into compact serialized programs, then executes them through a minimal runtime with hardware acceleration and on-device large language model inference capabilities. The project distinguishes itself through a hardware accelerator delegate system that partitions model subgraphs and offloads computation to specialized backends including NPUs, GPUs, and DSPs from Apple, Arm, Intel, MediaTek,

    ExecuTorch loads and executes a language model on-device, wrapping the runtime for text generation tasks.

    Pythondeep-learningembeddedgpu
    Vezi pe GitHub↗4,296
  • b4rtaz/distributed-llamaAvatar b4rtaz

    b4rtaz/distributed-llama

    2,837Vezi pe GitHub↗

    Distributed-llama is a distributed inference engine and command line tool for running large language models across multiple networked machines. It functions as a compute cluster manager that coordinates worker nodes to share the computational load of a single model. The system utilizes tensor parallelism to shard model weights across different hosts, allowing the execution of models that exceed the memory capacity of a single piece of hardware. It includes a dedicated format converter to transform standard model files into a compatible binary layout optimized for distributed loading. The eng

    Provides a command-line interface and server for interactive chat sessions and batch text generation.

    C++distributed-computingdistributed-llmllama2
    Vezi pe GitHub↗2,837
  • microsoft/foundry-localAvatar microsoft

    microsoft/Foundry-Local

    2,380Vezi pe GitHub↗

    Foundry-Local este un instrument de dezvoltare machine learning conceput pentru a facilita inferența privată, pe dispozitiv, și gestionarea modelelor. Oferă un mediu de server local care găzduiește modele de machine learning direct pe hardware-ul utilizatorului, asigurându-se că toată procesarea datelor, inclusiv gestionarea prompt-urilor și transcrierea audio, rămâne în mediul local fără a necesita conectivitate externă la cloud. Proiectul se distinge prin automatizarea întregului ciclu de viață al modelului, inclusiv descoperirea, descărcarea și versionarea activelor pentru a menține compatibilitatea cu hardware-ul gazdă. Dispune de un strat de abstractizare hardware care detectează și selectează automat cel mai eficient procesor disponibil pentru sarcini intensive de calcul, permițând execuția accelerată hardware fără configurare manuală. Dincolo de inferența de bază, instrumentul include o interfață CLI pentru explorarea interactivă a modelelor și verificarea performanței. De asemenea, oferă proxy-ing API standardizat, care mapează cererile primite către endpoint-urile modelelor locale folosind protocoale standard din industrie pentru a susține integrarea cu framework-uri software externe.

    Provides an interactive command-line interface for developers to test inference performance and verify model outputs directly.

    C++ai-sdkchat-completionsfoundry-local
    Vezi pe GitHub↗2,380
  1. Home
  2. Development Tools & Productivity
  3. Command Line Model Inferences

Explorează sub-etichetele

  • Command-Line SlicersProcesses 3D model files with specified profiles and parameters via terminal commands to produce printable G-code. **Distinct from Command Line Model Inferences:** Distinct from Command Line Model Inferences: applies to 3D printing slicing, not ML model inference.
  • Interactive Model Inference Sessions3 sub-tag-uriCommand-line sessions that load a pre-trained model and support interactive chat or batch text generation for fine-tuned models. **Distinct from Command Line Model Inferences:** Distinct from Command Line Model Inferences: focuses on interactive multi-turn sessions and batch generation from loaded models, rather than one-shot single predictions.
  • Model InstallersDownloads and configures model files from a content delivery network using a single terminal command. **Distinct from Command Line Model Inferences:** Distinct from Command Line Model Inferences: focuses on downloading and installing models, not running inference.
  • Model ManagersDownloads, installs, and manages language models through terminal commands for local use. **Distinct from Command Line Model Inferences:** Distinct from Command Line Model Inferences: covers the full lifecycle of model management (download, install, list, remove), not just running inference.