20 repositorios
Utilities for executing single model predictions directly from a terminal interface.
Distinct from Command Line: Candidates focus on shell completions or general task management; this is specifically for running ML model inference via CLI.
Explore 20 awesome GitHub repositories matching development tools & productivity · Command Line Model Inferences. Refine with filters or upvote what's useful.
TensorFlow.js is a JavaScript machine learning library used for training and deploying models in web browsers and server-side environments. It functions as a browser-based model trainer, a WebAssembly inference engine, and a WebGPU accelerated tensor library for low-level linear algebra. The project also includes a model converter to transform Python-based models into optimized formats for JavaScript execution. The library distinguishes itself through a pluggable backend architecture that allows mathematical operations to be executed via CPU, WebGL, or WebGPU. It supports the conversion of Py
Provides command-line utilities to process input tensors and perform model inference.
The simplest way to run LLaMA on your local machine
Manages language models through terminal commands for local use.
Mistral Inference is a library for running Mistral large language models on a GPU, generating text from prompts with token streaming. It loads pretrained model weights from local disk or a remote registry into GPU memory, then produces output tokens one by one for real-time display in interactive applications. The library supports multimodal prompts that accept image URLs alongside text, enabling visual description and reasoning. It includes content safety guardrails that scan generated text against predefined policies to block or flag policy violations. For structured interactions, it provid
Starts a command-line session that accepts user prompts and streams model responses conversationally.
Este proyecto es una biblioteca y framework de inferencia de modelos de lenguaje de gran tamaño (LLM) diseñado para ejecutar modelos para generación de texto, resolución de problemas y asistencia en codificación. Incluye un framework multimodal para procesar entradas combinadas de imagen y texto, y una implementación de uso de herramientas que permite la ejecución de funciones externas basadas en el razonamiento del modelo. El sistema cuenta con un motor de inferencia de GPU distribuido que reparte las cargas de trabajo de modelos grandes a través de múltiples procesadores gráficos para aumentar la velocidad de procesamiento y cumplir con los requisitos de memoria. También proporciona despliegue de modelos en contenedores a través de imágenes preempaquetadas y dependencias para servir motores de inferencia en entornos aislados. La biblioteca cubre una gama de capacidades que incluyen análisis de entrada multimodal, integración de llamadas a funciones y codificación de relleno (fill-in-the-middle) para predecir segmentos de código faltantes. Además, admite chat interactivo con el modelo a través de una interfaz de línea de comandos para mantener sesiones conversacionales.
Provides a command-line interface for maintaining interactive conversational sessions with models.
WhisperLiveKit is a real-time speech-to-text server that transcribes streaming audio into text with ultra-low latency using Whisper models. It serves transcription capabilities through REST endpoints and WebSocket connections, enabling external applications to send audio and receive transcriptions as words are spoken, making it suitable for live captioning or voice interfaces. The project distinguishes itself by combining real-time transcription with speaker diarization, assigning transcribed words to individual speakers during live audio streams for meeting or interview transcripts. It also
Manages model lifecycle through CLI commands for listing, downloading, and deleting speech recognition models.
Cog is a machine learning packaging tool and containerized model wrapper that bundles models and their dependencies into standardized Docker containers. It functions as an environment manager and inference server, ensuring consistent model execution across different hardware systems by resolving GPU drivers, system libraries, and Python dependencies. The project distinguishes itself by automatically generating RESTful HTTP servers and OpenAPI schemas based on defined model input and output types. It manages large model weights as external fixtures to optimize image size and utilizes a slot-ba
Provides a command-line interface to execute a single prediction through a containerized model.
PrusaSlicer is a G-code generator that converts 3D models into machine instructions for FFF and mSLA printers, handling slicing, infill, and support generation. It provides a command-line slicing interface for processing models and profiles via terminal commands without a graphical user interface, and includes a G-code customization engine that inserts user-defined macros, variables, and post-processing scripts into generated G-code for tailored machine control. The software also manages multi-material prints by coordinating multiple extruders and filament colors, assigning materials to model
Processes 3D models and profiles via terminal commands to produce printable G-code without a graphical user interface.
Intel XPU LLM Acceleration Library is a toolkit designed to accelerate large language model inference and finetuning on Intel CPUs, GPUs, and NPUs. It provides a distributed inference engine for scaling models across multiple accelerators, a multimodal model runtime for vision and speech tasks, and a low-bit model quantization tool for converting weights into INT4, FP8, and GGUF formats. The project features a parameter-efficient finetuning framework that enables model adaptation using QLoRA and DPO on Intel hardware. It distinguishes itself by providing specialized optimizations for Intel XP
Provides a command-line interface for executing model inferences with configurable sampling parameters.
Vowpal Wabbit is an open-source machine learning system designed for online learning, where models update incrementally from streaming data without requiring full retraining. It provides a reduction-based learning framework that composes complex tasks from simpler algorithms, and includes a feature hashing trick that maps unbounded feature names into a fixed-size vector space to keep memory usage constant regardless of dataset size. The system supports distributed training across a cluster using an allreduce protocol for synchronized updates, and offers an active learning query strategy that s
Trains and evaluates machine learning models directly from the terminal using compact argument syntax.
Metaseq es un toolkit de modelado de secuencias transformer diseñado para entrenar, ajustar y desplegar modelos de secuencia a secuencia utilizando pesos pre-entrenados abiertos. Proporciona un framework integral para el entrenamiento de modelos de lenguaje de gran tamaño, incluyendo herramientas dedicadas para el procesamiento de datasets de secuencias y un servidor de inferencia independiente para generar texto mediante solicitudes API. El proyecto cuenta con utilidades especializadas para la cuantización de modelos para reducir la precisión de los parámetros a ocho bits, lo que reduce el uso de memoria y aumenta la velocidad de inferencia. También incluye un pipeline de conversión de checkpoints para transformar pesos de modelos en estructuras optimizadas para motores de inferencia de alto rendimiento. El framework soporta entrenamiento a gran escala a través de clústeres de GPU mediante el uso de paralelismo de tensores y paralelismo de datos fragmentados. Capacidades adicionales cubren la preparación de datasets de NLP, carga de pesos pre-entrenados para transfer learning y seguimiento de métricas de entrenamiento para la visualización del progreso.
Supports interactive command-line sessions for loading models and generating text with configurable sampling parameters.
The TensorFlow Cookbook is a collection of code examples and recipes for building, training, and deploying machine learning models using TensorFlow. It covers the full model lifecycle, from constructing neural networks and training them with configurable parameters to packaging trained models for production deployment with unit tests and multi-device support. The project also integrates TensorBoard for logging and visualizing computational graphs, scalar summaries, and histograms during training. The cookbook demonstrates a wide range of machine learning techniques, including convolutional ne
Manages model training and inference through explicit session creation, variable initialization, and cleanup.
Este proyecto es una biblioteca e interfaz de línea de comandos para la inferencia local de modelos de lenguaje de gran tamaño (LLM). Permite la generación de finalizaciones de texto y respuestas de chat desde varias arquitecturas de modelos. El proyecto proporciona herramientas para la cuantización de pesos para reducir la huella de memoria e incorpora aceleración de hardware mediante descarga a GPU para aumentar la velocidad de computación. También incluye utilidades para la evaluación de modelos midiendo la perplejidad en conjuntos de datos específicos. Las capacidades cubren el ciclo de vida completo de inferencia, incluyendo carga de modelos binarios, estructuración de prompts basada en plantillas y persistencia de sesiones para mantener el contexto conversacional. También admite la orquestación de tareas, permitiendo que múltiples llamadas a modelos se secuencien en pipelines para operaciones de varios pasos.
Allows saving and loading the state of an interaction to maintain context across sessions.
SAHI es un framework de inferencia segmentada y pipeline de visión artificial diseñado para detectar objetos pequeños en imágenes de alta resolución. Proporciona un sistema para dividir imágenes grandes en parches superpuestos para evitar la pérdida de detalle que ocurre típicamente durante la reducción de escala estándar del modelo, junto con una utilidad de mosaico de imágenes y un kit de herramientas de conjunto de datos COCO. El proyecto se distingue por ofrecer un wrapper de predicción agnóstico al modelo que estandariza diferentes frameworks de aprendizaje automático en una interfaz unificada. Esto le permite implementar inferencia segmentada y detección de objetos a través de varios backends de modelos mientras mantiene un formato de salida consistente. Más allá de la inferencia, el framework cubre la gestión de conjuntos de datos para formatos COCO y YOLO, incluyendo herramientas para el corte de imágenes anotadas, remapeo de categorías y fusión de conjuntos de datos. También incluye una suite para la evaluación y monitoreo del rendimiento del modelo, con cálculo de métricas para precisión y recall, análisis de errores de detección y visualización de resultados. El conjunto de herramientas es accesible a través de una interfaz de línea de comandos para automatizar flujos de trabajo de inferencia a través de directorios de imágenes y flujos de video.
Provides a command-line interface for executing object detection predictions and dataset operations.
Este proyecto es un stack de desarrollo contenedorizado y framework de aplicaciones para construir sistemas de generación aumentada por recuperación (RAG). Proporciona un sandbox de IA dockerizado que integra entornos de ejecución de modelos locales, grafos de conocimiento y almacenes vectoriales para permitir la creación de chatbots contextuales. El stack se distingue por su almacén vectorial basado en grafos, que combina grafos de conocimiento estructurados con índices vectoriales para la recuperación de datos tanto semánticos como estructurales. Permite el alojamiento de modelos locales con aceleración de CPU o GPU, facilitando tareas generativas sin depender de APIs externas en la nube. El framework cubre una amplia gama de capacidades, incluyendo el procesamiento e indexación de documentos PDF, la orquestación de servicios de IA basados en contenedores y la implementación de generación de respuestas fundamentadas. Incluye una interfaz de chat basada en web con streaming de respuestas incremental y una interfaz estandarizada para cambiar entre diferentes proveedores de modelos de lenguaje. El entorno se inicializa mediante orquestación de contenedores para desplegar rápidamente un stack preconfigurado de modelos y bases de datos.
Automates the download and installation of local language model runtimes and system services.
xtuner es un motor de entrenamiento integral para modelos de lenguaje grandes, que ofrece un toolkit para pre-entrenamiento, ajuste fino supervisado (fine-tuning) y la optimización de modelos multimodales de visión-lenguaje. Sirve como un acelerador de entrenamiento distribuido y un framework especializado para escalar modelos de Mezcla de Expertos (MoE) y alinear el comportamiento del modelo mediante aprendizaje por refuerzo a partir de retroalimentación humana (RLHF). El proyecto se distingue por optimizaciones avanzadas de memoria y cómputo, como el paralelismo de secuencia para ventanas de contexto ultra largas y el paralelismo de pipeline entrelazado para reducir el tiempo de inactividad de la GPU. Proporciona una suite dedicada para la optimización de preferencias, implementando técnicas como Group Relative Policy Optimization y Direct Preference Optimization para refinar las políticas del modelo y los sistemas de recompensa. Las áreas de capacidad cubren el entrenamiento distribuido de modelos a través de múltiples nodos, la preparación de datasets multimodales y la gestión del ajuste fino basado en adaptadores. El motor también incluye herramientas para la evaluación de modelos, fusión de pesos y exportación de parámetros entrenados a motores de inferencia. El entrenamiento se gestiona mediante archivos de configuración estandarizados y lanzadores distribuidos para asegurar resultados consistentes a través de clusters de computación.
Executes interactive chat sessions using specific prompt templates and optional adapter weights.
MedicalGPT is an open-source framework for fine-tuning large language models, with a dedicated focus on adapting general models to the medical domain. It provides a complete pipeline that covers continued pretraining on domain-specific corpora, supervised instruction tuning, tokenizer vocabulary extension with medical terminology, and alignment to clinician preferences through direct preference optimization, reinforcement learning, or knowledge distillation. The framework also supports training models to invoke external tools and functions in multi-turn clinical conversations. The platform di
Loads the fine‑tuned model weights and supports interactive chat or batch text generation from a command‑line session within the framework
Aigcpanel is a visual workflow automation tool and model lifecycle manager designed for generative AI media pipelines. It provides a unified interface to install, launch, and configure both local and remote AI model endpoints, acting as an orchestration platform for large language models and AI tools. The system features a drag-and-drop node editor for chaining AI models and scripts into automated processing pipelines. It distinguishes itself with a breakpoint-aware execution model that allows users to pause and resume long media tasks from specific points in the workflow. Additionally, it in
Provides a command line interface for executing model functions and querying available models for script integration.
ExecuTorch is a lightweight C++ runtime for deploying PyTorch models on mobile, embedded, and edge hardware. It provides an ahead-of-time compilation pipeline that exports, quantizes, and lowers model graphs into compact serialized programs, then executes them through a minimal runtime with hardware acceleration and on-device large language model inference capabilities. The project distinguishes itself through a hardware accelerator delegate system that partitions model subgraphs and offloads computation to specialized backends including NPUs, GPUs, and DSPs from Apple, Arm, Intel, MediaTek,
ExecuTorch loads and executes a language model on-device, wrapping the runtime for text generation tasks.
Distributed-llama is a distributed inference engine and command line tool for running large language models across multiple networked machines. It functions as a compute cluster manager that coordinates worker nodes to share the computational load of a single model. The system utilizes tensor parallelism to shard model weights across different hosts, allowing the execution of models that exceed the memory capacity of a single piece of hardware. It includes a dedicated format converter to transform standard model files into a compatible binary layout optimized for distributed loading. The eng
Provides a command-line interface and server for interactive chat sessions and batch text generation.
Foundry-Local es una herramienta de desarrollo de aprendizaje automático diseñada para facilitar la inferencia privada en el dispositivo y la gestión de modelos. Proporciona un entorno de servidor local que aloja modelos de aprendizaje automático directamente en el hardware del usuario, asegurando que todo el procesamiento de datos, incluido el manejo de avisos y la transcripción de audio, permanezca dentro del entorno local sin requerir conectividad externa a la nube. El proyecto se distingue por automatizar todo el ciclo de vida del modelo, incluido el descubrimiento, la descarga y el versionado de activos para mantener la compatibilidad con el hardware host. Cuenta con una capa de abstracción de hardware que detecta y selecciona automáticamente el procesador disponible más eficiente para tareas intensivas de cómputo, permitiendo la ejecución acelerada por hardware sin configuración manual. Más allá de la inferencia central, la herramienta incluye una interfaz de línea de comandos para la exploración interactiva de modelos y la verificación del rendimiento. También proporciona proxy de API estandarizado, que mapea las solicitudes entrantes a puntos finales de modelos locales utilizando protocolos estándar de la industria para apoyar la integración con marcos de software externos.
Provides an interactive command-line interface for developers to test inference performance and verify model outputs directly.