awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

11 repositorios

Awesome GitHub RepositoriesInference Gateways

Unified interfaces that abstract multiple local and remote AI model providers into a single API.

Distinct from Remote Inference Providers: The candidates focus on remote providers or data interfaces, whereas this is a unifying gateway for both local and remote inference engines.

Explore 11 awesome GitHub repositories matching artificial intelligence & ml · Inference Gateways. Refine with filters or upvote what's useful.

Awesome Inference Gateways GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • pewdiepie-archdaemon/odysseusAvatar de pewdiepie-archdaemon

    pewdiepie-archdaemon/odysseus

    72,184Ver en GitHub↗

    Odysseus is a self-hosted AI workspace and autonomous agent framework designed for deploying and managing large language models. It serves as a centralized platform for orchestrating agentic tasks, utilizing a model context protocol server to connect AI models to external system utilities, browser automation, and local hardware. The system distinguishes itself through a combination of retrieval-augmented generation and a RAG knowledge base, using vector stores and local embeddings to provide persistent semantic memory. It further integrates AI-driven communication management to triage email i

    Unifies local serving engines and external API providers into a single interface for prompt processing.

    Python
    Ver en GitHub↗72,184
  • rootsongjc/kubernetes-handbookAvatar de rootsongjc

    rootsongjc/kubernetes-handbook

    11,584Ver en GitHub↗

    This project is a comprehensive infrastructure guide and technical reference for designing and deploying cloud native and AI native environments using Kubernetes. It serves as a manual for managing container orchestration, pod lifecycles, and declarative state reconciliation to maintain scalable cluster workloads. The resource provides instructional material on building custom controllers and implementing operational logic via the operator pattern. It also functions as a framework for optimizing the delivery of large language models through specialized gateways and workload scheduling. The h

    Describes using specialized inference gateways to optimize the delivery and routing of large language model workloads.

    Mermaidcloud-nativecncfgitbook
    Ver en GitHub↗11,584
  • higress-group/higressAvatar de higress-group

    higress-group/higress

    8,727Ver en GitHub↗

    Higress es una API gateway nativa de IA y nativa de la nube que enruta, asegura y optimiza el tráfico entre clientes y servicios de grandes modelos de lenguaje. Funciona como un punto de entrada centralizado para microservicios, sirviendo tanto como controlador de ingreso (ingress) de Kubernetes como orquestador de puerta de enlace de IA. El proyecto se distingue por gestionar el tráfico a través de múltiples proveedores de IA utilizando un protocolo unificado, incorporando limitación de tasa consciente de tokens y almacenamiento en caché de respuestas para optimizar la inferencia del modelo. Coordina la comunicación entre modelos de IA y herramientas externas para proporcionar contexto y datos en tiempo real, al tiempo que aloja puntos finales de servidor para agentes de IA. Sus capacidades incluyen la aplicación de seguridad de API mediante firewalls de aplicaciones web, gestión automatizada de certificados TLS y descubrimiento dinámico de servicios. La puerta de enlace admite el procesamiento de solicitudes personalizadas a través de plugins de WebAssembly en sandbox que permiten la transformación del tráfico con recarga en caliente. El sistema implementa API de ingreso estandarizadas para gestionar el enrutamiento de red dentro de clústeres en contenedores con baja sobrecarga de recursos.

    Balances requests across multiple AI providers using unified protocols, token-aware rate limiting, and response caching.

    Go
    Ver en GitHub↗8,727
  • fermyon/spinAvatar de fermyon

    fermyon/spin

    6,443Ver en GitHub↗

    Spin is a WebAssembly serverless framework and development toolchain for building and running portable microservices. It functions as an event-driven orchestrator and runtime that executes WebAssembly components, allowing developers to map HTTP requests, Redis messages, and cron schedules to specific modules. The project distinguishes itself by implementing a Wasm-based AI inference gateway, enabling components to perform model inference and generate text embeddings. It utilizes the WebAssembly Component Model and WASI for language-agnostic composition and portable host interfacing, while emp

    Implements an AI inference gateway connecting Wasm components to large language models.

    Rust
    Ver en GitHub↗6,443
  • helicone/heliconeAvatar de Helicone

    Helicone/helicone

    5,830Ver en GitHub↗

    Helicone is an AI gateway and observability platform designed to intercept, manage, and monitor interactions with large language models. By acting as a reverse-proxy, it provides a centralized layer for routing requests across multiple AI providers, allowing developers to maintain consistent application logic while gaining deep visibility into model performance, usage, and costs. The platform distinguishes itself through a robust suite of traffic management and prompt engineering tools. It enables policy-driven control, including automatic failover between providers, rate limiting, and edge-b

    Manages request flow and costs through caching, rate limiting, and security policies at the gateway level.

    TypeScript
    Ver en GitHub↗5,830
  • kubeflow/kfservingAvatar de kubeflow

    kubeflow/kfserving

    5,576Ver en GitHub↗

    KServe is an open platform for deploying and serving generative and predictive AI models on Kubernetes. It defines inference services as custom resources with declarative YAML specifications, enabling a Kubernetes-native approach to model deployment and lifecycle management. The platform leverages Knative-based serverless scaling for automatic scale-to-zero and revision management, and supports a pluggable serving runtime architecture that maps model formats to containerized execution environments. KServe distinguishes itself through model-aware autoscaling that scales replicas based on token

    Routes, rate-limits, and authenticates inference requests across model versions and replicas.

    Go
    Ver en GitHub↗5,576
  • kserve/kserveAvatar de kserve

    kserve/kserve

    5,576Ver en GitHub↗

    KServe is a Kubernetes-native platform for deploying and serving machine learning models as scalable inference services. It supports both generative AI models, including large language models, and traditional predictive models from frameworks such as TensorFlow, PyTorch, Scikit-Learn, XGBoost, and ONNX. The platform manages the full lifecycle of model deployments, including revision tracking, canary rollouts, A/B testing, and automatic rollbacks, and provides serverless scale-to-zero capabilities for cost-efficient resource management. KServe distinguishes itself through a standardized infere

    Creates gateways and HTTPRoutes to direct external traffic to LLM schedulers for controlled model access.

    Go
    Ver en GitHub↗5,576
  • vllm-project/aibrixAvatar de vllm-project

    vllm-project/aibrix

    4,882Ver en GitHub↗

    Aibrix es un orquestador de inferencia diseñado para escalar, enrutar y gestionar el despliegue de modelos de lenguaje grandes a través de clústeres vLLM distribuidos. Sirve como una puerta de enlace centralizada para el balanceo de carga y el enrutamiento de tráfico a réplicas y versiones específicas de modelos. El sistema gestiona la eficiencia de los recursos a través de un autoescalador de clúster de GPU que ajusta el conteo de instancias de cómputo según el volumen de solicitudes en tiempo real. Además, optimiza las operaciones mezclando diferentes tipos de aceleradores dentro de un solo clúster y utilizando un orquestador de adaptadores de modelos para desplegar adaptadores de parámetros ligeros en modelos base compartidos. Las capacidades generales incluyen el uso de un gestor de caché de clave-valor distribuido para compartir datos de tokens a través de motores de inferencia y la implementación de monitoreo de salud del hardware para detectar fallos en las unidades de procesamiento. El proyecto también proporciona un pipeline de métricas unificado para estandarizar la recopilación de datos de rendimiento en diversos entornos de ejecución.

    Provides a centralized gateway that routes incoming inference requests to specific model replicas and versions for load balancing.

    Go
    Ver en GitHub↗4,882
  • seldonio/seldon-coreAvatar de SeldonIO

    SeldonIO/seldon-core

    4,752Ver en GitHub↗

    Seldon Core es un servidor de modelos de machine learning basado en Kubernetes y un framework de inferencia MLOps. Funciona como un motor de servicio multimodelo y orquestador de pipelines, empaquetando modelos como microservicios escalables que se exponen a través de APIs REST y gRPC estandarizadas. El proyecto se distingue por sus pipelines de inferencia basados en grafos que encadenan modelos y transformadores de datos en flujos de trabajo secuenciales. Optimiza la utilización del hardware mediante el servicio compartido multimodelo y estrategias de sobreasignación dinámica de memoria, mientras admite la experimentación en producción mediante enrutamiento de tráfico ponderado, pruebas A/B y despliegues shadow. El framework cubre una amplia gama de capacidades MLOps, incluyendo escalado automático basado en la demanda, procesamiento asíncrono de solicitudes mediante buses de mensajes y monitoreo integral para la deriva de datos, valores atípicos y explicabilidad de predicciones. También proporciona gestión de infraestructura para la configuración del tiempo de ejecución del modelo y comunicación segura mediante cifrado TLS en los planos de control y datos.

    Directs traffic to appropriate model servers using a high-availability ingress and reverse proxy system.

    Goaiopsdeploymentkubernetes
    Ver en GitHub↗4,752
  • vllm-project/semantic-routerAvatar de vllm-project

    vllm-project/semantic-router

    3,205Ver en GitHub↗

    Accepts OpenAI-style chat and responses API requests and dispatches them to the appropriate backend model.

    Goai-gatewaybert-classificationfine-tuning
    Ver en GitHub↗3,205
  • llm-d/llm-dAvatar de llm-d

    llm-d/llm-d

    2,514Ver en GitHub↗

    llm-d is a distributed serving framework designed for large language model inference. It functions as an inference orchestrator and gateway, providing a control plane for deploying model replicas and managing hardware accelerators. The system includes a batch inference scheduler and a cache manager to coordinate request flow and memory utilization. The project is distinguished by a disaggregated serving architecture that separates prefill and decode execution phases across specialized workers to maximize throughput. It employs a hardware-agnostic control plane and tiered cache offloading, mov

    Functions as an OpenAI-compatible API gateway for request routing and traffic distribution.

    Shell
    Ver en GitHub↗2,514
  1. Home
  2. Artificial Intelligence & ML
  3. Inference Gateways

Explorar subetiquetas

  • Traffic Management1 sub-etiquetaRouting, rate limiting, and authenticating inference requests across model versions and replicas. **Distinct from Inference Gateways:** Distinct from Inference Gateways: focuses on traffic management across model versions, not abstracting multiple providers.