awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

4 Repos

Awesome GitHub RepositoriesToken Throughput Measurement

Calculating the number of tokens processed per second under specific request rates and input lengths.

Distinct from Multithreaded Throughput Measurement: Specific to LLM token-based throughput, distinct from network bandwidth or generic multithreaded CPU throughput.

Explore 4 awesome GitHub repositories matching testing & quality assurance · Token Throughput Measurement. Refine with filters or upvote what's useful.

Awesome Token Throughput Measurement GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • microsoft/promptflowAvatar von microsoft

    microsoft/promptflow

    11,165Auf GitHub ansehen↗

    Promptflow ist ein Entwicklungs-Framework und Orchestrator für den Aufbau von Anwendungen, die auf Large Language Models basieren. Es fungiert als Tool-Suite für das Design, die Orchestrierung und das Deployment von KI-Workflows, indem Prompts, benutzerdefinierter Python-Code und Sprachmodelle zu ausführbaren Sequenzen verknüpft werden. Das Projekt zeichnet sich durch einen visuellen KI-Workflow-Designer aus, der die Erstellung von gerichteten azyklischen Graphen (DAGs) aus Logik-Knoten ermöglicht. Es bietet eine dedizierte Prompt-Engineering-Umgebung für Versionierung und Vergleich von Templates sowie zustandsbehaftetes Execution-Tracing, um Funktionsaufrufe und Variablenwerte für schrittweises Debugging aufzuzeichnen. Die Plattform deckt ein breites Funktionsspektrum ab, einschließlich Retrieval Augmented Generation (RAG) via Vektordatenbank-Lookups und metrikgesteuerte Evaluierungspipelines für Batch-Tests und Qualitätssicherung. Sie deckt den gesamten Lebenszyklus von der Entwicklung bis zur Produktion ab, durch containerisiertes Deployment, Workflow-Endpoint-Serving und sicheres Verbindungsmanagement für API-Anmeldedaten. Ein Command-Line-Interface (CLI) und ein SDK für Workflow-Validierung und Integration in automatisierte CI/CD-Pipelines sind enthalten.

    Measures the number of tokens processed per second to establish scalability limits and latency baselines.

    Python
    Auf GitHub ansehen↗11,165
  • crazyguitar/pysheeetAvatar von crazyguitar

    crazyguitar/pysheeet

    8,150Auf GitHub ansehen↗

    pysheeet ist eine technische Referenzbibliothek, die eine kuratierte Sammlung von Code-Snippets und Implementierungsmustern für fortgeschrittene Python-Entwicklung, Systemintegration und High-Performance-Computing bereitstellt. Sie dient als umfassender Leitfaden für die Implementierung von Low-Level-Netzwerkprogrammierung, nativen C-Erweiterungen sowie asynchroner und nebenläufiger Programmierung. Das Projekt bietet spezialisierte Frameworks für die Entwicklung und Bereitstellung von Large Language Models, einschließlich Werkzeugen für verteilte GPU-Inferenz und High-Performance-Serving. Es enthält zudem detaillierte Muster für die Orchestrierung von High-Performance-Computing-Clustern, die GPU-Ressourcenzuweisung und Multi-Node-Workload-Management abdecken. Die Bibliothek deckt ein breites Spektrum an Funktionen ab, einschließlich sicherer Netzwerkkommunikation und Kryptografie, Object-Relational-Mapping und Datenbankverwaltung sowie die Implementierung komplexer Datenstrukturen und Algorithmen. Sie bietet zudem Utilities für Speicherverwaltung, native Interoperabilität via Foreign-Function-Interfaces und systemnahe OS-Integration.

    Implements calculation of peak output tokens per second by saturating servers with requests for throughput benchmarking.

    Python
    Auf GitHub ansehen↗8,150
  • modeltc/lightllmAvatar von ModelTC

    ModelTC/LightLLM

    3,901Auf GitHub ansehen↗

    LightLLM is a high-performance serving framework for deploying and executing large language models. It functions as a multi-GPU inference engine and server capable of handling dense architectures, mixture-of-experts designs, and multimodal models that process both text and images. The system is distinguished by its specialized support for Mixture-of-Experts models using expert parallelism and fused kernels. It implements structured text generation through deterministic state machines and pushdown automata to enforce precise output formats. To optimize throughput, the framework employs specula

    Evaluates queries per second and token throughput using customizable input lengths and request rates.

    Pythondeep-learninggptllama
    Auf GitHub ansehen↗3,901
  • evolvinglmms-lab/lmms-evalAvatar von EvolvingLMMs-Lab

    EvolvingLMMs-Lab/lmms-eval

    3,701Auf GitHub ansehen↗

    lmms-eval is a benchmarking system and performance analysis suite designed to measure the capabilities of large multimodal models. It provides a framework for evaluating models across text, image, audio, and video datasets, serving as a multimodal dataset orchestrator and benchmarking tool to quantify accuracy and efficiency. The project distinguishes itself through a unified multimodal message protocol that structures diverse media inputs for consistent model consumption. It features specialized benchmarking for audio, video, visual, document, and spatial reasoning, alongside tools for model

    Calculates latency, token generation speed, and time to first token to evaluate inference performance.

    Pythonagiaudio-evaluationbenchmark
    Auf GitHub ansehen↗3,701
  1. Home
  2. Testing & Quality Assurance
  3. Token Throughput Measurement

Unter-Tags erkunden

  • First Token Latency MeasurementEvaluation of the time elapsed between a request and the generation of the first output token. **Distinct from Token Throughput Measurement:** Distinct from general throughput (tokens per second) by focusing specifically on the initial response latency (Time to First Token).
  • Inter-Token Latency MetricsCalculation of the time elapsed between the generation of consecutive tokens in LLMs. **Distinct from Token Throughput Measurement:** Focuses on the per-token decode speed rather than aggregate tokens-per-second throughput.