awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

14 Repos

Awesome GitHub RepositoriesGeneration Speed Optimizers

Utilities that improve generation latency by reducing the number of model forward passes.

Distinct from Token Optimization Utilities: Distinct from Token Optimization Utilities: targets GPU pass reduction for speed rather than just token count reduction for cost.

Explore 14 awesome GitHub repositories matching artificial intelligence & ml · Generation Speed Optimizers. Refine with filters or upvote what's useful.

Awesome Generation Speed Optimizers GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • microsoft/guidanceAvatar von microsoft

    microsoft/guidance

    21,502Auf GitHub ansehen↗

    Guidance is a control framework and generation orchestrator for large language models. It provides a programming layer to steer model outputs through structured templates, schema enforcement, and logical flow management. The framework distinguishes itself by interleaving model generation with local code execution, enabling the use of loops and conditional branching within a single session. It employs grammar-based token constraints and regular expressions to force models to sample only from tokens that satisfy a specific structural format, ensuring strict adherence to predefined data models.

    Improves generation speed by inserting known tokens directly into the output stream to reduce GPU passes.

    Jupyter Notebook
    Auf GitHub ansehen↗21,502
  • yujiangshui/a-programmers-guide-to-englishAvatar von yujiangshui

    yujiangshui/A-Programmers-Guide-to-English

    16,428Auf GitHub ansehen↗

    This project is a systematic framework for English language acquisition that applies structured workflows and cognitive strategies to build linguistic proficiency. It focuses on the construction of a linguistic knowledge base, enabling learners to master vocabulary and grammar through methodical training. The methodology is distinguished by its use of computer science concepts, such as mental-model-based learning and memory buffers, to organize progression. It emphasizes a cognitive-translation bypass to develop target language thinking, reducing mental latency by processing information direc

    Removes the need for mental translation to improve real-time interaction efficiency.

    englishenglish-learning
    Auf GitHub ansehen↗16,428
  • cumulo-autumn/streamdiffusionAvatar von cumulo-autumn

    cumulo-autumn/StreamDiffusion

    10,770Auf GitHub ansehen↗

    StreamDiffusion is an interactive generative AI framework and inference engine designed for the low-latency delivery of image and video streams. It provides a real-time Stable Diffusion pipeline for text-to-image and image-to-image generation, enabling the creation of continuous generative image streams with minimized computational delay. The framework optimizes throughput using a pre-computed cache engine and residual-based guidance approximation to reduce the number of required model passes. It further manages GPU load through similarity-based frame skipping, which avoids redundant computat

    Accelerates image generation by reducing the number of required model forward passes.

    Python
    Auf GitHub ansehen↗10,770
  • openai/consistency_modelsAvatar von openai

    openai/consistency_models

    6,492Auf GitHub ansehen↗

    This project is a framework for training and sampling generative models designed to produce high-quality images in few steps. It provides implementations for image generation models that transform random noise into structured visual data through an optimized sampling process. The system specializes in accelerating image generation through consistency distillation and consistency training. It includes tools to transform pre-trained diffusion models into faster versions by distilling knowledge from a teacher model into a student model, as well as methods to train consistency models from scratch

    Optimizes inference speed by reducing the number of sampling steps required for image generation.

    Python
    Auf GitHub ansehen↗6,492
  • getstream/vision-agentsAvatar von GetStream

    GetStream/Vision-Agents

    6,029Auf GitHub ansehen↗

    Chooses model size and compute precision to balance transcription accuracy against inference speed on available hardware.

    Pythonagentic-aiagentsai
    Auf GitHub ansehen↗6,029
  • xiaomi/maceAvatar von XiaoMi

    XiaoMi/mace

    5,041Auf GitHub ansehen↗

    Mace ist ein mobiles Deep-Learning-Inference-Framework und eine Hardware-Beschleunigungs-Engine. Es fungiert als Laufzeitumgebung für die Ausführung neuronaler Netzwerkmodelle auf mobilen Geräten und verteilt Berechnungen auf CPUs, GPUs und NPUs. Das Projekt enthält einen plattformübergreifenden Modellkonverter zur Transformation vortrainierter neuronaler Netze aus verschiedenen Industrieformaten in mobil optimierte Repräsentationen. Es bietet zudem einen Obfuscator für neuronale Netze, der Modellgewichte in Quellcode umwandelt, um geistiges Eigentum vor Reverse Engineering zu schützen. Das Framework verwaltet geräteinterne Ressourcen durch Optimierung der Speicherallokation und Anpassung der Chip-Energieeinstellungen. Es adressiert zudem die Ausführungsleistung durch mathematische Algorithmusoptimierung und Berechnungssplitting, um die Reaktionsfähigkeit der Oberfläche aufrechtzuerhalten.

    Increases operation speed by applying hardware acceleration and optimized mathematical algorithms to complex calculations.

    C++deep-learninghvxmachine-learning
    Auf GitHub ansehen↗5,041
  • cvg/lightglueAvatar von cvg

    cvg/LightGlue

    4,625Auf GitHub ansehen↗

    LightGlue ist ein Deep-Learning-Framework für lokales Feature-Matching und die hochpräzise Korrespondenzschätzung zwischen Bildpaaren. Es fungiert als Computer-Vision-Matching-Modell, das korrespondierende Keypoints über verschiedene Blickwinkel hinweg identifiziert. Das System nutzt eine adaptive neuronale Netzwerkarchitektur, die die Inferenzgeschwindigkeit dynamisch optimiert, indem sie ihre eigene Tiefe und Breite basierend auf den Eingabebildpaaren anpasst. Dieser Ansatz verwendet einen Transformer-basierten Aufmerksamkeitsmechanismus und Cross-Image-Attention, um Korrelationen zwischen Feature-Deskriptoren zu berechnen. Der Matching-Prozess umfasst eine iterative Verfeinerungsschleife und dynamisches Early-Stopping, um die Berechnung zu beenden, sobald Konfidenzschwellen erreicht sind. Diese Funktionen unterstützen eine umfassendere Computer-Vision-Pipeline für die Echtzeit-Bildausrichtung und die Optimierung neuronaler Netzwerkinferenzen.

    Reduces computational cost and increases processing speed through adaptive network pruning during inference.

    Python
    Auf GitHub ansehen↗4,625
  • tingsongyu/pytorch-tutorial-2ndAvatar von TingsongYu

    TingsongYu/PyTorch-Tutorial-2nd

    4,555Auf GitHub ansehen↗

    Dieses Projekt ist eine umfassende Lehrressource und ein Kurs zum Aufbau neuronaler Netze mit PyTorch. Es deckt die grundlegenden Bausteine des Deep Learning ab, einschließlich Tensor-Manipulation, automatischer Differenzierung und der Konstruktion modularer Komponenten für neuronale Netze. Das Repository dient als technischer Leitfaden für verschiedene spezialisierte Bereiche. Es bietet Implementierungsdetails für Computer-Vision-Aufgaben wie Bildklassifizierung, Objekterkennung und semantische Segmentierung sowie Workflows für die Verarbeitung natürlicher Sprache (NLP) mit Transformern, rekurrenten Netzen und generativen Modellen. Zudem enthält es eine Referenz für generative KI, mit Fokus auf die Synthese von Bildern mittels Diffusionsmodellen und adversarialen Netzwerken. Das Material erstreckt sich auf Modelloptimierung und Deployment-Pipelines. Es behandelt Techniken zur Reduzierung der Modellgröße und zur Erhöhung der Inferenzgeschwindigkeit durch Quantisierung und den Export von Modellen in Formate wie ONNX und TensorRT. Weitere Kompetenzbereiche umfassen Data Engineering für paralleles Laden, Modellevaluierung mittels benutzerdefinierter Metriken und das Deployment von Open-Source Large Language Models. Das Projekt wird primär als eine Reihe von Jupyter Notebooks bereitgestellt.

    Adjusts image size and confidence thresholds to balance execution speed and accuracy.

    Jupyter Notebookcomputer-visiondeepsortdiffusion-models
    Auf GitHub ansehen↗4,555
  • huawei-noah/ghostnetAvatar von huawei-noah

    huawei-noah/ghostnet

    4,416Auf GitHub ansehen↗

    GhostNet bietet eine Reihe effizienter KI-Modellarchitekturen und Entwurfsmuster für neuronale Netze, die darauf ausgelegt sind, den Rechen- und Speicheraufwand zu reduzieren. Es dient als Backbone für Computer Vision und als leichtgewichtiger Vision Transformer, der das Gleichgewicht zwischen Vorhersagegenauigkeit und Inferenzgeschwindigkeit optimiert. Das Projekt konzentriert sich auf die Reduzierung des Ressourcenverbrauchs für den Einsatz auf Mobilgeräten und Edge-Hardware. Dies wird durch leichtgewichtige Vision-Transformer-Implementierungen und Architekturen erreicht, die die Gesamtzahl der Parameter minimieren. Die Codebasis deckt eine Reihe von Funktionen zur Inferenzoptimierung ab, einschließlich der Senkung von Rechenkosten und Speicherbedarf. Sie implementiert strukturelle Entwurfsmuster wie tiefenseparierbare Faltungsblöcke (depthwise-separable convolutional blocks), Linear-Bottleneck-Depthwise-Convolutions und gewichtete Transformer-Blöcke, um die Inferenzlatenz zu verringern.

    Optimizes the execution speed and memory usage of neural network inference for faster live predictions.

    Python
    Auf GitHub ansehen↗4,416
  • apachecn/pytorch-doc-zhAvatar von apachecn

    apachecn/pytorch-doc-zh

    4,224Auf GitHub ansehen↗

    Dieses Projekt ist eine chinesische Übersetzung der technischen Handbücher und API-Referenzen für das PyTorch Deep-Learning-Framework. Es dient als lokalisierte Wissensdatenbank und Referenzmaterial, um die Deep-Learning-Dokumentation für nicht-englischsprachige Nutzer zugänglich zu machen. Die Dokumentation deckt ein umfassendes Spektrum an PyTorch-Funktionen ab, einschließlich der Entwicklung neuronaler Netzwerkmodelle, automatischer Differenzierung und der Implementierung von Backend-Kernels. Sie bietet detaillierte Anleitungen zu verteilten Trainingsstrategien, Modellbereitstellung über Formate wie ONNX und C++ sowie verschiedene Techniken zur Modelloptimierung und Quantisierung. Das Projekt nutzt eine Community-gesteuerte Übersetzungspipeline und ein verteiltes Beitragsmodell, um versionierte Inhalte aktuell zu halten. Technische Materialien sind in Markdown organisiert und werden über Static Site Generation in eine navigierbare Website umgewandelt.

    Offers methods to reduce memory footprint and execution time by converting models to quantized formats.

    Shelldeep-learningdocumentationpython
    Auf GitHub ansehen↗4,224
  • metavoiceio/metavoice-srcAvatar von metavoiceio

    metavoiceio/metavoice-src

    4,202Auf GitHub ansehen↗

    Dieses Projekt ist ein ausdrucksstarkes Text-to-Speech-Grundlagenmodell und Voice-Cloning-System, das darauf ausgelegt ist, menschenähnliche Sprache mit emotionaler Nuance und hoher Wiedergabetreue zu synthetisieren. Es fungiert als feinabstimmbares Sprachmodell, das Audio generieren kann, das eine bestimmte Person unter Verwendung eines Referenz-Stimmbeispiels imitiert. Das System zeichnet sich durch eine hochperformante Inference-Engine aus, die Memory-Caching und Hardware-Kompilierung nutzt, um die Latenz während des Audio-Generierungsprozesses zu reduzieren. Es ermöglicht zudem Verbesserungen der Synthesequalität durch das Training des Sprachmodells auf benutzerdefinierten Datensätzen, die aus Audiodateien und passenden Untertiteln bestehen. Das Framework deckt die breiteren Bereiche des benutzerdefinierten Voice-Clonings, der ausdrucksstarken Sprachsynthese und der Feinabstimmung von Sprachmodellen ab.

    Optimizes the execution speed of neural network inference via hardware compilation and memory caching.

    Pythonaideep-learningpytorch
    Auf GitHub ansehen↗4,202
  • vectorspacelab/omnigen2Avatar von VectorSpaceLab

    VectorSpaceLab/OmniGen2

    4,093Auf GitHub ansehen↗

    OmniGen2 is a unified image generation model and multimodal large language model designed to handle text-to-image generation, image-to-image tasks, and image editing within a single framework. It functions as a causal language model visual engine capable of generating and editing images based on combined text and visual inputs. The system features in-context visual composition and subject-driven generation, allowing it to extract subjects from reference images and place them into new scenes. It also supports instruction-based image editing, where specific objects or styles are modified via na

    Increases generation throughput using caching techniques and adjusted guidance ranges to accelerate model inference.

    Jupyter Notebook
    Auf GitHub ansehen↗4,093
  • sandai-org/magi-1Avatar von SandAI-org

    SandAI-org/MAGI-1

    3,711Auf GitHub ansehen↗

    MAGI-1 is an autoregressive video generation model designed to synthesize high-resolution video sequences from text prompts and image references. It functions as a generative system for text-to-video, image-to-video, and video-to-video transformations. The model utilizes an autoregressive architecture that treats spatio-temporal patches as a sequence of discrete tokens to maintain temporal motion. It employs a variational autoencoder to compress the spatial and temporal dimensions of video data and uses distillation-based step scaling to allow for inference budget control. The system integra

    Provides inference budget control to balance output quality and processing speed via distillation-based step sizes.

    Pythonautoregressivediffusion-modelsvideo-generation
    Auf GitHub ansehen↗3,711
  • hkuds/paper2slidesAvatar von HKUDS

    HKUDS/Paper2Slides

    3,092Auf GitHub ansehen↗

    Paper2Slides is an AI-driven presentation generator and content extractor designed to transform academic papers and scientific documents into structured slides and posters. It utilizes retrieval-augmented generation to distill key data points and identify critical figures while maintaining direct traceability to the original source text. The system functions as an AI slide designer that applies professional themes or custom visual styles defined through natural language. It integrates with external image generation services to produce high-quality visuals and research visualizations for acade

    Optimizes processing speed by allowing a choice between deep semantic indexing for complex papers and a fast mode for short files.

    Pythonagentic-aillm-agentspaper2poster
    Auf GitHub ansehen↗3,092
  1. Home
  2. Artificial Intelligence & ML
  3. Token Optimization Utilities
  4. Generation Speed Optimizers

Unter-Tags erkunden

  • Adaptive IndexingOptimization techniques that switch between indexing depths based on document complexity to balance speed and accuracy. **Distinct from Generation Speed Optimizers:** Focuses on switching indexing strategies for document processing rather than reducing GPU passes for LLM inference
  • Cognitive Processing SpeedStrategies to reduce mental translation time for more efficient real-time communication. **Distinct from Generation Speed Optimizers:** Distinct from Generation Speed Optimizers: focuses on human cognitive latency rather than AI model inference speed.
  • Transcription Speed Optimizers1 Sub-TagUtilities that choose model size and compute precision to balance transcription accuracy against inference speed on available hardware. **Distinct from Generation Speed Optimizers:** Distinct from Generation Speed Optimizers: focuses on transcription-specific speed/accuracy tradeoffs, not general generation latency.