awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

14 repository-uri

Awesome GitHub RepositoriesGeneration Speed Optimizers

Utilities that improve generation latency by reducing the number of model forward passes.

Distinct from Token Optimization Utilities: Distinct from Token Optimization Utilities: targets GPU pass reduction for speed rather than just token count reduction for cost.

Explore 14 awesome GitHub repositories matching artificial intelligence & ml · Generation Speed Optimizers. Refine with filters or upvote what's useful.

Awesome Generation Speed Optimizers GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • microsoft/guidanceAvatar microsoft

    microsoft/guidance

    21,502Vezi pe GitHub↗

    Guidance is a control framework and generation orchestrator for large language models. It provides a programming layer to steer model outputs through structured templates, schema enforcement, and logical flow management. The framework distinguishes itself by interleaving model generation with local code execution, enabling the use of loops and conditional branching within a single session. It employs grammar-based token constraints and regular expressions to force models to sample only from tokens that satisfy a specific structural format, ensuring strict adherence to predefined data models.

    Improves generation speed by inserting known tokens directly into the output stream to reduce GPU passes.

    Jupyter Notebook
    Vezi pe GitHub↗21,502
  • yujiangshui/a-programmers-guide-to-englishAvatar yujiangshui

    yujiangshui/A-Programmers-Guide-to-English

    16,428Vezi pe GitHub↗

    This project is a systematic framework for English language acquisition that applies structured workflows and cognitive strategies to build linguistic proficiency. It focuses on the construction of a linguistic knowledge base, enabling learners to master vocabulary and grammar through methodical training. The methodology is distinguished by its use of computer science concepts, such as mental-model-based learning and memory buffers, to organize progression. It emphasizes a cognitive-translation bypass to develop target language thinking, reducing mental latency by processing information direc

    Removes the need for mental translation to improve real-time interaction efficiency.

    englishenglish-learning
    Vezi pe GitHub↗16,428
  • cumulo-autumn/streamdiffusionAvatar cumulo-autumn

    cumulo-autumn/StreamDiffusion

    10,770Vezi pe GitHub↗

    StreamDiffusion is an interactive generative AI framework and inference engine designed for the low-latency delivery of image and video streams. It provides a real-time Stable Diffusion pipeline for text-to-image and image-to-image generation, enabling the creation of continuous generative image streams with minimized computational delay. The framework optimizes throughput using a pre-computed cache engine and residual-based guidance approximation to reduce the number of required model passes. It further manages GPU load through similarity-based frame skipping, which avoids redundant computat

    Accelerates image generation by reducing the number of required model forward passes.

    Python
    Vezi pe GitHub↗10,770
  • openai/consistency_modelsAvatar openai

    openai/consistency_models

    6,492Vezi pe GitHub↗

    This project is a framework for training and sampling generative models designed to produce high-quality images in few steps. It provides implementations for image generation models that transform random noise into structured visual data through an optimized sampling process. The system specializes in accelerating image generation through consistency distillation and consistency training. It includes tools to transform pre-trained diffusion models into faster versions by distilling knowledge from a teacher model into a student model, as well as methods to train consistency models from scratch

    Optimizes inference speed by reducing the number of sampling steps required for image generation.

    Python
    Vezi pe GitHub↗6,492
  • getstream/vision-agentsAvatar GetStream

    GetStream/Vision-Agents

    6,029Vezi pe GitHub↗

    Chooses model size and compute precision to balance transcription accuracy against inference speed on available hardware.

    Pythonagentic-aiagentsai
    Vezi pe GitHub↗6,029
  • xiaomi/maceAvatar XiaoMi

    XiaoMi/mace

    5,041Vezi pe GitHub↗

    Mace este un framework de inferență deep learning mobil și un motor de accelerare hardware. Funcționează ca un runtime pentru executarea modelelor de rețele neuronale pe dispozitive mobile, distribuind calculele între CPU-uri, GPU-uri și NPU-uri. Proiectul include un convertor de modele cross-platform pentru transformarea rețelelor neuronale pre-antrenate din diverse formate industriale în reprezentări optimizate pentru mobil. De asemenea, oferă un obfuscator de rețele neuronale care convertește ponderile modelului în cod sursă pentru a proteja proprietatea intelectuală împotriva ingineriei inverse. Framework-ul gestionează resursele de pe dispozitiv prin optimizarea alocării memoriei și ajustarea setărilor de putere ale cipului. Mai mult, abordează performanța execuției prin optimizarea algoritmilor matematici și împărțirea calculelor pentru a menține responsivitatea interfeței.

    Increases operation speed by applying hardware acceleration and optimized mathematical algorithms to complex calculations.

    C++deep-learninghvxmachine-learning
    Vezi pe GitHub↗5,041
  • cvg/lightglueAvatar cvg

    cvg/LightGlue

    4,625Vezi pe GitHub↗

    LightGlue is a deep learning framework designed for local feature matching and high-speed correspondence estimation between pairs of images. It functions as a computer vision matching model that identifies corresponding keypoints across different viewpoints. The system utilizes an adaptive neural network architecture that dynamically optimizes inference speed by pruning its own depth and width based on the input image pairs. This approach employs a transformer-style attention mechanism and cross-image attention to compute correlations between feature descriptors. The matching process include

    Reduces computational cost and increases processing speed through adaptive network pruning during inference.

    Python
    Vezi pe GitHub↗4,625
  • tingsongyu/pytorch-tutorial-2ndAvatar TingsongYu

    TingsongYu/PyTorch-Tutorial-2nd

    4,555Vezi pe GitHub↗

    Acest proiect este o resursă educațională cuprinzătoare și un curs pentru construirea de rețele neuronale folosind PyTorch. Acoperă elementele fundamentale ale deep learning-ului, inclusiv manipularea tensorilor, diferențierea automată și construcția componentelor modulare de rețele neuronale. Repository-ul servește drept ghid tehnic pentru mai multe domenii specializate. Oferă detalii de implementare pentru sarcini de computer vision, cum ar fi clasificarea imaginilor, detecția obiectelor și segmentarea semantică, precum și fluxuri de lucru de procesare a limbajului natural (NLP) care implică transformatoare, rețele recurente și modele generative. În plus, include o referință pentru AI generativ, concentrându-se în mod specific pe sinteza de imagini prin modele de difuzie și rețele adversariale. Materialul se extinde către optimizarea modelelor și pipeline-uri de deployment. Acoperă tehnici pentru reducerea dimensiunii modelelor și creșterea vitezei de inferență prin cuantizare și exportul modelelor în formate precum ONNX și TensorRT. Alte domenii de capabilitate includ ingineria datelor pentru încărcarea paralelă, evaluarea modelelor folosind metrici personalizate și deployment-ul modelelor de limbaj mari (LLM) open-source. Proiectul este livrat în principal sub formă de serie de Jupyter Notebooks.

    Adjusts image size and confidence thresholds to balance execution speed and accuracy.

    Jupyter Notebookcomputer-visiondeepsortdiffusion-models
    Vezi pe GitHub↗4,555
  • huawei-noah/ghostnetAvatar huawei-noah

    huawei-noah/ghostnet

    4,416Vezi pe GitHub↗

    GhostNet oferă un set de arhitecturi AI eficiente și modele de design pentru rețele neuronale, create pentru a reduce consumul de resurse computaționale și de memorie. Acesta servește drept backbone pentru viziune computerizată și ca vision transformer ușor, optimizând echilibrul dintre acuratețea predicțiilor și viteza de inferență. Proiectul se concentrează pe reducerea consumului de resurse pentru implementarea pe dispozitive mobile și hardware de tip edge. Acest lucru este realizat prin utilizarea unor implementări de vision transformer ușoare și a unor arhitecturi care minimizează numărul total de parametri. Codul sursă acoperă o gamă largă de capabilități pentru optimizarea inferenței, inclusiv reducerea costurilor computaționale și a utilizării memoriei. Acesta implementează modele de design structural precum blocuri convoluționale depthwise-separable, convoluții depthwise cu linear-bottleneck și blocuri transformer cu ponderi legate (tied-weight) pentru a reduce latența de inferență.

    Optimizes the execution speed and memory usage of neural network inference for faster live predictions.

    Python
    Vezi pe GitHub↗4,416
  • apachecn/pytorch-doc-zhAvatar apachecn

    apachecn/pytorch-doc-zh

    4,224Vezi pe GitHub↗

    Acest proiect este o traducere în limba chineză a ghidurilor tehnice și a referințelor API pentru framework-ul de deep learning PyTorch. Servește ca o bază de cunoștințe localizată și material de referință pentru a face documentația de deep learning accesibilă vorbitorilor non-nativi de engleză. Documentația acoperă o gamă cuprinzătoare de capabilități PyTorch, inclusiv dezvoltarea modelelor de rețele neuronale, diferențierea automată și implementarea kernel-urilor de backend. Oferă îndrumări detaliate privind strategiile de antrenare distribuită, implementarea modelelor prin formate precum ONNX și C++, precum și diverse tehnici de optimizare și cuantizare a modelelor. Proiectul utilizează un pipeline de traducere condus de comunitate și un model de contribuție distribuit pentru a menține conținutul sincronizat cu versiunile. Materialele tehnice sunt organizate folosind markdown și randate într-un site web navigabil prin generare de site-uri statice.

    Offers methods to reduce memory footprint and execution time by converting models to quantized formats.

    Shelldeep-learningdocumentationpython
    Vezi pe GitHub↗4,224
  • metavoiceio/metavoice-srcAvatar metavoiceio

    metavoiceio/metavoice-src

    4,202Vezi pe GitHub↗

    Acest proiect este un model de bază expresiv de text-to-speech și un sistem de clonare a vocii, conceput pentru a sintetiza vorbirea umană cu nuanțe emoționale și înaltă fidelitate. Acesta funcționează ca un model de vorbire finetunabil care poate genera audio imitând o anumită persoană folosind o mostră de voce de referință. Sistemul se distinge printr-un motor de inferență de înaltă performanță care utilizează caching-ul memoriei și compilarea hardware pentru a reduce latența în timpul procesului de generare audio. De asemenea, permite îmbunătățirea calității sintezei prin antrenarea modelului de limbaj pe seturi de date personalizate constând în fișiere audio și subtitrări corespondente. Framework-ul acoperă domeniile mai largi ale clonării vocale personalizate, sintezei vocale expresive și finetuning-ului modelelor de vorbire.

    Optimizes the execution speed of neural network inference via hardware compilation and memory caching.

    Pythonaideep-learningpytorch
    Vezi pe GitHub↗4,202
  • vectorspacelab/omnigen2Avatar VectorSpaceLab

    VectorSpaceLab/OmniGen2

    4,093Vezi pe GitHub↗

    OmniGen2 este un model unificat de generare de imagini și un model de limbaj mare multimodal conceput pentru a gestiona generarea text-to-image, sarcinile image-to-image și editarea imaginilor în cadrul unui singur framework. Acesta funcționează ca un motor vizual de model de limbaj cauzal capabil să genereze și să editeze imagini pe baza unor input-uri combinate de text și vizuale. Sistemul dispune de compoziție vizuală în context și generare bazată pe subiect, permițându-i să extragă subiecte din imagini de referință și să le plaseze în scene noi. De asemenea, suportă editarea imaginilor bazată pe instrucțiuni, unde obiecte sau stiluri specifice sunt modificate prin comenzi în limbaj natural, păstrând în același timp restul imaginii. Capabilitățile modelului se extind la analiza și raționamentul conținutului vizual, permițând recunoașterea obiectelor prin input-uri combinate de text și viziune. Pentru a îmbunătăți calitatea output-ului, acesta folosește un proces iterativ de rafinare vizuală cu un mecanism de autocorecție. Performanța este gestionată prin optimizarea utilizării VRAM prin descărcarea dinamică a ponderilor și accelerarea vitezei de inferență folosind tehnici de caching.

    Increases generation throughput using caching techniques and adjusted guidance ranges to accelerate model inference.

    Jupyter Notebook
    Vezi pe GitHub↗4,093
  • sandai-org/magi-1Avatar SandAI-org

    SandAI-org/MAGI-1

    3,711Vezi pe GitHub↗

    MAGI-1 is an autoregressive video generation model designed to synthesize high-resolution video sequences from text prompts and image references. It functions as a generative system for text-to-video, image-to-video, and video-to-video transformations. The model utilizes an autoregressive architecture that treats spatio-temporal patches as a sequence of discrete tokens to maintain temporal motion. It employs a variational autoencoder to compress the spatial and temporal dimensions of video data and uses distillation-based step scaling to allow for inference budget control. The system integra

    Provides inference budget control to balance output quality and processing speed via distillation-based step sizes.

    Pythonautoregressivediffusion-modelsvideo-generation
    Vezi pe GitHub↗3,711
  • hkuds/paper2slidesAvatar HKUDS

    HKUDS/Paper2Slides

    3,092Vezi pe GitHub↗

    Paper2Slides is an AI-driven presentation generator and content extractor designed to transform academic papers and scientific documents into structured slides and posters. It utilizes retrieval-augmented generation to distill key data points and identify critical figures while maintaining direct traceability to the original source text. The system functions as an AI slide designer that applies professional themes or custom visual styles defined through natural language. It integrates with external image generation services to produce high-quality visuals and research visualizations for acade

    Optimizes processing speed by allowing a choice between deep semantic indexing for complex papers and a fast mode for short files.

    Pythonagentic-aillm-agentspaper2poster
    Vezi pe GitHub↗3,092
  1. Home
  2. Artificial Intelligence & ML
  3. Token Optimization Utilities
  4. Generation Speed Optimizers

Explorează sub-etichetele

  • Adaptive IndexingOptimization techniques that switch between indexing depths based on document complexity to balance speed and accuracy. **Distinct from Generation Speed Optimizers:** Focuses on switching indexing strategies for document processing rather than reducing GPU passes for LLM inference
  • Cognitive Processing SpeedStrategies to reduce mental translation time for more efficient real-time communication. **Distinct from Generation Speed Optimizers:** Distinct from Generation Speed Optimizers: focuses on human cognitive latency rather than AI model inference speed.
  • Transcription Speed Optimizers1 sub-tagUtilities that choose model size and compute precision to balance transcription accuracy against inference speed on available hardware. **Distinct from Generation Speed Optimizers:** Distinct from Generation Speed Optimizers: focuses on transcription-specific speed/accuracy tradeoffs, not general generation latency.