awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 repository-uri

Awesome GitHub RepositoriesTraining Frameworks

Open-source frameworks for training and fine-tuning small vision-language models from scratch or from pretrained components.

Distinct from Vision-Language Training: Distinct from Vision-Language Training: specifically provides a framework for training and fine-tuning, not just the training workflow itself.

Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Training Frameworks. Refine with filters or upvote what's useful.

Awesome Training Frameworks GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • jingyaogong/minimind-vAvatar jingyaogong

    jingyaogong/minimind-v

    6,431Vezi pe GitHub↗

    Provides an open-source framework for building and fine-tuning small vision-language models.

    Pythonartificial-intelligencechatgptvision-language-model
    Vezi pe GitHub↗6,431
  • salesforce/blipAvatar salesforce

    salesforce/BLIP

    5,676Vezi pe GitHub↗

    BLIP is a vision-language model framework that combines contrastive, matching, and language modeling objectives to align images with text. Built on a multimodal encoder-decoder architecture, it supports distributed data-parallel training with cosine learning rate scheduling and sliding-window metric tracking for training stability. The framework provides capabilities for image captioning, visual question answering, and cross-modal retrieval, scoring semantic alignment between images and text through learned embeddings. It includes toolkits for fine-tuning pre-trained models on custom datasets

    Provides an open-source framework for training, fine-tuning, and evaluating vision-language models on custom image-text datasets.

    Jupyter Notebookimage-captioningimage-text-retrievalvision-and-language-pre-training
    Vezi pe GitHub↗5,676
  • huggingface/nanovlmAvatar huggingface

    huggingface/nanoVLM

    4,917Vezi pe GitHub↗

    nanoVLM este un framework de antrenare și un set de instrumente pentru modele mici de tip vision-language. Oferă un mediu bazat pe PyTorch pentru antrenarea și fine-tuning-ul modelelor, pentru a asocia intrările de imagine cu descrieri textuale și a genera răspunsuri în limbaj natural. Proiectul include un instrument de versionare a modelelor în cloud pentru salvarea și încărcarea ponderilor modelelor în repository-uri centralizate, pentru a sincroniza activele între medii. De asemenea, dispune de o suită dedicată de evaluare pentru a măsura acuratețea și fiabilitatea modelelor vision-language față de seturi de date standard. Framework-ul acoperă planificarea resurselor GPU prin măsurarea consumului VRAM și gestionează stabilitatea antrenării cu persistența stării bazată pe checkpoint-uri și gestionarea memoriei bazată pe batch-uri.

    Provides a comprehensive framework for training and fine-tuning small vision-language models.

    Python
    Vezi pe GitHub↗4,917
  • mlfoundations/open_flamingoAvatar mlfoundations

    mlfoundations/open_flamingo

    4,107Vezi pe GitHub↗

    Open Flamingo este un framework de antrenare a modelelor de limbaj mari multimodale conceput pentru a integra encodere de viziune pre-antrenate cu modele de limbaj. Acesta implementează o arhitectură viziune-limbaj care utilizează straturi de cross-attention pentru a procesa secvențe intercalate de imagini și text. Sistemul este caracterizat prin capabilitățile sale de învățare multimodală few-shot, permițând modelului să se adapteze la noi sarcini vizuale folosind un set mic de exemple imagine-text furnizate în prompt. Suportă învățarea în context și generarea de text multimodal pentru sarcini precum răspunsul la întrebări vizuale și captioning. Framework-ul include un antrenor de model distribuit care utilizează paralelismul datelor și gradient checkpointing pentru optimizarea memoriei pe mai multe GPU-uri. Oferă, de asemenea, utilitare pentru încărcarea seturilor de date multimodale sharded, evaluarea paralelă a modelelor și infrastructură pentru găzduirea modelelor la scară largă pentru inferență.

    Offers a framework for training and deploying large-scale models that process interleaved sequences of images and text.

    Pythoncomputer-visiondeep-learningflamingo
    Vezi pe GitHub↗4,107
  • evolvinglmms-lab/otterAvatar EvolvingLMMs-Lab

    EvolvingLMMs-Lab/Otter

    3,331Vezi pe GitHub↗

    Otter is a framework and toolkit for the pretraining, fine-tuning, and evaluation of vision-language models. It provides a pipeline for training large language models to process high-resolution images and video frames, integrating visual encoders with textual token spaces. The system is designed for multi-visual input processing, allowing models to interpret multiple images or video sequences within a single prompt. It supports multi-round conversation management to maintain context across interactions for detailed scene comprehension and visual reasoning. The framework covers a full develop

    Provides a comprehensive framework for pretraining and fine-tuning vision-language models to process high-resolution images and video.

    Pythonartificial-inteligencechatgptdeep-learning
    Vezi pe GitHub↗3,331
  1. Home
  2. Artificial Intelligence & ML
  3. Model Training Frameworks
  4. Vision Model Training
  5. Vision-Language Training
  6. Training Frameworks