5 repository-uri
Open-source frameworks for training and fine-tuning small vision-language models from scratch or from pretrained components.
Distinct from Vision-Language Training: Distinct from Vision-Language Training: specifically provides a framework for training and fine-tuning, not just the training workflow itself.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Training Frameworks. Refine with filters or upvote what's useful.
Provides an open-source framework for building and fine-tuning small vision-language models.
BLIP is a vision-language model framework that combines contrastive, matching, and language modeling objectives to align images with text. Built on a multimodal encoder-decoder architecture, it supports distributed data-parallel training with cosine learning rate scheduling and sliding-window metric tracking for training stability. The framework provides capabilities for image captioning, visual question answering, and cross-modal retrieval, scoring semantic alignment between images and text through learned embeddings. It includes toolkits for fine-tuning pre-trained models on custom datasets
Provides an open-source framework for training, fine-tuning, and evaluating vision-language models on custom image-text datasets.
nanoVLM este un framework de antrenare și un set de instrumente pentru modele mici de tip vision-language. Oferă un mediu bazat pe PyTorch pentru antrenarea și fine-tuning-ul modelelor, pentru a asocia intrările de imagine cu descrieri textuale și a genera răspunsuri în limbaj natural. Proiectul include un instrument de versionare a modelelor în cloud pentru salvarea și încărcarea ponderilor modelelor în repository-uri centralizate, pentru a sincroniza activele între medii. De asemenea, dispune de o suită dedicată de evaluare pentru a măsura acuratețea și fiabilitatea modelelor vision-language față de seturi de date standard. Framework-ul acoperă planificarea resurselor GPU prin măsurarea consumului VRAM și gestionează stabilitatea antrenării cu persistența stării bazată pe checkpoint-uri și gestionarea memoriei bazată pe batch-uri.
Provides a comprehensive framework for training and fine-tuning small vision-language models.
Open Flamingo este un framework de antrenare a modelelor de limbaj mari multimodale conceput pentru a integra encodere de viziune pre-antrenate cu modele de limbaj. Acesta implementează o arhitectură viziune-limbaj care utilizează straturi de cross-attention pentru a procesa secvențe intercalate de imagini și text. Sistemul este caracterizat prin capabilitățile sale de învățare multimodală few-shot, permițând modelului să se adapteze la noi sarcini vizuale folosind un set mic de exemple imagine-text furnizate în prompt. Suportă învățarea în context și generarea de text multimodal pentru sarcini precum răspunsul la întrebări vizuale și captioning. Framework-ul include un antrenor de model distribuit care utilizează paralelismul datelor și gradient checkpointing pentru optimizarea memoriei pe mai multe GPU-uri. Oferă, de asemenea, utilitare pentru încărcarea seturilor de date multimodale sharded, evaluarea paralelă a modelelor și infrastructură pentru găzduirea modelelor la scară largă pentru inferență.
Offers a framework for training and deploying large-scale models that process interleaved sequences of images and text.
Otter is a framework and toolkit for the pretraining, fine-tuning, and evaluation of vision-language models. It provides a pipeline for training large language models to process high-resolution images and video frames, integrating visual encoders with textual token spaces. The system is designed for multi-visual input processing, allowing models to interpret multiple images or video sequences within a single prompt. It supports multi-round conversation management to maintain context across interactions for detailed scene comprehension and visual reasoning. The framework covers a full develop
Provides a comprehensive framework for pretraining and fine-tuning vision-language models to process high-resolution images and video.