5 Repos
Open-source frameworks for training and fine-tuning small vision-language models from scratch or from pretrained components.
Distinct from Vision-Language Training: Distinct from Vision-Language Training: specifically provides a framework for training and fine-tuning, not just the training workflow itself.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Training Frameworks. Refine with filters or upvote what's useful.
Provides an open-source framework for building and fine-tuning small vision-language models.
BLIP is a vision-language model framework that combines contrastive, matching, and language modeling objectives to align images with text. Built on a multimodal encoder-decoder architecture, it supports distributed data-parallel training with cosine learning rate scheduling and sliding-window metric tracking for training stability. The framework provides capabilities for image captioning, visual question answering, and cross-modal retrieval, scoring semantic alignment between images and text through learned embeddings. It includes toolkits for fine-tuning pre-trained models on custom datasets
Provides an open-source framework for training, fine-tuning, and evaluating vision-language models on custom image-text datasets.
nanoVLM ist ein Trainings-Framework und Toolkit für kleine Vision-Language-Modelle. Es bietet eine auf PyTorch basierende Umgebung zum Trainieren und Fine-Tuning von Modellen, um Bild-Inputs mit Textbeschreibungen zu verknüpfen und natürlichsprachliche Antworten zu generieren. Das Projekt enthält ein Cloud-Modell-Versionierungstool zum Speichern und Laden von Modellgewichten in zentralen Repositories, um Assets über Umgebungen hinweg zu synchronisieren. Es bietet zudem eine dedizierte Evaluierungssuite zur Messung der Genauigkeit und Zuverlässigkeit von Vision-Language-Modellen anhand von Standard-Aufgabendatensätzen. Das Framework deckt die GPU-Ressourcenplanung durch Messung des VRAM-Verbrauchs ab und verwaltet die Trainingsstabilität mit checkpoint-basierter Zustandspersistenz und batch-basiertem Speichermanagement.
Provides a comprehensive framework for training and fine-tuning small vision-language models.
Open Flamingo ist ein multimodales Large-Language-Model-Trainingsframework, das darauf ausgelegt ist, vortrainierte Vision-Encoder mit Sprachmodellen zu integrieren. Es implementiert eine Vision-Language-Architektur, die Cross-Attention-Layer nutzt, um verschachtelte Sequenzen von Bildern und Text zu verarbeiten. Das System zeichnet sich durch seine Few-Shot-multimodalen Lernfähigkeiten aus, die es dem Modell ermöglichen, sich mit einer kleinen Menge an Bild-Text-Beispielen im Prompt an neue visuelle Aufgaben anzupassen. Es unterstützt In-Context-Learning und multimodale Textgenerierung für Aufgaben wie visuelle Fragenbeantwortung (VQA) und Captioning. Das Framework enthält einen verteilten Modell-Trainer, der Datenparallelität und Gradient-Checkpointing zur Speicheroptimierung über mehrere GPUs hinweg einsetzt. Es bietet zudem Utilities für das Laden geshardeter multimodaler Datensätze, parallelisierte Modellevaluierung und Infrastruktur zum Hosten großskaliger Modelle für die Inferenz.
Offers a framework for training and deploying large-scale models that process interleaved sequences of images and text.
Otter is a framework and toolkit for the pretraining, fine-tuning, and evaluation of vision-language models. It provides a pipeline for training large language models to process high-resolution images and video frames, integrating visual encoders with textual token spaces. The system is designed for multi-visual input processing, allowing models to interpret multiple images or video sequences within a single prompt. It supports multi-round conversation management to maintain context across interactions for detailed scene comprehension and visual reasoning. The framework covers a full develop
Provides a comprehensive framework for pretraining and fine-tuning vision-language models to process high-resolution images and video.