5 repositorios
Open-source frameworks for training and fine-tuning small vision-language models from scratch or from pretrained components.
Distinct from Vision-Language Training: Distinct from Vision-Language Training: specifically provides a framework for training and fine-tuning, not just the training workflow itself.
Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Training Frameworks. Refine with filters or upvote what's useful.
Provides an open-source framework for building and fine-tuning small vision-language models.
BLIP is a vision-language model framework that combines contrastive, matching, and language modeling objectives to align images with text. Built on a multimodal encoder-decoder architecture, it supports distributed data-parallel training with cosine learning rate scheduling and sliding-window metric tracking for training stability. The framework provides capabilities for image captioning, visual question answering, and cross-modal retrieval, scoring semantic alignment between images and text through learned embeddings. It includes toolkits for fine-tuning pre-trained models on custom datasets
Provides an open-source framework for training, fine-tuning, and evaluating vision-language models on custom image-text datasets.
nanoVLM es un framework de entrenamiento y kit de herramientas para modelos pequeños de visión-lenguaje. Proporciona un entorno basado en PyTorch para entrenar y ajustar modelos con el fin de asociar entradas de imagen con descripciones textuales y generar respuestas en lenguaje natural. El proyecto incluye una herramienta de versionado de modelos en la nube para guardar y cargar pesos de modelos en repositorios centralizados, sincronizando activos entre entornos. También cuenta con una suite de evaluación dedicada para medir la precisión y fiabilidad de los modelos de visión-lenguaje frente a datasets de tareas estándar. El framework cubre la planificación de recursos de GPU mediante la medición del consumo de VRAM y gestiona la estabilidad del entrenamiento con persistencia de estado basada en checkpoints y gestión de memoria por lotes.
Provides a comprehensive framework for training and fine-tuning small vision-language models.
Open Flamingo es un framework de entrenamiento de modelos de lenguaje multimodal de gran tamaño diseñado para integrar codificadores de visión preentrenados con modelos de lenguaje. Implementa una arquitectura de visión-lenguaje que utiliza capas de atención cruzada para procesar secuencias intercaladas de imágenes y texto. El sistema se caracteriza por sus capacidades de aprendizaje multimodal few-shot, permitiendo al modelo adaptarse a nuevas tareas visuales utilizando un pequeño conjunto de ejemplos de imagen-texto proporcionados en el prompt. Admite aprendizaje en contexto y generación de texto multimodal para tareas como respuesta a preguntas visuales y subtitulado. El framework incluye un entrenador de modelos distribuido que emplea paralelismo de datos y checkpointing de gradiente para la optimización de memoria a través de múltiples GPUs. También proporciona utilidades para la carga de datasets multimodales fragmentados, evaluación de modelos paralelizada e infraestructura para alojar modelos a gran escala para inferencia.
Offers a framework for training and deploying large-scale models that process interleaved sequences of images and text.
Otter is a framework and toolkit for the pretraining, fine-tuning, and evaluation of vision-language models. It provides a pipeline for training large language models to process high-resolution images and video frames, integrating visual encoders with textual token spaces. The system is designed for multi-visual input processing, allowing models to interpret multiple images or video sequences within a single prompt. It supports multi-round conversation management to maintain context across interactions for detailed scene comprehension and visual reasoning. The framework covers a full develop
Provides a comprehensive framework for pretraining and fine-tuning vision-language models to process high-resolution images and video.