awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 repositorios

Awesome GitHub RepositoriesTraining Frameworks

Open-source frameworks for training and fine-tuning small vision-language models from scratch or from pretrained components.

Distinct from Vision-Language Training: Distinct from Vision-Language Training: specifically provides a framework for training and fine-tuning, not just the training workflow itself.

Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Training Frameworks. Refine with filters or upvote what's useful.

Awesome Training Frameworks GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • jingyaogong/minimind-vAvatar de jingyaogong

    jingyaogong/minimind-v

    6,431Ver en GitHub↗

    Provides an open-source framework for building and fine-tuning small vision-language models.

    Pythonartificial-intelligencechatgptvision-language-model
    Ver en GitHub↗6,431
  • salesforce/blipAvatar de salesforce

    salesforce/BLIP

    5,676Ver en GitHub↗

    BLIP is a vision-language model framework that combines contrastive, matching, and language modeling objectives to align images with text. Built on a multimodal encoder-decoder architecture, it supports distributed data-parallel training with cosine learning rate scheduling and sliding-window metric tracking for training stability. The framework provides capabilities for image captioning, visual question answering, and cross-modal retrieval, scoring semantic alignment between images and text through learned embeddings. It includes toolkits for fine-tuning pre-trained models on custom datasets

    Provides an open-source framework for training, fine-tuning, and evaluating vision-language models on custom image-text datasets.

    Jupyter Notebookimage-captioningimage-text-retrievalvision-and-language-pre-training
    Ver en GitHub↗5,676
  • huggingface/nanovlmAvatar de huggingface

    huggingface/nanoVLM

    4,917Ver en GitHub↗

    nanoVLM es un framework de entrenamiento y kit de herramientas para modelos pequeños de visión-lenguaje. Proporciona un entorno basado en PyTorch para entrenar y ajustar modelos con el fin de asociar entradas de imagen con descripciones textuales y generar respuestas en lenguaje natural. El proyecto incluye una herramienta de versionado de modelos en la nube para guardar y cargar pesos de modelos en repositorios centralizados, sincronizando activos entre entornos. También cuenta con una suite de evaluación dedicada para medir la precisión y fiabilidad de los modelos de visión-lenguaje frente a datasets de tareas estándar. El framework cubre la planificación de recursos de GPU mediante la medición del consumo de VRAM y gestiona la estabilidad del entrenamiento con persistencia de estado basada en checkpoints y gestión de memoria por lotes.

    Provides a comprehensive framework for training and fine-tuning small vision-language models.

    Python
    Ver en GitHub↗4,917
  • mlfoundations/open_flamingoAvatar de mlfoundations

    mlfoundations/open_flamingo

    4,107Ver en GitHub↗

    Open Flamingo es un framework de entrenamiento de modelos de lenguaje multimodal de gran tamaño diseñado para integrar codificadores de visión preentrenados con modelos de lenguaje. Implementa una arquitectura de visión-lenguaje que utiliza capas de atención cruzada para procesar secuencias intercaladas de imágenes y texto. El sistema se caracteriza por sus capacidades de aprendizaje multimodal few-shot, permitiendo al modelo adaptarse a nuevas tareas visuales utilizando un pequeño conjunto de ejemplos de imagen-texto proporcionados en el prompt. Admite aprendizaje en contexto y generación de texto multimodal para tareas como respuesta a preguntas visuales y subtitulado. El framework incluye un entrenador de modelos distribuido que emplea paralelismo de datos y checkpointing de gradiente para la optimización de memoria a través de múltiples GPUs. También proporciona utilidades para la carga de datasets multimodales fragmentados, evaluación de modelos paralelizada e infraestructura para alojar modelos a gran escala para inferencia.

    Offers a framework for training and deploying large-scale models that process interleaved sequences of images and text.

    Pythoncomputer-visiondeep-learningflamingo
    Ver en GitHub↗4,107
  • evolvinglmms-lab/otterAvatar de EvolvingLMMs-Lab

    EvolvingLMMs-Lab/Otter

    3,331Ver en GitHub↗

    Otter is a framework and toolkit for the pretraining, fine-tuning, and evaluation of vision-language models. It provides a pipeline for training large language models to process high-resolution images and video frames, integrating visual encoders with textual token spaces. The system is designed for multi-visual input processing, allowing models to interpret multiple images or video sequences within a single prompt. It supports multi-round conversation management to maintain context across interactions for detailed scene comprehension and visual reasoning. The framework covers a full develop

    Provides a comprehensive framework for pretraining and fine-tuning vision-language models to process high-resolution images and video.

    Pythonartificial-inteligencechatgptdeep-learning
    Ver en GitHub↗3,331
  1. Home
  2. Artificial Intelligence & ML
  3. Model Training Frameworks
  4. Vision Model Training
  5. Vision-Language Training
  6. Training Frameworks