awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetÀ proposNotre méthodologiePresseServeur MCP
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
huggingface avatar

huggingface/nanoVLM

0
View on GitHub↗
4,917 stars·497 forks·Python·Apache-2.0·14 vues

NanoVLM

nanoVLM est un framework d'entraînement et une boîte à outils pour les petits modèles vision-langage. Il fournit un environnement basé sur PyTorch pour entraîner et affiner des modèles afin d'associer des entrées d'image à des descriptions textuelles et de générer des réponses en langage naturel.

Le projet inclut un outil de versioning de modèles dans le cloud pour enregistrer et charger les poids des modèles vers des dépôts centralisés afin de synchroniser les ressources entre les environnements. Il dispose également d'une suite d'évaluation dédiée pour mesurer la précision et la fiabilité des modèles vision-langage par rapport à des jeux de données de tâches standard.

Le framework couvre la planification des ressources GPU via la mesure de la consommation VRAM et gère la stabilité de l'entraînement avec la persistance d'état basée sur des points de contrôle et la gestion de la mémoire par lots.

Features

  • Training Frameworks - Provides a comprehensive framework for training and fine-tuning small vision-language models.
  • Vision-Language Training - Implements specialized training workflows for models that process both visual and textual data.
  • PyTorch Training Frameworks - Provides a high-level structure and utility for executing the training of PyTorch-based models.
  • PyTorch Vision Model Trainers - Provides a PyTorch-based environment for optimizing weights and measuring GPU memory during training.
  • Vision-Language Inference - Processes combined image and text inputs to generate analytical natural language text.
  • Visual-Language Multimodal Integration - Integrates visual feature extractors with language models in a shared embedding space for multimodal processing.
  • Visual Question Answering - Generates natural language answers and descriptive captions based on visual content.
  • Small VLM Fine-Tuning - Provides streamlined scripts for training and adapting small vision-language models to specific datasets.
  • Model Performance Evaluators - Quantifies model accuracy and reliability by comparing predictions against ground truth labels.
  • Training Checkpoint Persistence - Provides persistence for model weights and trainer states to ensure fault tolerance and training recovery.
  • VRAM Planning Tools - Calculates peak VRAM usage for different model configurations to determine required training hardware.
  • Multi-Dataset Vision-Language Evaluators - Evaluates pretrained models across multiple vision-and-language datasets to report task accuracy.
  • Model Asset Versioning - Interfaces with remote repositories to store and retrieve model weights for consistent multi-environment deployment.
  • Model Version Synchronizers - Synchronizes AI model weights across different development environments via cloud repositories.
  • Model Asset Synchronizers - Synchronizes model weights and vocabulary files from remote repositories to local environments.
  • VRAM Usage Analysis - Calculates memory requirements for tensors and activations to optimize GPU batch sizes.
  • GPU Block Memory Management - Implements GPU memory management to balance data throughput with available video memory.
  • Vision-Language Model Benchmarking - Evaluates the accuracy and reasoning of vision-language models against standard benchmark datasets.
  • Evaluation Pipelines - Runs models against standardized benchmarks to measure quantitative performance metrics.
  • Small Multimodal Models - Small-scale vision-language model.
  • Small Vision Models - Compact vision-language model for efficient deployment.

Historique des stars

Graphique de l'historique des stars pour huggingface/nanovlmGraphique de l'historique des stars pour huggingface/nanovlm

Recherche par IA

Explorez plus de dépôts awesome

Décrivez vos besoins en langage naturel — l'IA classe des milliers de projets open source sélectionnés par pertinence.

Start searching with AI

Alternatives open source à NanoVLM

Projets open source similaires, classés selon le nombre de fonctionnalités partagées avec NanoVLM.
  • jingyaogong/minimind-vAvatar de jingyaogong

    jingyaogong/minimind-v

    6,431Voir sur GitHub↗
    Pythonartificial-intelligencechatgptvision-language-model
    Voir sur GitHub↗6,431
  • facebookresearch/mmfAvatar de facebookresearch

    facebookresearch/mmf

    5,635Voir sur GitHub↗

    MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a configuration-driven experiment system where model, dataset, and training parameters are defined through composable YAML files, alongside a curated model zoo of pretrained checkpoints for state-of-the-art multimodal architectures. The framework includes a multimodal dataset loader that downloads, processes, and batches vision-and-language data, and a vision-language model trainer supporting distributed training, mixed precision, and checkpoint-based resumption. The framework distinguish

    Pythoncaptioningdeep-learningdialog
    Voir sur GitHub↗5,635
  • salesforce/blipAvatar de salesforce

    salesforce/BLIP

    5,676Voir sur GitHub↗

    BLIP is a vision-language model framework that combines contrastive, matching, and language modeling objectives to align images with text. Built on a multimodal encoder-decoder architecture, it supports distributed data-parallel training with cosine learning rate scheduling and sliding-window metric tracking for training stability. The framework provides capabilities for image captioning, visual question answering, and cross-modal retrieval, scoring semantic alignment between images and text through learned embeddings. It includes toolkits for fine-tuning pre-trained models on custom datasets

    Jupyter Notebookimage-captioningimage-text-retrievalvision-and-language-pre-training
    Voir sur GitHub↗5,676
  • apple/ml-fastvlmAvatar de apple

    apple/ml-fastvlm

    7,375Voir sur GitHub↗

    This project is a vision language model framework and vision-to-text pipeline designed for deploying and optimizing models that process both images and text. It provides an on-device inference engine and a vision language model framework to run quantized models locally on mobile and desktop hardware accelerators. The framework features a model quantization toolkit to reduce weight precision for lower memory footprints and increased execution speed on specialized silicon. It also includes an efficient vision encoder utilizing a hybrid encoding system to compress image tokens, which reduces pro

    Python
    Voir sur GitHub↗7,375
Voir les 30 alternatives à NanoVLM→

Questions fréquentes

Que fait huggingface/nanovlm ?

nanoVLM est un framework d'entraînement et une boîte à outils pour les petits modèles vision-langage. Il fournit un environnement basé sur PyTorch pour entraîner et affiner des modèles afin d'associer des entrées d'image à des descriptions textuelles et de générer des réponses en langage naturel.

Quelles sont les fonctionnalités principales de huggingface/nanovlm ?

Les fonctionnalités principales de huggingface/nanovlm sont : Training Frameworks, Vision-Language Training, PyTorch Training Frameworks, PyTorch Vision Model Trainers, Vision-Language Inference, Visual-Language Multimodal Integration, Visual Question Answering, Small VLM Fine-Tuning.

Quelles sont les alternatives open-source à huggingface/nanovlm ?

Les alternatives open-source à huggingface/nanovlm incluent : jingyaogong/minimind-v. facebookresearch/mmf — MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a… salesforce/blip — BLIP is a vision-language model framework that combines contrastive, matching, and language modeling objectives to… apple/ml-fastvlm — This project is a vision language model framework and vision-to-text pipeline designed for deploying and optimizing… thudm/cogvlm — CogVLM is a multimodal large language model designed to integrate visual and textual data for reasoning about images… pytorch/ignite — Ignite is a high-level training framework for PyTorch neural networks that serves as a training engine and deep…