awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

4 dépôts

Awesome GitHub RepositoriesMulti-Task Vision Training

Training a single vision model for multiple tasks such as segmentation and depth prediction.

Distinct from Vision Model Training: Focuses on unified multi-task training using guiding codes, rather than single-task vision training.

Explore 4 awesome GitHub repositories matching artificial intelligence & ml · Multi-Task Vision Training. Refine with filters or upvote what's useful.

Awesome Multi-Task Vision Training GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • facebookresearch/mmfAvatar de facebookresearch

    facebookresearch/mmf

    5,635Voir sur GitHub↗

    MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a configuration-driven experiment system where model, dataset, and training parameters are defined through composable YAML files, alongside a curated model zoo of pretrained checkpoints for state-of-the-art multimodal architectures. The framework includes a multimodal dataset loader that downloads, processes, and batches vision-and-language data, and a vision-language model trainer supporting distributed training, mixed precision, and checkpoint-based resumption. The framework distinguish

    Launches distributed training of unified models on configurable sets of vision and language tasks simultaneously.

    Pythoncaptioningdeep-learningdialog
    Voir sur GitHub↗5,635
  • opendrivelab/uniadAvatar de OpenDriveLab

    OpenDriveLab/UniAD

    4,645Voir sur GitHub↗

    UniAD est un framework de deep learning unifié pour la conduite autonome qui intègre la perception, la prédiction et la planification dans un seul modèle end-to-end. Il fonctionne comme une architecture de réseau de neurones qui mappe directement les données brutes des capteurs vers des trajectoires de conduite et des plans de mouvement. Ce projet sert d'implémentation de recherche pour une approche orientée planification qui entraîne conjointement des modules d'occupation, de cartographie et de suivi d'objets. Il utilise un framework de perception multi-tâches pour optimiser les performances globales de conduite. Le système couvre un large éventail de capacités, notamment les pipelines de conduite end-to-end, l'optimisation du mouvement des véhicules et l'agrégation de caractéristiques visuelles. Il coordonne diverses tâches de conduite autonome pour affiner l'ensemble du processus de conduite en un seul cycle d'entraînement.

    Jointly trains occupancy, mapping, and object tracking modules within a single unified vision model.

    Pythonautonomous-drivingautonomous-driving-frameworkbev-segmentation
    Voir sur GitHub↗4,645
  • vectorspacelab/omnigenAvatar de VectorSpaceLab

    VectorSpaceLab/OmniGen

    4,326Voir sur GitHub↗

    OmniGen est un modèle de génération d'images unifié et un framework de diffusion qui traite le texte, les images et les tâches de vision via un système unique. Il fonctionne comme un framework de diffusion multimodal qui traite diverses opérations de vision comme des problèmes de synthèse d'image unifiés en utilisant des poids de modèle partagés, supprimant le besoin de modules adaptateurs externes. Le système prend en charge la génération d'images basée sur le sujet pour préserver l'identité des objets à partir de photos de référence et permet la synthèse d'images multi-références. Il fonctionne également comme un éditeur d'images basé sur des instructions, modifiant le contenu visuel via des prompts en langage naturel. Le framework s'étend aux tâches de vision par ordinateur générative, où des opérations telles que la détection de contours et la reconnaissance de pose sont effectuées en les transformant en tâches de synthèse. Les performances sur des tâches spécifiques peuvent être améliorées via l'affinage des poids du modèle et l'adaptation de bas rang (LoRA).

    Treats vision operations like edge detection and pose recognition as unified image synthesis tasks.

    Jupyter Notebookdiffusionimageimage-edit
    Voir sur GitHub↗4,326
  • google-research/big_visionAvatar de google-research

    google-research/big_vision

    3,363Voir sur GitHub↗

    This project is a research framework and toolkit designed for training large-scale vision transformers and multimodal language models. It provides a comprehensive suite for vision-language pretraining, enabling the development of models that map images and text into shared latent spaces. The framework is distinguished by its capabilities in high-fidelity image generation and multimodal research, utilizing normalizing flows and variational autoencoders to produce images from text prompts or class labels. It supports the development of both generative and contrastive models, allowing for a wide

    Trains unified vision models for segmentation, colorization, and depth prediction using a guiding code approach.

    Jupyter Notebook
    Voir sur GitHub↗3,363
  1. Home
  2. Artificial Intelligence & ML
  3. Model Training Frameworks
  4. Vision Model Training
  5. Multi-Task Vision Training

Explorer les sous-tags

  • Unified Vision SynthesisExecuting multiple computer vision tasks by treating them as unified image synthesis problems. **Distinct from Multi-Task Vision Training:** Unlike general multi-task training, this specifically maps all vision outputs as synthesized images.
  • Vision-Language Multi-Task TrainersLaunches distributed training of a unified model on a configurable set of vision and language tasks simultaneously. **Distinct from Multi-Task Vision Training:** Distinct from Multi-Task Vision Training: extends multi-task training to include both vision and language tasks, not just vision-only tasks.