4 dépôts
Training a single vision model for multiple tasks such as segmentation and depth prediction.
Distinct from Vision Model Training: Focuses on unified multi-task training using guiding codes, rather than single-task vision training.
Explore 4 awesome GitHub repositories matching artificial intelligence & ml · Multi-Task Vision Training. Refine with filters or upvote what's useful.
MMF is a modular framework for building, training, and evaluating vision-and-language models. It provides a configuration-driven experiment system where model, dataset, and training parameters are defined through composable YAML files, alongside a curated model zoo of pretrained checkpoints for state-of-the-art multimodal architectures. The framework includes a multimodal dataset loader that downloads, processes, and batches vision-and-language data, and a vision-language model trainer supporting distributed training, mixed precision, and checkpoint-based resumption. The framework distinguish
Launches distributed training of unified models on configurable sets of vision and language tasks simultaneously.
UniAD est un framework de deep learning unifié pour la conduite autonome qui intègre la perception, la prédiction et la planification dans un seul modèle end-to-end. Il fonctionne comme une architecture de réseau de neurones qui mappe directement les données brutes des capteurs vers des trajectoires de conduite et des plans de mouvement. Ce projet sert d'implémentation de recherche pour une approche orientée planification qui entraîne conjointement des modules d'occupation, de cartographie et de suivi d'objets. Il utilise un framework de perception multi-tâches pour optimiser les performances globales de conduite. Le système couvre un large éventail de capacités, notamment les pipelines de conduite end-to-end, l'optimisation du mouvement des véhicules et l'agrégation de caractéristiques visuelles. Il coordonne diverses tâches de conduite autonome pour affiner l'ensemble du processus de conduite en un seul cycle d'entraînement.
Jointly trains occupancy, mapping, and object tracking modules within a single unified vision model.
OmniGen est un modèle de génération d'images unifié et un framework de diffusion qui traite le texte, les images et les tâches de vision via un système unique. Il fonctionne comme un framework de diffusion multimodal qui traite diverses opérations de vision comme des problèmes de synthèse d'image unifiés en utilisant des poids de modèle partagés, supprimant le besoin de modules adaptateurs externes. Le système prend en charge la génération d'images basée sur le sujet pour préserver l'identité des objets à partir de photos de référence et permet la synthèse d'images multi-références. Il fonctionne également comme un éditeur d'images basé sur des instructions, modifiant le contenu visuel via des prompts en langage naturel. Le framework s'étend aux tâches de vision par ordinateur générative, où des opérations telles que la détection de contours et la reconnaissance de pose sont effectuées en les transformant en tâches de synthèse. Les performances sur des tâches spécifiques peuvent être améliorées via l'affinage des poids du modèle et l'adaptation de bas rang (LoRA).
Treats vision operations like edge detection and pose recognition as unified image synthesis tasks.
This project is a research framework and toolkit designed for training large-scale vision transformers and multimodal language models. It provides a comprehensive suite for vision-language pretraining, enabling the development of models that map images and text into shared latent spaces. The framework is distinguished by its capabilities in high-fidelity image generation and multimodal research, utilizing normalizing flows and variational autoencoders to produce images from text prompts or class labels. It supports the development of both generative and contrastive models, allowing for a wide
Trains unified vision models for segmentation, colorization, and depth prediction using a guiding code approach.