awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

18 dépôts

Awesome GitHub RepositoriesMulti-Task Learning Models

Model architectures that share input-output sequences to perform multiple distinct tasks simultaneously.

Explore 18 awesome GitHub repositories matching artificial intelligence & ml · Multi-Task Learning Models. Refine with filters or upvote what's useful.

Awesome Multi-Task Learning Models GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • openai/whisperAvatar de openai

    openai/whisper

    102,828Voir sur GitHub↗

    This project is a speech recognition and translation engine that utilizes a sequence-to-sequence transformer architecture to convert audio into text. It is built upon a weakly supervised learning framework, which leverages large-scale, unlabelled audio-transcript data to create generalized speech representations capable of performing simultaneous transcription, language identification, and translation. The system distinguishes itself through a unified multi-task modeling approach that shares token sequences across different objectives, allowing it to handle diverse languages and vocabularies

    Coordinates speech recognition, translation, and language identification simultaneously by sharing input-output sequences within a single model.

    Python
    Voir sur GitHub↗102,828
  • twitter/the-algorithmAvatar de twitter

    twitter/the-algorithm

    73,422Voir sur GitHub↗

    The algorithm is a distributed recommendation engine pipeline designed to construct and serve personalized content timelines. It functions as a multi-stage orchestration layer that aggregates candidate content from diverse social graphs and high-dimensional embedding spaces, processing user interaction data to deliver a unified, ranked experience. The system utilizes a high-performance machine learning serving infrastructure to execute deep learning models that predict engagement probabilities in real-time. It distinguishes itself through a hybrid retrieval strategy that combines graph-traver

    Shares model architectures to predict multiple engagement signals simultaneously for optimized content relevance.

    Scala
    Voir sur GitHub↗73,422
  • d2l-ai/d2l-enAvatar de d2l-ai

    d2l-ai/d2l-en

    29,001Voir sur GitHub↗

    This project is an educational platform and research toolkit designed to teach deep learning through a combination of mathematical theory, visual diagrams, and executable code. It provides a comprehensive environment for building, training, and evaluating neural networks, grounding complex concepts in interactive computational notebooks that allow for hands-on experimentation. The framework distinguishes itself by interleaving theoretical foundations—including linear algebra, calculus, and probability—with practical implementations across multiple industry-standard libraries. It supports flex

    Enables task execution by conditioning model output on prompts and examples without requiring parameter updates.

    Pythonbookcomputer-visiondata-science
    Voir sur GitHub↗29,001
  • uber/ludwigAvatar de uber

    uber/ludwig

    11,718Voir sur GitHub↗

    Ludwig is a declarative machine learning framework designed for training neural networks and large language models using configuration files instead of manual coding. It functions as a multimodal model builder and a low-code tool for supervised fine-tuning, allowing users to build models that process mixed inputs of text, images, audio, and tabular data. The project distinguishes itself through an automated hyperparameter optimizer and a system for large language model fine-tuning using parameter-efficient adapters. It features a multimodal data pipeline and the ability to automatically gener

    Enables the training of a single model to predict multiple output features simultaneously.

    Python
    Voir sur GitHub↗11,718
  • shenweichen/deepctrAvatar de shenweichen

    shenweichen/DeepCTR

    8,039Voir sur GitHub↗

    DeepCTR is a specialized software framework and deep learning model library designed for predicting click-through rates and implementing recommendation systems. It provides a suite of tabular data models and architectures tailored for binary classification and sparse feature processing. The framework includes dedicated toolkits for multi-task learning and sequential interest modeling. It allows for the simultaneous estimation of multiple related targets through shared-bottom and gated expert neural networks, while capturing evolving user behavior using attention mechanisms and transformers.

    Implements model architectures that predict multiple related targets, such as click and conversion rates, simultaneously.

    Pythonautointclick-through-ratectr
    Voir sur GitHub↗8,039
  • priorlabs/tabpfnAvatar de PriorLabs

    PriorLabs/TabPFN

    7,408Voir sur GitHub↗

    Performs inference by processing training examples as context within the transformer's attention window.

    Pythondata-sciencefoundation-modelsmachine-learning
    Voir sur GitHub↗7,408
  • qwenlm/qwen-imageAvatar de QwenLM

    QwenLM/Qwen-Image

    7,379Voir sur GitHub↗

    Qwen-Image is a text-to-image model and large language model image generation framework. It functions as an AI image editing suite and a personalized image trainer, capable of producing high-fidelity visuals and accurate typography from natural language descriptions. The system is distinguished by its precision text rendering engine, which integrates multi-script calligraphy and layout-coherent alphabetic text into images. It provides specialized capabilities for subject identity preservation and consistent subject generation across different poses and viewpoints, alongside a training pipelin

    Utilizes a multi-task training objective to simultaneously optimize for diverse editing and generation tasks.

    Python
    Voir sur GitHub↗7,379
  • google-research/text-to-text-transfer-transformerAvatar de google-research

    google-research/text-to-text-transfer-transformer

    6,528Voir sur GitHub↗

    Il s'agit d'un framework de machine learning pour traiter diverses tâches de traitement du langage naturel comme un problème unifié de texte-à-texte. Il fournit une boîte à outils pour le pré-entraînement et le fine-tuning de modèles transformer à grande échelle, utilisant un système où à la fois les entrées et les sorties sont formatées comme des séquences de texte brut. Le framework se distingue par son système d'entraînement distribué, qui utilise des stratégies basées sur des maillages pour mettre à l'échelle les poids des modèles et les lots d'entraînement à travers de multiples cœurs TPU. Il supporte l'apprentissage multi-tâches en combinant divers datasets dans un flux d'entraînement unique en utilisant des taux de mélange configurables, permettant à un modèle unique de gérer diverses tâches linguistiques. Le système couvre un large éventail de capacités, incluant les architectures encodeur-décodeur, le décodage par recherche en faisceau (beam-search) pour la génération de texte, et les workflows de transfert learning. Il inclut des utilitaires pour la préparation de datasets NLP, l'évaluation de la performance des modèles et l'exportation de points de contrôle entraînés pour la mise en production. La bibliothèque supporte le chargement de points de contrôle de modèles pré-entraînés de diverses tailles pour accélérer le développement.

    Implements a model architecture that shares input-output sequences to perform multiple distinct language tasks simultaneously.

    Python
    Voir sur GitHub↗6,528
  • facebookresearch/sapiensAvatar de facebookresearch

    facebookresearch/sapiens

    5,388Voir sur GitHub↗

    Sapiens est un modèle de vision humaine haute résolution conçu pour des tâches de vision par ordinateur centrées sur l'humain de haute précision. Il fonctionne comme une suite d'outils pour estimer la pose humaine, la profondeur et la géométrie de surface. Le projet utilise une architecture vision transformer comme backbone pour effectuer plusieurs tâches via un encodeur partagé. Cette architecture permet la prédiction simultanée des structures squelettiques, des emplacements des articulations et de la distance entre une caméra et un sujet humain. Les capacités du modèle couvrent la segmentation des parties du corps humain pour isoler les régions anatomiques des arrière-plans et la prédiction des normales de surface pour récupérer les détails géométriques 3D à partir d'images 2D. Ces tâches sont soutenues par un framework d'apprentissage multi-tâches qui utilise la régression au niveau des pixels et le masquage par segmentation sémantique.

    Employs a shared encoder architecture to simultaneously perform depth, pose, and segmentation tasks.

    Python
    Voir sur GitHub↗5,388
  • py-why/econmlAvatar de py-why

    py-why/EconML

    4,683Voir sur GitHub↗

    EconML est une bibliothèque Python pour l'inférence causale conçue pour estimer les effets de traitement hétérogènes en utilisant une combinaison de machine learning et d'économétrie. Elle sert de boîte à outils pour calculer les effets de traitement moyens conditionnels afin de déterminer comment des interventions spécifiques impactent des individus ou des sous-groupes. Le projet fournit un framework pour le double machine learning et le machine learning orthogonal afin d'isoler les signaux causaux des facteurs de confusion de haute dimension. Il inclut des implémentations spécialisées pour les forêts causales et les apprenants à variables instrumentales, permettant la récupération de relations causales même en présence de facteurs de confusion non observés. La bibliothèque couvre un large éventail de capacités, notamment la validation de modèles causaux via des tests de réfutation et des courbes de calibration, la construction de politiques de traitement personnalisées et l'analyse de régimes de traitement dynamiques. Elle prend également en charge l'inférence statistique pour la quantification de l'incertitude et l'interprétation de l'hétérogénéité des effets en utilisant des modèles basés sur des arbres et des valeurs de Shapley. Le projet est principalement implémenté et démontré via des Jupyter Notebooks.

    Fits a multi-task linear model with L1 regularization and sample weights to handle biased observational data.

    Jupyter Notebookcausal-inferencecausalityeconometrics
    Voir sur GitHub↗4,683
  • alibaba/x-deeplearningAvatar de alibaba

    alibaba/x-deeplearning

    4,301Voir sur GitHub↗

    Ce projet est une plateforme d'apprentissage automatique distribué et un framework d'apprentissage profond creux (sparse) conçu pour entraîner et servir des modèles avec des données creuses de haute dimension. Il fonctionne comme une infrastructure de service de modèles en ligne et un moteur de système de recommandation, permettant la récupération et le scoring d'éléments en temps réel en utilisant le deep tree matching et les réseaux de neurones. Le système se distingue par un framework d'apprentissage multi-tâches qui optimise plusieurs fonctions objectives au sein d'un espace de représentation partagé. Il dispose d'une infrastructure de service en ligne spécialisée qui prend en charge le chargement à chaud dynamique des modèles et la transformation des checkpoints standard en un format optimisé personnalisé pour une inférence haute performance. La plateforme couvre un large éventail de capacités, incluant la gestion distribuée des paramètres pour mettre à l'échelle l'entraînement sur plusieurs travailleurs, le calcul d'embeddings creux pour les caractéristiques catégorielles, et la récupération neuronale basée sur des arbres pour les catalogues à grande échelle. Elle fournit également des outils pour la gestion de l'entraînement en flux continu, le contrôle du cycle de vie des caractéristiques via des seuils de probabilité, et le profilage de performance pour identifier les goulots d'étranglement d'exécution. Le projet inclut une interface d'entraînement unifiée et une intégration de framework backend pour standardiser l'exécution des tâches d'entraînement, de prédiction et d'évaluation.

    Optimizes multiple objective functions simultaneously using a shared representation space within a single model.

    PureBasic
    Voir sur GitHub↗4,301
  • mlfoundations/open_flamingoAvatar de mlfoundations

    mlfoundations/open_flamingo

    4,107Voir sur GitHub↗

    Open Flamingo est un framework d'entraînement de modèles de langage étendus multimodaux conçu pour intégrer des encodeurs de vision pré-entraînés avec des modèles de langage. Il implémente une architecture vision-langage qui utilise des couches d'attention croisée pour traiter des séquences entrelacées d'images et de texte. Le système se caractérise par ses capacités d'apprentissage multimodal few-shot, permettant au modèle de s'adapter à de nouvelles tâches visuelles en utilisant un petit ensemble d'exemples image-texte fournis dans l'invite. Il prend en charge l'apprentissage en contexte et la génération de texte multimodal pour des tâches telles que la réponse aux questions visuelles et le sous-titrage. Le framework inclut un entraîneur de modèle distribué qui emploie le parallélisme des données et le gradient checkpointing pour l'optimisation de la mémoire sur plusieurs GPU. Il fournit également des utilitaires pour le chargement de jeux de données multimodaux fragmentés, l'évaluation de modèles parallélisés et une infrastructure pour héberger des modèles à grande échelle pour l'inférence.

    Performs new tasks by providing few-shot examples of image-text pairs without modifying underlying model parameters.

    Pythoncomputer-visiondeep-learningflamingo
    Voir sur GitHub↗4,107
  • defog-ai/sqlcoderAvatar de defog-ai

    defog-ai/sqlcoder

    4,035Voir sur GitHub↗

    Sqlcoder est un modèle de langage (LLM) text-to-SQL spécialisé dans la conversion de questions en langage naturel en requêtes de base de données structurées et exécutables. Il fonctionne comme une interface de base de données et un générateur de requêtes permettant la récupération de données sans nécessiter de code manuel. Le système utilise un modèle ajusté par instructions combiné à une incitation (prompting) consciente du schéma et à une injection de contexte dynamique. En ingérant les métadonnées de la base de données et en utilisant l'apprentissage en contexte avec des paires de requêtes exemples, il génère des requêtes syntaxiquement valides qui correspondent au schéma spécifique de la base de données connectée. Le projet couvre un éventail plus large de capacités, notamment l'automatisation de la business intelligence et l'analyse de données en libre-service. Il fournit une infrastructure pour la gestion des connexions aux bases de données et une interface visuelle pour l'exécution des requêtes et l'ingestion des métadonnées.

    Uses few-shot prompting with example query pairs to guide the model toward correct SQL dialects.

    Jupyter Notebook
    Voir sur GitHub↗4,035
  • ashishpatel26/andrew-ng-notesAvatar de ashishpatel26

    ashishpatel26/Andrew-NG-Notes

    3,594Voir sur GitHub↗

    This project is a collection of structured study notes and notebooks serving as an educational resource for deep learning and neural network fundamentals. It provides a technical reference for implementing machine learning theory, covering everything from basic network design to the construction of advanced architectures. The material specifically focuses on the implementation of convolutional neural networks for computer vision and sequence models for natural language processing. It includes detailed guidance on building object detection systems, face recognition, and speech transcription mo

    Implements architectures that share features to perform multiple related tasks simultaneously.

    Jupyter Notebookandrew-ngandrew-ng-courseandrew-ng-machine-learning
    Voir sur GitHub↗3,594
  • shenweichen/deepctr-torchAvatar de shenweichen

    shenweichen/DeepCTR-Torch

    3,376Voir sur GitHub↗

    DeepCTR-Torch is a deep learning library for building click-through rate prediction models. It provides a modular framework for assembling custom prediction architectures from pre-built core, interaction, and sequence layers, enabling the construction of deep neural networks that estimate click probability from user behavior data. The library specializes in feature interaction modeling, offering components for learning low-order, high-order, and adaptive-order feature crosses. It supports multi-task learning for predicting multiple objectives simultaneously, such as click and conversion rates

    Trains a single model to predict multiple related outcomes simultaneously, such as click and conversion rates, using shared representations.

    Pythonctr-modelsdeep-learningdeepctr
    Voir sur GitHub↗3,376
  • evolvinglmms-lab/otterAvatar de EvolvingLMMs-Lab

    EvolvingLMMs-Lab/Otter

    3,331Voir sur GitHub↗

    Otter is a framework and toolkit for the pretraining, fine-tuning, and evaluation of vision-language models. It provides a pipeline for training large language models to process high-resolution images and video frames, integrating visual encoders with textual token spaces. The system is designed for multi-visual input processing, allowing models to interpret multiple images or video sequences within a single prompt. It supports multi-round conversation management to maintain context across interactions for detailed scene comprehension and visual reasoning. The framework covers a full develop

    Implements few-shot demonstration pairs within prompts to guide model output formats without updating parameters.

    Pythonartificial-inteligencechatgptdeep-learning
    Voir sur GitHub↗3,331
  • kpzhang93/mtcnn_face_detection_alignmentAvatar de kpzhang93

    kpzhang93/MTCNN_face_detection_alignment

    2,863Voir sur GitHub↗

    Cette bibliothèque fournit un framework de deep learning pour identifier les visages humains et extraire les points de repère faciaux dans les images numériques. Elle utilise une architecture de réseau de neurones convolutifs multi-tâches pour effectuer simultanément la classification des visages, la régression de boîte englobante et la localisation des points de repère. Le système traite les images à travers trois étapes séquentielles de réseaux de neurones, intégrant le redimensionnement par pyramide d'images pour détecter les visages à différentes échelles. Pour garantir la précision, il utilise la régression de boîte englobante pour affiner les prédictions de coordonnées et la suppression des non-maxima pour filtrer les détections redondantes qui se chevauchent. Ces outils prennent en charge le prétraitement des données biométriques en standardisant l'orientation et le positionnement des traits du visage. En alignant les points de repère et en recadrant les images, la bibliothèque prépare les données visuelles pour des tâches de reconnaissance ou d'analyse en aval.

    Trains a unified model to simultaneously perform face classification, bounding box regression, and landmark localization.

    MATLAB
    Voir sur GitHub↗2,863
  • biubug6/face-detector-1mb-with-landmarkAvatar de biubug6

    biubug6/Face-Detector-1MB-with-landmark

    1,106Voir sur GitHub↗

    This project provides a compact neural network architecture designed for human face detection and facial landmark localization. It functions as a specialized computer vision tool that identifies faces and extracts five specific facial key points within a single inference pass, making it suitable for integration into resource-constrained environments. The system utilizes a lightweight convolutional backbone and an anchor-based detection mechanism to maintain a small memory footprint while performing real-time processing. By employing a multi-task learning head, the model simultaneously predict

    Employs a multi-task learning head to simultaneously predict bounding boxes and facial landmarks in one pass.

    Python
    Voir sur GitHub↗1,106
  1. Home
  2. Artificial Intelligence & ML
  3. Machine Learning
  4. Architectures
  5. Sequence Models
  6. Multi-Task Learning Models

Explorer les sous-tags

  • CTR Multi-Task Models1 sous-tagMulti-task learning architectures specifically designed for click-through rate prediction using shared-bottom, ESMM, MMOE, or PLE patterns. **Distinct from Multi-Task Learning Models:** Distinct from Multi-Task Learning Models: focuses on CTR-specific multi-task architectures like ESMM and MMOE, not general sequence-based multi-task models.
  • Click-Through Rate Multi-Task ModelsFrameworks for training models that predict multiple objectives like click and conversion rates using shared representations. **Distinct from Multi-Task Learning Models:** Distinct from Multi-Task Learning Models: specifically targets CTR prediction with shared-bottom, ESMM, MMOE, and PLE architectures.
  • FrameworksSystems for implementing and managing multi-task learning architectures. **Distinct from Multi-Task Learning Models:** Distinct from Multi-Task Learning Models: focuses on the framework/infrastructure for managing multiple tasks rather than just the model architecture itself.
  • Game-Theoretic Loss BalancingTechniques that use game theory to dynamically weight multiple task losses and prevent gradient dominance. **Distinct from Multi-Task Learning Models:** Specifically addresses the mathematical balancing of loss functions in multi-task settings
  • Gated Expert Routing LayersLearned gating networks that selectively combine outputs from shared expert modules per task. **Distinct from Expert Routing Gates:** Distinct from Expert Routing Gates: focuses on per-task gating in multi-task learning, not general mixture-of-experts input routing.
  • In-Context Learning EnginesCapabilities for performing inference using prompts and examples without parameter updates. **Distinct from Multi-Task Learning Models:** Distinct from Multi-Task Learning Models: focuses on zero-shot or few-shot inference via prompting rather than multi-task training.
  • Progressive Layer SeparationArchitectures that progressively split shared and task-specific components in multi-task learning. **Distinct from Click-Through Rate Multi-Task Models:** Distinct from Shared-Bottom Architectures: separates shared and task-specific features through progressive layers rather than a single shared bottom.
  • Shared-Bottom ArchitecturesMulti-task learning architectures that share bottom layers across multiple prediction objectives to learn from related tasks simultaneously. **Distinct from Multi-Task Learning Models:** Distinct from Multi-Task Learning Models: specifically focuses on the shared-bottom architecture pattern rather than general multi-task sequence models.