1 dépôt
Models that use permutation-based objectives to learn bidirectional representations while remaining autoregressive.
Distinct from Autoregressive Models: Specifically covers the permutation-based training objective, unlike general autoregressive sequence generation.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Permutation Language Models. Refine with filters or upvote what's useful.
Ce projet est un framework de traitement du langage naturel axé sur un pré-entraîneur autorégressif généralisé conçu pour la représentation de langage non supervisée. Il implémente un modèle de langage qui combine un entraînement basé sur la permutation avec une architecture Transformer-XL pour fonctionner comme un processeur de texte à long contexte. Le système se distingue par sa capacité à gérer des séquences de texte dépassant les limites de longueur standard grâce à l'utilisation de la récurrence au niveau du segment et du codage positionnel relatif. Il met à l'échelle le pré-entraînement haute performance sur plusieurs clusters de GPU et TPU en utilisant des implémentations d'entraînement distribué. La base de code couvre l'ensemble du workflow de machine learning, incluant le nettoyage de texte et la tokenisation par sous-mots pour le prétraitement des données, ainsi que le fine-tuning spécifique à une tâche pour la réponse aux questions, la compréhension de lecture et la classification de texte. Il inclut des utilitaires pour l'optimisation des paramètres, la planification du taux d'apprentissage et l'évaluation des probabilités de réponse via des métriques de précision-rappel. Le projet fournit des configurations pour gérer les hyperparamètres du modèle et l'entraînement accéléré par le matériel sur plusieurs hôtes.
Implements a generalized autoregressive pretrainer combining autoregressive modeling with permutation-based training.