2 dépôts
Specialized constructions for building models that predict subsequent tokens in a sequence.
Distinct from Model Construction: Specifically targets the structural construction of language models rather than general model construction.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Language Model Architectures. Refine with filters or upvote what's useful.
Ce projet est un programme éducatif complet et un framework de deep learning conçu pour enseigner le deep learning pratique avec PyTorch via des notebooks et des exemples de code. Il sert de bibliothèque de haut niveau pour construire, entraîner et déployer des réseaux de neurones, agissant comme un orchestrateur d'entraînement de modèles qui coordonne les modèles PyTorch, les optimiseurs et les fonctions de perte. Le projet fournit des boîtes à outils spécialisées pour la vision par ordinateur, le traitement du langage naturel et le prétraitement de données tabulaires. Il se distingue par des contrôles d'entraînement avancés tels que des taux d'apprentissage discriminatifs, un système de callback bidirectionnel pour personnaliser la logique d'entraînement, et une abstraction de haut niveau qui automatise le placement sur périphérique et les boucles d'entraînement. Le framework couvre une large surface de capacités, y compris la construction automatisée de pipelines de données, l'analyse d'architecture de modèles et l'évaluation des performances sur des tâches de classification, de régression et de segmentation. Il inclut également des utilitaires pour l'entraînement distribué sur plusieurs GPU, l'entraînement en précision mixte pour l'optimisation de la mémoire, et un support spécialisé pour les données d'imagerie médicale. Le projet est livré sous forme d'une série de Jupyter Notebooks.
fastai constructs a model for predicting subsequent tokens in a sequence using specified architectures.
Ce projet est une implémentation éducative d'un transformeur pré-entraîné génératif à petite échelle conçu pour enseigner les fondamentaux de l'architecture et de l'entraînement des réseaux de neurones. Il sert d'implémentation de référence et de tutoriel pour construire un réseau de neurones générant du texte à partir de zéro. La base de code démontre les mécanismes de tokenisation, d'auto-attention et la construction d'un modèle de langage léger. Il se concentre sur le processus étape par étape de construction d'un modèle génératif pour illustrer comment les grands modèles de langage sont construits. L'implémentation couvre l'architecture basée sur les transformeurs, y compris l'attention multi-têtes, les réseaux feed-forward et le masquage causal. Il utilise PyTorch pour le calcul tensoriel et emploie l'apprentissage basé sur la rétropropagation pour entraîner le modèle sur des données textuelles séquentielles.
Provides a framework for constructing language model architectures that predict subsequent tokens.