2 repositorios
Specialized constructions for building models that predict subsequent tokens in a sequence.
Distinct from Model Construction: Specifically targets the structural construction of language models rather than general model construction.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Language Model Architectures. Refine with filters or upvote what's useful.
Este repositorio es un programa educativo integral y un framework de deep learning diseñado para enseñar aprendizaje profundo práctico usando PyTorch a través de notebooks y ejemplos de código. Sirve como una librería de alto nivel para construir, entrenar y desplegar redes neuronales, actuando como un orquestador de entrenamiento de modelos que coordina modelos de PyTorch, optimizadores y funciones de pérdida. El proyecto proporciona kits de herramientas especializados para visión artificial, procesamiento de lenguaje natural y preprocesamiento de datos tabulares. Se distingue por controles de entrenamiento avanzados como tasas de aprendizaje discriminativas, un sistema de callbacks bidireccional para personalizar la lógica de entrenamiento y una abstracción de learner de alto nivel que automatiza la colocación en dispositivos y los bucles de entrenamiento. El framework cubre una amplia superficie de capacidades, incluyendo la construcción automatizada de pipelines de datos, análisis de arquitectura de modelos y evaluación de rendimiento en tareas de clasificación, regresión y segmentación. También incluye utilidades para entrenamiento distribuido en múltiples GPUs, entrenamiento de precisión mixta para optimización de memoria y soporte especializado para datos de imágenes médicas. El proyecto se entrega como una serie de Jupyter Notebooks.
fastai constructs a model for predicting subsequent tokens in a sequence using specified architectures.
Este proyecto es una implementación educativa de un transformer generativo preentrenado a pequeña escala diseñado para enseñar los fundamentos de la arquitectura y el entrenamiento de redes neuronales. Sirve como implementación de referencia y tutorial para construir una red neuronal generativa de texto desde cero. El código base demuestra la mecánica de la tokenización, la auto-atención y la construcción de un modelo de lenguaje ligero. Se centra en el proceso paso a paso de construir un modelo generativo para ilustrar cómo se construyen los modelos de lenguaje grandes. La implementación cubre la arquitectura basada en transformers, incluyendo atención de múltiples cabezales, redes feed-forward y enmascaramiento causal. Utiliza PyTorch para el cálculo de tensores y emplea aprendizaje basado en retropropagación para entrenar el modelo con datos de texto secuenciales.
Provides a framework for constructing language model architectures that predict subsequent tokens.