12 repositorios
Trainable lookup tables that map discrete tokens to dense vector representations.
Distinct from Dense Embeddings: Focuses on the lookup table architecture itself, whereas dense embeddings refers to the vector format.
Explore 12 awesome GitHub repositories matching artificial intelligence & ml · Token Embedding Layers. Refine with filters or upvote what's useful.
Este proyecto es una implementación en TensorFlow de una red neuronal convolucional diseñada para la clasificación de texto. Funciona como un categorizador de texto de deep learning que asigna etiquetas predefinidas a documentos de texto identificando y analizando patrones aprendidos dentro de los conjuntos de entrenamiento. El modelo utiliza una secuencia de vectorización de capa de embedding, capas convolucionales para la extracción de características y submuestreo de max-pooling para procesar datos de texto. Las probabilidades de categoría final se determinan a través de un sistema de clasificación de capa densa. El flujo de trabajo cubre el ciclo de vida completo del machine learning, incluyendo aprendizaje de texto supervisado, entrenamiento de modelos con dimensiones de embedding y tamaños de filtro configurables, y evaluación del rendimiento utilizando datasets de validación y persistencia de modelos basada en checkpoints.
Uses trainable embedding layers to transform discrete text tokens into dense vector representations.
Flashlight es una biblioteca de aprendizaje automático y de tensores independiente en C++ utilizada para construir y entrenar redes neuronales. Funciona como un framework integral de redes neuronales y motor de diferenciación automática, proporcionando las herramientas para construir grafos de computación y calcular gradientes mediante retropropagación. El proyecto sirve como framework de entrenamiento distribuido, utilizando operaciones all-reduce para sincronizar gradientes y parámetros a través de múltiples nodos de cómputo y dispositivos. Se distingue por una integración profunda de manipulación de tensores de alto rendimiento, interoperabilidad nativa de memoria de dispositivo y un sistema para sincronizar pesos a través de trabajadores distribuidos para acelerar el entrenamiento de modelos a gran escala. El framework cubre una amplia gama de capacidades de aprendizaje profundo, incluyendo composición modular de capas para diseñar arquitecturas complejas como bloques residuales y celdas recurrentes. Proporciona utilidades extensas de gestión de datos para ingesta y prefetching, junto con sistemas de serialización para persistir estados de modelos. Además, incluye una suite de herramientas de monitorización y observabilidad para rastrear métricas de entrenamiento y medir errores de secuencia. La biblioteca está implementada en C++.
Implements embedding lookups to retrieve vectors from learnable dictionaries using index lists.
Este proyecto es un sistema de procesamiento de lenguaje natural diseñado para el reconocimiento de entidades nombradas y clasificación de texto. Utiliza un enfoque de aprendizaje automático para identificar nombres específicos e información clave a partir de texto sin procesar para organizar contenido no estructurado en un formato estructurado. El sistema implementa una arquitectura multicapa que combina un transformer pre-entrenado para embeddings, memoria a largo plazo bidireccional (BiLSTM) para modelado de secuencias y un campo aleatorio condicional (CRF) para transiciones de etiquetas. Soporta aprendizaje por transferencia mediante el fine-tuning de estos modelos en datasets específicos de la tarea. El proyecto incluye capacidades para entrenar modelos en datasets personalizados utilizando configuraciones y archivos de vocabulario especificados. También proporciona un mecanismo para desplegar el modelo entrenado como un servicio de red, permitiendo la clasificación de texto y el reconocimiento de entidades a través de un servidor HTTP.
Implements a BERT-based layer to map tokens to dense vector representations for downstream sequence modeling.
Este proyecto es un framework de reconocimiento de entidades nombradas y modelo de procesamiento de lenguaje natural basado en TensorFlow. Proporciona un pipeline para adaptar modelos de lenguaje pre-entrenados a tareas específicas de reconocimiento de entidades y clasificación de texto. El sistema implementa una arquitectura de etiquetado de secuencias que combina embeddings basados en transformers con modelado de secuencias bidireccional y decodificación de campo aleatorio condicional (CRF). Incluye herramientas para ajustar los pesos del modelo y entrenar la red para identificar y categorizar entidades dentro de texto no estructurado. El framework también incluye una arquitectura cliente-servidor que expone modelos entrenados a través de una API HTTP. Esto permite la inferencia remota, predicción de entidades nombradas y clasificación de documentos de texto a través de una interfaz de red.
Utilizes a BERT-based embedding layer to convert raw text into dense contextual vector representations.
Este proyecto es una implementación educativa de un transformer generativo preentrenado a pequeña escala diseñado para enseñar los fundamentos de la arquitectura y el entrenamiento de redes neuronales. Sirve como implementación de referencia y tutorial para construir una red neuronal generativa de texto desde cero. El código base demuestra la mecánica de la tokenización, la auto-atención y la construcción de un modelo de lenguaje ligero. Se centra en el proceso paso a paso de construir un modelo generativo para ilustrar cómo se construyen los modelos de lenguaje grandes. La implementación cubre la arquitectura basada en transformers, incluyendo atención de múltiples cabezales, redes feed-forward y enmascaramiento causal. Utiliza PyTorch para el cálculo de tensores y emplea aprendizaje basado en retropropagación para entrenar el modelo con datos de texto secuenciales.
Provides token embedding layers that map discrete characters to high-dimensional dense vectors.
Engram es un sistema dinámico de recuperación de conocimiento y framework de aumento de memoria para modelos de lenguaje grandes (LLM). Funciona como una capa de búsqueda de memoria escalable y un componente de arquitectura dispersa diseñado para fusionar el conocimiento estático del modelo con estados externos dinámicos para mejorar la veracidad y reducir las alucinaciones. El sistema utiliza recuperación de memoria condicional y direccionamiento de memoria diferenciable para mapear tokens de entrada a índices específicos dentro de un almacén de memoria asociativa a gran escala. Esto permite al modelo aumentar sus parámetros totales disponibles almacenando pesos en tablas de búsqueda externas y activando solo los segmentos de conocimiento relevantes para una entrada dada. El framework cubre la optimización de dispersión del modelo y el aumento escalable, utilizando recuperación clave-valor y fusión dinámica de parámetros para mejorar el rendimiento en tareas especializadas sin requerir un reentrenamiento completo de la red.
Provides a scalable lookup layer for conditional memory retrieval of external knowledge.
Tiny Universe is an educational monorepo that delivers multiple independent implementations of core AI subsystems as self-contained Jupyter notebooks. It provides from-scratch constructions of foundational architectures including a complete Transformer model built from the original paper specification, a denoising diffusion probabilistic model for image generation, and a ReAct-style autonomous agent framework that equips an LLM with tools for planning and multi-step task execution. The project distinguishes itself by covering the full lifecycle of modern AI systems through hands-on implementa
Maps token indices to dense vectors using a learnable lookup table for continuous representations.
Este proyecto es una colección de ejemplos de aprendizaje automático de TensorFlow que proporciona implementaciones de referencia para varios paradigmas de redes neuronales. Cubre modelos de aprendizaje supervisado, no supervisado, por refuerzo y secuencial. El repositorio incluye implementaciones para redes neuronales convolucionales centradas en la clasificación y clasificación de imágenes, así como redes neuronales recurrentes para pronóstico de series temporales y traducción de secuencia a secuencia. Proporciona además ejemplos de agentes de aprendizaje por refuerzo entrenados mediante optimización de recompensas y técnicas de aprendizaje no supervisado como autoencoders y mapas autoorganizados para la agrupación de datos. Las capacidades adicionales cubren la regresión y clasificación supervisada, la generación de embeddings semánticos y el uso de modelos ocultos de Markov para el modelado de datos secuenciales. El proyecto también incluye utilidades para la gestión de operaciones de tensores y la visualización del rendimiento del modelo mediante paneles. El contenido se entrega como una serie de Jupyter Notebooks.
Provides neural network layers for retrieving dense vectors from learnable dictionaries using indices.
tiny-llm is a large language model inference engine and transformer model implementation. It serves as a quantized model runtime and paged key-value cache manager, providing a specialized inference stack optimized for Apple Silicon. The system distinguishes itself through high-throughput execution techniques, including continuous batching and paged attention. It utilizes a paged memory system to eliminate fragmentation during token generation and employs on-the-fly dequantization of compressed weights to reduce the memory footprint during matrix multiplication. The project covers a broad ran
Implements token embedding layers that map discrete token IDs to dense vector representations.
Este proyecto es un curso educativo y un conjunto de materiales de instrucción para construir modelos de lenguaje de gran tamaño (LLM) desde cero usando Python. Proporciona una guía paso a paso y tutoriales prácticos centrados en la mecánica interna de las arquitecturas transformer y los flujos de trabajo de pre-entrenamiento. El repositorio cuenta con un framework para implementar y comparar diversas familias de modelos, incluyendo Llama, GLM y RWKV. Utiliza un enfoque de ensamblaje basado en configuración para analizar las diferencias estructurales y los mecanismos internos de estas arquitecturas. El código cubre el pipeline completo de desarrollo, incluyendo preprocesamiento de texto, codificación por pares de bytes (BPE) y la implementación de atención multi-cabeza con enmascaramiento causal. También incluye utilidades de entrenamiento como recorte de gradientes, programación de tasa de aprendizaje y optimización de hiperparámetros para el pre-entrenamiento en corpus no etiquetados. El proyecto está implementado mediante Jupyter Notebooks.
Demonstrates the mathematical equivalence between embedding layers and fully connected layers using one-hot encoded vectors.
This project is a generative AI educational resource and natural language processing course. It serves as a technical implementation guide for building, pre-training, and fine-tuning a large language model from scratch using PyTorch. The curriculum provides a step-by-step tutorial on large language model development, focusing specifically on the design of transformer-based text generation models. It includes dedicated instruction on parameter-efficient fine-tuning to optimize training by updating only a small subset of model weights. The material covers the end-to-end generative AI training
Implements token embedding layers that map discrete text tokens to high-dimensional semantic vectors.
TransformerLens is a library for mechanistic interpretability research designed to reverse engineer the learned algorithms within large language models. It provides a standardized framework for wrapping diverse transformer architectures, allowing researchers to extract, manipulate, and analyze internal activations and weights through a consistent interface. The project distinguishes itself through a comprehensive system of activation hooks that can capture, patch, and ablate internal tensors during the forward pass. It includes specialized utilities for decomposing fused projections, material
Transforms input token IDs into dense vector representations using trainable lookup tables.