12 repository-uri
Trainable lookup tables that map discrete tokens to dense vector representations.
Distinct from Dense Embeddings: Focuses on the lookup table architecture itself, whereas dense embeddings refers to the vector format.
Explore 12 awesome GitHub repositories matching artificial intelligence & ml · Token Embedding Layers. Refine with filters or upvote what's useful.
This project is a TensorFlow implementation of a convolutional neural network designed for text classification. It functions as a deep learning text categorizer that assigns predefined labels to text documents by identifying and analyzing learned patterns within training sets. The model utilizes a sequence of embedding-layer vectorization, convolutional layers for feature extraction, and max-pooling downsampling to process text data. Final category probabilities are determined through a dense-layer classification system. The workflow covers the end-to-end machine learning lifecycle, includin
Uses trainable embedding layers to transform discrete text tokens into dense vector representations.
Flashlight este o bibliotecă C++ standalone de machine learning și tensori, utilizată pentru construirea și antrenarea rețelelor neuronale. Aceasta funcționează ca un framework cuprinzător de rețele neuronale și motor de diferențiere automată, oferind instrumentele necesare pentru a construi grafuri de calcul și a calcula gradienții prin backpropagation. Proiectul servește drept framework de antrenare distribuită, utilizând operațiuni all-reduce pentru a sincroniza gradienții și parametrii pe mai multe noduri de calcul și dispozitive. Se distinge prin integrarea profundă a manipulării de înaltă performanță a tensorilor, interoperabilitatea nativă a memoriei dispozitivului și un sistem pentru sincronizarea ponderilor între workerii distribuiți pentru a accelera antrenarea modelelor la scară largă. Framework-ul acoperă o gamă largă de capabilități de deep learning, inclusiv compoziția modulară a straturilor pentru proiectarea arhitecturilor complexe precum blocuri reziduale și celule recurente. Oferă utilitare extinse de gestionare a datelor pentru ingestie și prefetching, alături de sisteme de serializare pentru persistența stărilor modelelor. În plus, include o suită de instrumente de monitorizare și observabilitate pentru urmărirea metricilor de antrenare și măsurarea erorilor de secvență. Biblioteca este implementată în C++.
Implements embedding lookups to retrieve vectors from learnable dictionaries using index lists.
Acest proiect este un sistem de procesare a limbajului natural conceput pentru recunoașterea entităților numite și clasificarea textului. Utilizează o abordare de machine learning pentru a identifica nume specifice și informații cheie din text brut pentru a organiza conținutul nestructurat într-un format structurat. Sistemul implementează o arhitectură multi-strat care combină un transformer pre-antrenat pentru embedding-uri, long short-term memory bidirecțional pentru modelarea secvențelor și un câmp aleatoriu condiționat pentru tranzițiile de etichete. Suportă transfer learning prin fine-tuning-ul acestor modele pe seturi de date specifice sarcinii. Proiectul include capabilități pentru antrenarea modelelor pe seturi de date personalizate folosind configurații și fișiere de vocabular specificate. Oferă, de asemenea, un mecanism pentru a implementa modelul antrenat ca serviciu de rețea, permițând clasificarea textului și recunoașterea entităților printr-un server HTTP.
Implements a BERT-based layer to map tokens to dense vector representations for downstream sequence modeling.
Acest proiect este un framework de recunoaștere a entităților numite și un model de procesare a limbajului natural bazat pe TensorFlow. Oferă un pipeline pentru adaptarea modelelor de limbaj pre-antrenate la sarcini specifice de recunoaștere a entităților și clasificare a textului. Sistemul implementează o arhitectură de etichetare a secvențelor care combină embedding-urile bazate pe transformer cu modelarea secvențelor bidirecționale și decodarea prin câmpuri aleatorii condiționate. Include instrumente pentru fine-tuning-ul ponderilor modelului și antrenarea rețelei pentru a identifica și categorisi entitățile din textul nestructurat. Framework-ul include, de asemenea, o arhitectură client-server care expune modelele antrenate printr-un API HTTP. Acest lucru permite inferența la distanță, predicția entităților numite și clasificarea documentelor text printr-o interfață de rețea.
Utilizes a BERT-based embedding layer to convert raw text into dense contextual vector representations.
Acest proiect este o implementare educațională a unui transformer generativ pre-antrenat la scară mică, conceput pentru a preda fundamentele arhitecturii și antrenării rețelelor neuronale. Acesta servește ca implementare de referință și tutorial pentru construirea unei rețele neuronale generatoare de text de la zero. Codul sursă demonstrează mecanica tokenizării, a auto-atenției (self-attention) și construcția unui model de limbaj ușor. Se concentrează pe procesul pas cu pas de construire a unui model generativ pentru a ilustra modul în care sunt construite modelele de limbaj mari. Implementarea acoperă arhitectura bazată pe transformer, inclusiv atenția multi-head, rețelele feed-forward și mascarea cauzală. Utilizează PyTorch pentru calculul tensorial și folosește învățarea bazată pe backpropagation pentru a antrena modelul pe date text secvențiale.
Provides token embedding layers that map discrete characters to high-dimensional dense vectors.
Engram este un sistem dinamic de recuperare a cunoștințelor și un framework de augmentare a memoriei pentru modele de limbaj mari (LLM). Funcționează ca un strat scalabil de căutare în memorie și o componentă de arhitectură rară (sparse), concepută pentru a îmbina cunoștințele statice ale modelului cu stări externe dinamice pentru a îmbunătăți factualitatea și a reduce halucinațiile. Sistemul utilizează recuperarea condiționată a memoriei și adresarea diferențiabilă a memoriei pentru a mapa tokenurile de input către indici specifici într-un depozit de memorie asociativă la scară largă. Acest lucru permite modelului să își mărească parametrii totali disponibili prin stocarea ponderilor în tabele de căutare externe și activarea doar a segmentelor de cunoștințe relevante pentru un anumit input. Frameworkul acoperă optimizarea rarității modelului și augmentarea scalabilă, folosind recuperarea key-value și fuziunea dinamică a parametrilor pentru a îmbunătăți performanța pe sarcini specializate fără a necesita o reantrenare completă a rețelei.
Provides a scalable lookup layer for conditional memory retrieval of external knowledge.
Tiny Universe is an educational monorepo that delivers multiple independent implementations of core AI subsystems as self-contained Jupyter notebooks. It provides from-scratch constructions of foundational architectures including a complete Transformer model built from the original paper specification, a denoising diffusion probabilistic model for image generation, and a ReAct-style autonomous agent framework that equips an LLM with tools for planning and multi-step task execution. The project distinguishes itself by covering the full lifecycle of modern AI systems through hands-on implementa
Maps token indices to dense vectors using a learnable lookup table for continuous representations.
This project is a collection of TensorFlow machine learning examples providing reference implementations for various neural network paradigms. It covers supervised, unsupervised, reinforcement, and sequential learning models. The repository includes implementations for convolutional neural networks focused on image classification and ranking, as well as recurrent neural networks for time-series forecasting and sequence-to-sequence translation. It further provides examples of reinforcement learning agents trained via reward optimization and unsupervised learning techniques such as autoencoders
Provides neural network layers for retrieving dense vectors from learnable dictionaries using indices.
tiny-llm is a large language model inference engine and transformer model implementation. It serves as a quantized model runtime and paged key-value cache manager, providing a specialized inference stack optimized for Apple Silicon. The system distinguishes itself through high-throughput execution techniques, including continuous batching and paged attention. It utilizes a paged memory system to eliminate fragmentation during token generation and employs on-the-fly dequantization of compressed weights to reduce the memory footprint during matrix multiplication. The project covers a broad ran
Implements token embedding layers that map discrete token IDs to dense vector representations.
Acest proiect este un curs educațional și un set de materiale instrucționale pentru construirea de la zero a modelelor de limbaj mari (LLM), folosind Python. Oferă un ghid pas cu pas și tutoriale practice axate pe mecanismele interne ale arhitecturilor de tip transformer și fluxurile de lucru de pre-antrenare. Repository-ul include un framework pentru implementarea și compararea diverselor familii de modele, inclusiv Llama, GLM și RWKV. Utilizează o abordare de asamblare bazată pe configurație pentru a analiza diferențele structurale și mecanismele interne ale acestor arhitecturi. Codul sursă acoperă întregul pipeline de dezvoltare, inclusiv preprocesarea textului, byte-pair encoding și implementarea mecanismului de multi-head attention cu causal masking. Include, de asemenea, utilitare de antrenare precum gradient clipping, learning rate scheduling și optimizarea hiperparametrilor pentru pre-antrenarea pe corpusuri neetichetate. Proiectul este implementat folosind Jupyter Notebooks.
Demonstrates the mathematical equivalence between embedding layers and fully connected layers using one-hot encoded vectors.
This project is a generative AI educational resource and natural language processing course. It serves as a technical implementation guide for building, pre-training, and fine-tuning a large language model from scratch using PyTorch. The curriculum provides a step-by-step tutorial on large language model development, focusing specifically on the design of transformer-based text generation models. It includes dedicated instruction on parameter-efficient fine-tuning to optimize training by updating only a small subset of model weights. The material covers the end-to-end generative AI training
Implements token embedding layers that map discrete text tokens to high-dimensional semantic vectors.
TransformerLens is a library for mechanistic interpretability research designed to reverse engineer the learned algorithms within large language models. It provides a standardized framework for wrapping diverse transformer architectures, allowing researchers to extract, manipulate, and analyze internal activations and weights through a consistent interface. The project distinguishes itself through a comprehensive system of activation hooks that can capture, patch, and ablate internal tensors during the forward pass. It includes specialized utilities for decomposing fused projections, material
Transforms input token IDs into dense vector representations using trainable lookup tables.