12 Repos
Trainable lookup tables that map discrete tokens to dense vector representations.
Distinct from Dense Embeddings: Focuses on the lookup table architecture itself, whereas dense embeddings refers to the vector format.
Explore 12 awesome GitHub repositories matching artificial intelligence & ml · Token Embedding Layers. Refine with filters or upvote what's useful.
Dieses Projekt ist eine TensorFlow-Implementierung eines Convolutional Neural Network, das für die Textklassifizierung entwickelt wurde. Es fungiert als Deep-Learning-Textkategorisierer, der Textdokumenten vordefinierte Labels zuweist, indem er gelernte Muster innerhalb von Trainingssets identifiziert und analysiert. Das Modell nutzt eine Sequenz aus Embedding-Layer-Vektorisierung, Convolutional Layers zur Merkmalsextraktion und Max-Pooling-Downsampling zur Verarbeitung von Textdaten. Die endgültigen Kategoriewahrscheinlichkeiten werden durch ein Dense-Layer-Klassifizierungssystem bestimmt. Der Workflow deckt den gesamten Machine-Learning-Lebenszyklus ab, einschließlich überwachtem Textlernen, Modelltraining mit konfigurierbaren Embedding-Dimensionen und Filtergrößen sowie Leistungsbewertung unter Verwendung von Validierungsdatensätzen und checkpoint-basierter Modellpersistenz.
Uses trainable embedding layers to transform discrete text tokens into dense vector representations.
Flashlight ist eine eigenständige C++-Bibliothek für maschinelles Lernen und Tensor-Berechnungen, die zum Erstellen und Trainieren neuronaler Netze verwendet wird. Sie fungiert als umfassendes Framework für neuronale Netze und Engine für automatische Differenzierung und bietet Werkzeuge zur Konstruktion von Berechnungsgraphen und zur Berechnung von Gradienten via Backpropagation. Das Projekt dient als Framework für verteiltes Training und nutzt All-Reduce-Operationen zur Synchronisation von Gradienten und Parametern über mehrere Rechenknoten und Geräte hinweg. Es zeichnet sich durch eine tiefe Integration von leistungsstarker Tensor-Manipulation, nativer Interoperabilität mit Gerätespeichern und einem System zur Synchronisation von Gewichten über verteilte Worker aus, um das Training großskaliger Modelle zu beschleunigen. Das Framework deckt eine breite Palette an Deep-Learning-Funktionen ab, einschließlich modularer Schichtkomposition für den Entwurf komplexer Architekturen wie Residual-Blöcke und rekurrente Zellen. Es bietet umfangreiche Datenmanagement-Utilities für Ingestion und Prefetching sowie Serialisierungssysteme zur Persistierung von Modellzuständen. Zusätzlich enthält es eine Suite an Überwachungs- und Observability-Tools zur Verfolgung von Trainingsmetriken und zur Messung von Sequenzfehlern. Die Bibliothek ist in C++ implementiert.
Implements embedding lookups to retrieve vectors from learnable dictionaries using index lists.
Dieses Projekt ist ein Natural-Language-Processing-System, das für Named Entity Recognition und Textklassifizierung entwickelt wurde. Es verwendet einen Machine-Learning-Ansatz, um spezifische Namen und Schlüsselinformationen aus Rohtext zu identifizieren und unstrukturierte Inhalte in ein strukturiertes Format zu organisieren. Das System implementiert eine Multi-Layer-Architektur, die einen vortrainierten Transformer für Embeddings, bidirektionales Long Short-Term Memory für Sequenzmodellierung und ein Conditional Random Field für Label-Übergänge kombiniert. Es unterstützt Transfer Learning durch das Fine-Tuning dieser Modelle auf aufgabenspezifischen Datensätzen. Das Projekt enthält Fähigkeiten zum Trainieren von Modellen auf benutzerdefinierten Datensätzen unter Verwendung spezifizierter Konfigurationen und Vokabular-Dateien. Es bietet zudem einen Mechanismus, um das trainierte Modell als Netzwerkdienst bereitzustellen, was Textklassifizierung und Entitätserkennung über einen HTTP-Server ermöglicht.
Implements a BERT-based layer to map tokens to dense vector representations for downstream sequence modeling.
Dieses Projekt ist ein Framework für Named Entity Recognition und ein auf TensorFlow basierendes Natural-Language-Processing-Modell. Es bietet eine Pipeline zur Anpassung vortrainierter Sprachmodelle an spezifische Entitätserkennungs- und Textklassifizierungsaufgaben. Das System implementiert eine Sequenz-Labeling-Architektur, die transformer-basierte Embeddings mit bidirektionaler Sequenzmodellierung und Conditional-Random-Field-Dekodierung kombiniert. Es enthält Tools zum Fine-Tuning von Modellgewichten und zum Trainieren des Netzwerks, um Entitäten innerhalb unstrukturierter Texte zu identifizieren und zu kategorisieren. Das Framework enthält zudem eine Client-Server-Architektur, die trainierte Modelle über eine HTTP-API bereitstellt. Dies ermöglicht Remote-Inferenz, Named-Entity-Vorhersage und Textdokumentklassifizierung über eine Netzwerkschnittstelle.
Utilizes a BERT-based embedding layer to convert raw text into dense contextual vector representations.
Dieses Projekt ist eine pädagogische Implementierung eines kleinen, generativen, vortrainierten Transformers, der die Grundlagen der Architektur und des Trainings neuronaler Netze vermitteln soll. Es dient als Referenzimplementierung und Tutorial für den Aufbau eines textgenerierenden neuronalen Netzes von Grund auf. Die Codebasis demonstriert die Mechanismen von Tokenisierung, Self-Attention und den Aufbau eines leichtgewichtigen Sprachmodells. Der Fokus liegt auf dem schrittweisen Prozess des Aufbaus eines generativen Modells, um zu veranschaulichen, wie Large Language Models konstruiert werden. Die Implementierung deckt transformer-basierte Architektur ab, einschließlich Multi-Head-Attention, Feed-Forward-Netzwerken und Causal Masking. Sie nutzt PyTorch für Tensor-Berechnungen und verwendet Backpropagation-basiertes Lernen, um das Modell mit sequenziellen Textdaten zu trainieren.
Provides token embedding layers that map discrete characters to high-dimensional dense vectors.
Engram ist ein dynamisches Wissensabrufsystem und ein Framework zur Speichererweiterung für Large Language Models. Es fungiert als skalierbare Speicher-Lookup-Schicht und spärliche Architekturkomponente, die statisches Modellwissen mit dynamischen externen Zuständen verschmilzt, um die Faktentreue zu verbessern und Halluzinationen zu reduzieren. Das System nutzt konditionalen Speicherabruf und differenzierbare Speicheradressierung, um Eingabe-Token auf spezifische Indizes innerhalb eines assoziativen Speichers im großen Maßstab abzubilden. Dies ermöglicht es dem Modell, seine gesamten verfügbaren Parameter zu erhöhen, indem Gewichte in externen Lookup-Tabellen gespeichert und nur die relevanten Wissenssegmente für eine bestimmte Eingabe aktiviert werden. Das Framework deckt die Optimierung der Modell-Sparsity und skalierbare Erweiterung ab, wobei Key-Value-Retrieval und dynamische Parameterfusion genutzt werden, um die Leistung bei spezialisierten Aufgaben zu steigern, ohne das Netzwerk vollständig neu trainieren zu müssen.
Provides a scalable lookup layer for conditional memory retrieval of external knowledge.
Tiny Universe is an educational monorepo that delivers multiple independent implementations of core AI subsystems as self-contained Jupyter notebooks. It provides from-scratch constructions of foundational architectures including a complete Transformer model built from the original paper specification, a denoising diffusion probabilistic model for image generation, and a ReAct-style autonomous agent framework that equips an LLM with tools for planning and multi-step task execution. The project distinguishes itself by covering the full lifecycle of modern AI systems through hands-on implementa
Maps token indices to dense vectors using a learnable lookup table for continuous representations.
Dieses Projekt ist eine Sammlung von TensorFlow-Machine-Learning-Beispielen, die Referenzimplementierungen für verschiedene neuronale Netzwerkparadigmen bereitstellen. Es deckt überwachte (supervised), unüberwachte (unsupervised), verstärkende (reinforcement) und sequentielle Lernmodelle ab. Das Repository enthält Implementierungen für Convolutional Neural Networks (CNNs), die auf Bildklassifizierung und -ranking fokussiert sind, sowie Recurrent Neural Networks (RNNs) für Zeitreihenprognosen und Sequence-to-Sequence-Übersetzung. Es bietet zudem Beispiele für Reinforcement-Learning-Agenten, die durch Belohnungsoptimierung trainiert werden, sowie unüberwachte Lerntechniken wie Autoencoder und selbstorganisierende Karten für Daten-Clustering. Zusätzliche Funktionen decken überwachte Regression und Klassifizierung, semantische Embedding-Generierung und die Verwendung von Hidden-Markov-Modellen für sequentielle Datenmodellierung ab. Das Projekt enthält zudem Utilities für das Management von Tensor-Operationen und die Visualisierung der Modellleistung über Dashboards. Der Inhalt wird als eine Reihe von Jupyter Notebooks bereitgestellt.
Provides neural network layers for retrieving dense vectors from learnable dictionaries using indices.
tiny-llm ist eine Inferenz-Engine für große Sprachmodelle und eine Transformer-Modell-Implementierung. Sie dient als Laufzeitumgebung für quantisierte Modelle und als Paged-Key-Value-Cache-Manager und bietet einen spezialisierten Inferenz-Stack, der für Apple Silicon optimiert ist. Das System zeichnet sich durch High-Throughput-Ausführungstechniken aus, einschließlich Continuous Batching und Paged Attention. Es nutzt ein Paged-Memory-System, um Fragmentierung während der Token-Generierung zu eliminieren, und verwendet On-the-Fly-Dequantisierung komprimierter Gewichte, um den Speicherbedarf während der Matrixmultiplikation zu reduzieren. Das Projekt deckt ein breites Spektrum an Modellarchitektur- und Performance-Funktionen ab, wie Mixture-of-Experts-Routing, Grouped Query Attention und Flash Attention. Es umfasst Unterstützung für fortgeschrittene Decoding-Logik, einschließlich Greedy Decoding und Sampling via Temperature, Top-K- und Top-P-Methoden. Die Implementierung ist in Python geschrieben und enthält benutzerdefinierte Low-Level-Kernel zur Beschleunigung der Tensor-Verarbeitung auf der Hardware.
Implements token embedding layers that map discrete token IDs to dense vector representations.
Dieses Projekt ist ein Bildungskurs mit Lehrmaterialien, um Large Language Models von Grund auf mit Python zu entwickeln. Es bietet eine Schritt-für-Schritt-Anleitung und praktische Tutorials, die sich auf die internen Mechanismen von Transformer-Architekturen und Pre-Training-Workflows konzentrieren. Das Repository enthält ein Framework zur Implementierung und zum Vergleich verschiedener Modellfamilien, darunter Llama, GLM und RWKV. Es nutzt einen konfigurationsgesteuerten Ansatz, um die strukturellen Unterschiede und internen Mechanismen dieser Architekturen zu analysieren. Die Codebasis deckt die komplette Entwicklungspipeline ab, einschließlich Text-Preprocessing, Byte-Pair-Encoding und der Implementierung von Multi-Head-Attention mit kausaler Maskierung. Zudem sind Trainings-Utilities wie Gradient Clipping, Learning Rate Scheduling und Hyperparameter-Optimierung für das Pre-Training auf ungelabelten Korpora enthalten. Das Projekt ist in Jupyter Notebooks umgesetzt.
Demonstrates the mathematical equivalence between embedding layers and fully connected layers using one-hot encoded vectors.
This project is a generative AI educational resource and natural language processing course. It serves as a technical implementation guide for building, pre-training, and fine-tuning a large language model from scratch using PyTorch. The curriculum provides a step-by-step tutorial on large language model development, focusing specifically on the design of transformer-based text generation models. It includes dedicated instruction on parameter-efficient fine-tuning to optimize training by updating only a small subset of model weights. The material covers the end-to-end generative AI training
Implements token embedding layers that map discrete text tokens to high-dimensional semantic vectors.
TransformerLens is a library for mechanistic interpretability research designed to reverse engineer the learned algorithms within large language models. It provides a standardized framework for wrapping diverse transformer architectures, allowing researchers to extract, manipulate, and analyze internal activations and weights through a consistent interface. The project distinguishes itself through a comprehensive system of activation hooks that can capture, patch, and ablate internal tensors during the forward pass. It includes specialized utilities for decomposing fused projections, material
Transforms input token IDs into dense vector representations using trainable lookup tables.