awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

18 dépôts

Awesome GitHub RepositoriesDense Embeddings

Vector representations where most dimensions are non-zero, capturing deep semantic meaning across multiple modalities.

Distinct from Vector Embeddings: Focuses on the specific dense format of vectors, whereas Vector Embeddings is the general generation process.

Explore 18 awesome GitHub repositories matching artificial intelligence & ml · Dense Embeddings. Refine with filters or upvote what's useful.

Awesome Dense Embeddings GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • ukplab/sentence-transformersAvatar de UKPLab

    UKPLab/sentence-transformers

    18,822Voir sur GitHub↗

    This project is a framework for training and deploying transformer-based models that map text, images, audio, and video into dense or sparse vector representations. It functions as a multimodal embedding library and semantic search engine used to retrieve relevant documents by calculating vector similarity between meanings. The framework provides specialized tools for both cross-encoder reranking, which calculates precise similarity scores to refine search results, and vector quantization to compress embedding vectors for reduced memory usage and increased retrieval speed. The project covers

    Generates dense vector representations for text, images, audio, and video to enable semantic similarity analysis.

    Python
    Voir sur GitHub↗18,822
  • huggingface/sentence-transformersAvatar de huggingface

    huggingface/sentence-transformers

    18,817Voir sur GitHub↗

    This project is a transformer-based framework for generating dense and sparse vector embeddings of text and multimodal data. It serves as a library for fine-tuning models to perform semantic similarity tasks, retrieval, and reranking. The system is distinguished by its support for diverse architectural patterns, including bi-encoders for fast similarity search and cross-encoders for high-precision reranking. It provides dedicated pipelines for multimodal embeddings, mapping text and images into a shared vector space, and implements knowledge distillation to compress large models into smaller,

    Generates dense vector representations for text, images, and other modalities to enable semantic analysis.

    Python
    Voir sur GitHub↗18,817
  • facebookresearch/dinov3Avatar de facebookresearch

    facebookresearch/dinov3

    9,613Voir sur GitHub↗

    This project is a self-supervised vision foundation model based on a vision transformer architecture. It is designed to learn dense visual representations from unlabeled images, serving as a general-purpose backbone for a wide variety of downstream vision tasks. The system is distinguished by its use of self-distillation and masked image modeling to extract semantic and geometric features. It also incorporates an image-text alignment model that maps visual embeddings to textual descriptions, enabling zero-shot image recognition, zero-shot segmentation, and cross-modal retrieval. The project

    Generates high-resolution dense image embeddings and similarity maps to find correspondences.

    Jupyter Notebook
    Voir sur GitHub↗9,613
  • infrasys-ai/aiinfraAvatar de Infrasys-AI

    Infrasys-AI/AIInfra

    7,414Voir sur GitHub↗

    Calculates FLOPs for dense Transformer models, a key performance analysis capability.

    Jupyter Notebookaiinfraaisystem
    Voir sur GitHub↗7,414
  • langchain-ai/rag-from-scratchAvatar de langchain-ai

    langchain-ai/rag-from-scratch

    7,393Voir sur GitHub↗

    This project is an educational implementation guide and framework for building Retrieval Augmented Generation systems. It provides a workflow for constructing a knowledge base pipeline that partitions documents, indexes them as vectors, and provides external context for language model prompts. The system features a document chunking framework that uses recursive character splitting to fit text into model context windows. It includes an in-memory vector store and a similarity search system that retrieves relevant text segments by calculating the mathematical distance between dense embedding ve

    Transforms raw text into high-dimensional numerical vectors that capture semantic meaning for retrieval.

    Jupyter Notebook
    Voir sur GitHub↗7,393
  • dennybritz/cnn-text-classification-tfAvatar de dennybritz

    dennybritz/cnn-text-classification-tf

    5,684Voir sur GitHub↗

    Ce projet est une implémentation TensorFlow d'un réseau de neurones convolutif conçu pour la classification de texte. Il fonctionne comme un catégoriseur de texte par deep learning qui assigne des étiquettes prédéfinies aux documents texte en identifiant et en analysant des modèles appris au sein des jeux d'entraînement. Le modèle utilise une séquence de vectorisation par couche d'embedding, des couches convolutives pour l'extraction de caractéristiques et un sous-échantillonnage par max-pooling pour traiter les données textuelles. Les probabilités de catégorie finales sont déterminées via un système de classification par couche dense. Le flux de travail couvre le cycle de vie complet du machine learning, incluant l'apprentissage supervisé de texte, l'entraînement de modèle avec des dimensions d'embedding et des tailles de filtre configurables, et l'évaluation des performances en utilisant des jeux de données de validation et la persistance de modèle basée sur des points de contrôle (checkpoints).

    Uses trainable embedding layers to transform discrete text tokens into dense vector representations.

    Python
    Voir sur GitHub↗5,684
  • flashlight/flashlightAvatar de flashlight

    flashlight/flashlight

    5,443Voir sur GitHub↗

    Flashlight est une bibliothèque de machine learning et de tenseurs autonome en C++ utilisée pour construire et entraîner des réseaux de neurones. Elle fonctionne comme un framework complet de réseaux de neurones et un moteur de différenciation automatique, fournissant les outils pour construire des graphes de calcul et calculer les gradients via la rétropropagation. Le projet sert de framework d'entraînement distribué, utilisant des opérations all-reduce pour synchroniser les gradients et les paramètres sur plusieurs nœuds de calcul et appareils. Il se distingue par une intégration profonde de la manipulation de tenseurs haute performance, l'interopérabilité native de la mémoire des appareils et un système pour synchroniser les poids entre les workers distribués afin d'accélérer l'entraînement de modèles à grande échelle. Le framework couvre un large éventail de capacités de deep learning, incluant la composition modulaire de couches pour concevoir des architectures complexes comme des blocs résiduels et des cellules récurrentes. Il fournit des utilitaires étendus de gestion de données pour l'ingestion et le préchargement, ainsi que des systèmes de sérialisation pour persister les états de modèle. De plus, il inclut une suite d'outils de surveillance et d'observabilité pour suivre les métriques d'entraînement et mesurer les erreurs de séquence. La bibliothèque est implémentée en C++.

    Implements embedding lookups to retrieve vectors from learnable dictionaries using index lists.

    C++
    Voir sur GitHub↗5,443
  • macanv/bert-bilsmt-crf-nerAvatar de macanv

    macanv/BERT-BiLSMT-CRF-NER

    4,906Voir sur GitHub↗

    Ce projet est un système de traitement du langage naturel conçu pour la reconnaissance d'entités nommées et la classification de texte. Il utilise une approche d'apprentissage automatique pour identifier des noms spécifiques et des informations clés à partir de texte brut afin d'organiser le contenu non structuré dans un format structuré. Le système implémente une architecture multicouche qui combine un transformeur pré-entraîné pour les embeddings, une mémoire à long terme bidirectionnelle (LSTM) pour la modélisation de séquence, et un champ aléatoire conditionnel (CRF) pour les transitions d'étiquettes. Il prend en charge l'apprentissage par transfert via l'affinage de ces modèles sur des jeux de données spécifiques à une tâche. Le projet inclut des capacités pour entraîner des modèles sur des jeux de données personnalisés en utilisant des configurations et des fichiers de vocabulaire spécifiés. Il fournit également un mécanisme pour déployer le modèle entraîné en tant que service réseau, permettant la classification de texte et la reconnaissance d'entités via un serveur HTTP.

    Implements a BERT-based layer to map tokens to dense vector representations for downstream sequence modeling.

    Python
    Voir sur GitHub↗4,906
  • macanv/bert-bilstm-crf-nerAvatar de macanv

    macanv/BERT-BiLSTM-CRF-NER

    4,904Voir sur GitHub↗

    Ce projet est un framework de reconnaissance d'entités nommées et un modèle de traitement du langage naturel basé sur TensorFlow. Il fournit un pipeline pour adapter des modèles de langage pré-entraînés à des tâches spécifiques de reconnaissance d'entités et de classification de texte. Le système implémente une architecture d'étiquetage de séquence qui combine des embeddings basés sur des transformeurs avec une modélisation de séquence bidirectionnelle et un décodage par champ aléatoire conditionnel. Il inclut des outils pour affiner les poids des modèles et entraîner le réseau à identifier et catégoriser les entités au sein de texte non structuré. Le framework inclut également une architecture client-serveur qui expose les modèles entraînés via une API HTTP. Cela permet l'inférence à distance, la prédiction d'entités nommées et la classification de documents texte via une interface réseau.

    Utilizes a BERT-based embedding layer to convert raw text into dense contextual vector representations.

    Python
    Voir sur GitHub↗4,904
  • karpathy/ng-video-lectureAvatar de karpathy

    karpathy/ng-video-lecture

    4,798Voir sur GitHub↗

    Ce projet est une implémentation éducative d'un transformeur pré-entraîné génératif à petite échelle conçu pour enseigner les fondamentaux de l'architecture et de l'entraînement des réseaux de neurones. Il sert d'implémentation de référence et de tutoriel pour construire un réseau de neurones générant du texte à partir de zéro. La base de code démontre les mécanismes de tokenisation, d'auto-attention et la construction d'un modèle de langage léger. Il se concentre sur le processus étape par étape de construction d'un modèle génératif pour illustrer comment les grands modèles de langage sont construits. L'implémentation couvre l'architecture basée sur les transformeurs, y compris l'attention multi-têtes, les réseaux feed-forward et le masquage causal. Il utilise PyTorch pour le calcul tensoriel et emploie l'apprentissage basé sur la rétropropagation pour entraîner le modèle sur des données textuelles séquentielles.

    Provides token embedding layers that map discrete characters to high-dimensional dense vectors.

    Python
    Voir sur GitHub↗4,798
  • deepseek-ai/engramAvatar de deepseek-ai

    deepseek-ai/Engram

    4,462Voir sur GitHub↗

    Engram est un système de récupération de connaissances dynamique et un framework d'augmentation de mémoire pour les grands modèles de langage (LLM). Il fonctionne comme une couche de recherche en mémoire scalable et un composant d'architecture creuse conçu pour fusionner les connaissances statiques du modèle avec des états externes dynamiques afin d'améliorer la véracité et réduire les hallucinations. Le système utilise la récupération conditionnelle en mémoire et l'adressage mémoire différentiable pour mapper les jetons d'entrée vers des indices spécifiques au sein d'un magasin de mémoire associative à grande échelle. Cela permet au modèle d'augmenter ses paramètres totaux disponibles en stockant des poids dans des tables de recherche externes et en n'activant que les segments de connaissances pertinents pour une entrée donnée. Le framework couvre l'optimisation de la sparsité des modèles et l'augmentation scalable, utilisant la récupération clé-valeur et la fusion dynamique de paramètres pour améliorer les performances sur des tâches spécialisées sans nécessiter un réentraînement complet du réseau.

    Provides a scalable lookup layer for conditional memory retrieval of external knowledge.

    Python
    Voir sur GitHub↗4,462
  • datawhalechina/tiny-universeAvatar de datawhalechina

    datawhalechina/tiny-universe

    4,505Voir sur GitHub↗

    Tiny Universe is an educational monorepo that delivers multiple independent implementations of core AI subsystems as self-contained Jupyter notebooks. It provides from-scratch constructions of foundational architectures including a complete Transformer model built from the original paper specification, a denoising diffusion probabilistic model for image generation, and a ReAct-style autonomous agent framework that equips an LLM with tools for planning and multi-step task execution. The project distinguishes itself by covering the full lifecycle of modern AI systems through hands-on implementa

    Maps token indices to dense vectors using a learnable lookup table for continuous representations.

    Jupyter Notebookagentdiffusionevaluation-metrics
    Voir sur GitHub↗4,505
  • binroot/tensorflow-bookAvatar de BinRoot

    BinRoot/TensorFlow-Book

    4,431Voir sur GitHub↗

    Ce projet est une collection d'exemples d'apprentissage automatique TensorFlow fournissant des implémentations de référence pour divers paradigmes de réseaux de neurones. Il couvre les modèles d'apprentissage supervisé, non supervisé, par renforcement et séquentiel. Le dépôt inclut des implémentations pour les réseaux de neurones convolutifs axés sur la classification et le classement d'images, ainsi que des réseaux de neurones récurrents pour la prévision de séries temporelles et la traduction séquence-à-séquence. Il fournit en outre des exemples d'agents d'apprentissage par renforcement entraînés via l'optimisation des récompenses et des techniques d'apprentissage non supervisé telles que les auto-encodeurs et les cartes auto-organisatrices pour le clustering de données. Les capacités supplémentaires couvrent la régression et la classification supervisées, la génération d'embeddings sémantiques et l'utilisation de modèles de Markov cachés pour la modélisation de données séquentielles. Le projet inclut également des utilitaires pour la gestion des opérations de tenseurs et la visualisation des performances des modèles via des tableaux de bord. Le contenu est livré sous forme d'une série de Jupyter Notebooks.

    Provides neural network layers for retrieving dense vectors from learnable dictionaries using indices.

    Jupyter Notebookautoencoderbookclassification
    Voir sur GitHub↗4,431
  • skyzh/tiny-llmAvatar de skyzh

    skyzh/tiny-llm

    4,304Voir sur GitHub↗

    tiny-llm est un moteur d'inférence de grands modèles de langage et une implémentation de modèle transformer. Il sert de runtime pour modèles quantifiés et de gestionnaire de cache clé-valeur paginé, fournissant une pile d'inférence spécialisée optimisée pour Apple Silicon. Le système se distingue par des techniques d'exécution à haut débit, incluant le batching continu et l'attention paginée. Il utilise un système de mémoire paginée pour éliminer la fragmentation lors de la génération de jetons et emploie une déquantification à la volée des poids compressés pour réduire l'empreinte mémoire lors de la multiplication matricielle. Le projet couvre un large éventail de capacités d'architecture de modèle et de performance, telles que le routage par mélange d'experts (MoE), l'attention par groupes de requêtes (GQA) et l'attention flash. Il inclut la prise en charge d'une logique de décodage avancée, incluant le décodage glouton (greedy) et l'échantillonnage via des méthodes de température, top-k et top-p. L'implémentation est écrite en Python et inclut des noyaux bas niveau personnalisés pour accélérer le traitement des tenseurs sur le matériel.

    Implements token embedding layers that map discrete token IDs to dense vector representations.

    Pythoncourselarge-language-modelllm
    Voir sur GitHub↗4,304
  • datawhalechina/llms-from-scratch-cnAvatar de datawhalechina

    datawhalechina/llms-from-scratch-cn

    4,211Voir sur GitHub↗

    Ce projet est un cours éducatif et un ensemble de supports pédagogiques pour construire des modèles de langage (LLM) à partir de zéro en Python. Il propose un guide étape par étape et des tutoriels pratiques axés sur les mécanismes internes des architectures transformer et les workflows de pré-entraînement. Le dépôt propose un framework pour implémenter et comparer diverses familles de modèles, dont Llama, GLM et RWKV. Il utilise une approche d'assemblage basée sur la configuration pour analyser les différences structurelles et les mécanismes internes de ces diverses architectures. La base de code couvre l'intégralité du pipeline de développement, incluant le prétraitement du texte, l'encodage par paires d'octets (BPE) et l'implémentation de l'attention multi-têtes avec masquage causal. Il inclut également des utilitaires d'entraînement tels que le gradient clipping, la planification du taux d'apprentissage et l'optimisation des hyperparamètres pour le pré-entraînement sur des corpus non étiquetés. Le projet est implémenté via des Jupyter Notebooks.

    Demonstrates the mathematical equivalence between embedding layers and fully connected layers using one-hot encoded vectors.

    Jupyter Notebookglmllamallm
    Voir sur GitHub↗4,211
  • andabi/deep-voice-conversionAvatar de andabi

    andabi/deep-voice-conversion

    3,941Voir sur GitHub↗

    Ce projet est un framework de conversion vocale TensorFlow et une boîte à outils audio de deep learning conçue pour le transfert de style vocal neuronal. Il fonctionne comme un moteur de synthèse vocale qui transforme les caractéristiques spectrales de la voix d'un locuteur source pour correspondre à l'identité vocale d'un locuteur cible. Le système emploie une approche basée sur les phonèmes pour la conversion vocale, classant les énoncés audio en phonèmes indépendants du locuteur et les resynthétisant en utilisant une voix cible. Ce pipeline permet la transformation des caractéristiques vocales en mappant les caractéristiques audio entre différents locuteurs. La boîte à outils inclut des capacités pour l'entraînement de modèles audio sur plusieurs GPU, la normalisation des données de tenseur et la gestion des hyperparamètres du modèle. Elle fournit également des outils pour surveiller les performances, comme la visualisation de la précision de classification via des matrices de confusion.

    Implements dense vector embeddings to map discrete phoneme IDs to continuous representations capturing semantic relationships.

    Python
    Voir sur GitHub↗3,941
  • skindhu/build-a-large-language-model-cnAvatar de skindhu

    skindhu/Build-A-Large-Language-Model-CN

    3,242Voir sur GitHub↗

    This project is a generative AI educational resource and natural language processing course. It serves as a technical implementation guide for building, pre-training, and fine-tuning a large language model from scratch using PyTorch. The curriculum provides a step-by-step tutorial on large language model development, focusing specifically on the design of transformer-based text generation models. It includes dedicated instruction on parameter-efficient fine-tuning to optimize training by updating only a small subset of model weights. The material covers the end-to-end generative AI training

    Implements token embedding layers that map discrete text tokens to high-dimensional semantic vectors.

    HTML
    Voir sur GitHub↗3,242
  • transformerlensorg/transformerlensAvatar de TransformerLensOrg

    TransformerLensOrg/TransformerLens

    3,098Voir sur GitHub↗

    TransformerLens is a library for mechanistic interpretability research designed to reverse engineer the learned algorithms within large language models. It provides a standardized framework for wrapping diverse transformer architectures, allowing researchers to extract, manipulate, and analyze internal activations and weights through a consistent interface. The project distinguishes itself through a comprehensive system of activation hooks that can capture, patch, and ablate internal tensors during the forward pass. It includes specialized utilities for decomposing fused projections, material

    Transforms input token IDs into dense vector representations using trainable lookup tables.

    Python
    Voir sur GitHub↗3,098
  1. Home
  2. Artificial Intelligence & ML
  3. Vector Embeddings
  4. Dense Embeddings

Explorer les sous-tags

  • Token Embedding Layers1 sous-tagTrainable lookup tables that map discrete tokens to dense vector representations. **Distinct from Dense Embeddings:** Focuses on the lookup table architecture itself, whereas dense embeddings refers to the vector format.
  • Transformer FLOPs CalculatorsTools for calculating total floating-point operations for dense Transformer models, including attention and MLP layers. **Distinct from Dense Embeddings:** Distinct from Dense Embeddings: focuses on computational cost estimation for Transformer architectures, not vector representations.