awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 dépôts

Awesome GitHub RepositoriesSemantic Document Retrieval

Fetching relevant documents from an index using vector embeddings for semantic similarity.

Distinct from Vector Document Indexing: Distinct from Vector Document Indexing: focuses on the retrieval step using embeddings, not the indexing workflow.

Explore 6 awesome GitHub repositories matching data & databases · Semantic Document Retrieval. Refine with filters or upvote what's useful.

Awesome Semantic Document Retrieval GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • facebookresearch/llama-recipesAvatar de facebookresearch

    facebookresearch/llama-recipes

    18,379Voir sur GitHub↗

    This repository is a collection of frameworks and guides for Llama models, functioning as a fine-tuning framework, an inference pipeline, and an AI workflow orchestrator. It provides tools for adapting large language models to specific datasets and domains. The project includes a parameter-efficient fine-tuning toolkit that utilizes techniques like low-rank adaptation to reduce memory and compute requirements. It also serves as an implementation guide for retrieval-augmented generation, combining model inference with external data retrieval to improve response accuracy. The capability surfac

    Queries external databases for relevant text chunks using semantic similarity to ground responses.

    Jupyter Notebook
    Voir sur GitHub↗18,379
  • firebase/genkitAvatar de firebase

    firebase/genkit

    6,121Voir sur GitHub↗

    Genkit is an open-source framework for building AI-powered applications. It provides a unified interface for connecting to hundreds of generative AI models from multiple providers, enabling text, image, audio, and video generation through a single API. The framework structures multi-step AI interactions—including chat, retrieval-augmented generation, tool use, and agentic workflows—as composable, traceable flows with built-in streaming and state management. The framework distinguishes itself through a comprehensive developer toolkit that includes a command-line interface and a local developer

    Fetches relevant documents from an index using vector embeddings for semantic similarity.

    TypeScript
    Voir sur GitHub↗6,121
  • brianpetro/obsidian-smart-connectionsAvatar de brianpetro

    brianpetro/obsidian-smart-connections

    5,195Voir sur GitHub↗

    Ce projet est un plugin de base de connaissances et un gestionnaire de contexte RAG qui utilise une interface de base de données vectorielle locale pour permettre la recherche sémantique et la cartographie des relations. Il transforme le texte en vecteurs numériques pour trouver des notes et des extraits sémantiquement liés basés sur le sens conceptuel plutôt que sur la correspondance de mots-clés. Le système se distingue par un visualiseur de graphe sémantique qui cartographie les notes en clusters pour révéler des connexions conceptuelles. Il dispose également d'un gestionnaire de contexte capable de regrouper des notes et extraits locaux en packs réutilisables pour fournir des bases factuelles solides aux conversations avec des modèles de langage. L'outil couvre un large éventail de capacités, notamment l'interrogation de connaissances en langage naturel, l'exécution de flux de travail automatisés pour la création de notes, et la possibilité de router les prompts entre des modèles IA locaux et cloud. Il propose plusieurs interfaces de découverte, telles que des indicateurs de contenu associé en ligne et un panneau de pied de page pour faire apparaître des documents similaires pendant le processus d'édition.

    Surfaces semantically similar excerpts based on the active document to discover relevant prior work.

    JavaScriptchatgptclaudeembeddings
    Voir sur GitHub↗5,195
  • facebookresearch/drqaAvatar de facebookresearch

    facebookresearch/DrQA

    4,468Voir sur GitHub↗

    DrQA est un système de réponse aux questions en domaine ouvert qui récupère des documents pertinents à partir d'un large corpus et extrait des réponses spécifiques à des questions en langage naturel. Il est implémenté comme un système de réseau de neurones qui combine un moteur de récupération de documents avec un modèle de compréhension de lecture automatique. Le système utilise une architecture de pipeline à deux étapes. Un récupérateur de documents à grain grossier utilise des vecteurs de mots pondérés pour identifier les documents potentiels, tandis qu'un modèle de compréhension de lecture automatique à grain fin identifie et extrait l'étendue de texte exacte contenant la réponse. Le projet inclut également un générateur de jeux de données de traitement du langage naturel supervisé. Cet outil crée des exemples d'entraînement en faisant correspondre des paires question-réponse avec des paragraphes de soutien en utilisant des heuristiques de chaîne automatisées. La base de code fournit des capacités supplémentaires pour le traitement du texte et la tokenisation afin de préparer le texte brut pour le traitement par réseau de neurones.

    Uses vector embeddings for semantic document retrieval within a large unstructured corpus.

    Python
    Voir sur GitHub↗4,468
  • rag-web-ui/rag-web-uiAvatar de rag-web-ui

    rag-web-ui/rag-web-ui

    3,048Voir sur GitHub↗

    Ce projet est une plateforme basée sur le web conçue pour la génération augmentée par récupération, fournissant une interface conversationnelle qui connecte les modèles de langage à des collections de documents privés. Il fonctionne comme un système complet pour gérer les bases de connaissances d'entreprise, permettant aux utilisateurs d'interroger des documents internes et de recevoir des réponses contextuelles et vérifiées par la source via une interface de chat en langage naturel. La plateforme se distingue en intégrant la recherche sémantique basée sur les vecteurs avec une gestion modulaire de la base de connaissances, permettant l'ingestion, la segmentation et l'indexation des documents dans des embeddings interrogeables. Elle prend en charge des environnements sécurisés et multi-utilisateurs en implémentant une authentification et une autorisation basées sur la session pour protéger les informations sensibles. De plus, le système est conçu pour gérer des opérations de données à haut volume en déchargeant le traitement des documents vers des travailleurs d'arrière-plan asynchrones et en livrant les réponses du modèle via un streaming en temps réel pour maintenir la réactivité de l'interface. Au-delà de ses capacités conversationnelles de base, le framework inclut des utilitaires pour la maintenance de la base de données, tels que la sauvegarde et la restauration, et expose des fonctions de récupération de connaissances via des API standards pour l'intégration avec des applications externes. Le système est conçu pour prendre en charge à la fois les modèles de langage locaux et basés sur le cloud, offrant une architecture flexible pour déployer des outils d'intelligence documentaire privés.

    Uses vector embeddings to perform rapid semantic similarity searches during query generation.

    TypeScriptaideepseeklangchain
    Voir sur GitHub↗3,048
  • kennethleungty/llama-2-open-source-llm-cpu-inferenceAvatar de kennethleungty

    kennethleungty/Llama-2-Open-Source-LLM-CPU-Inference

    973Voir sur GitHub↗

    Ce projet fournit un framework pour exécuter des modèles de langage (LLM) et effectuer des questions-réponses basées sur des documents, entièrement sur du matériel grand public local. En intégrant un moteur d'inférence basé sur le CPU à une base de données vectorielle locale, il permet aux utilisateurs de traiter des informations sans dépendre d'API cloud ou de GPU spécialisés. Le système fonctionne comme un outil en ligne de commande qui gère tout le cycle de vie du traitement des données privées. Il transforme les fichiers texte locaux en embeddings vectoriels interrogeables, permettant au modèle de récupérer un contexte pertinent et d'ancrer ses réponses dans des sources fournies par l'utilisateur. Grâce à l'exécution de modèles quantifiés, le framework réduit les besoins en mémoire et en calcul pour faciliter son fonctionnement sur du matériel standard. Le projet propose un pipeline complet pour l'indexation de documents, la recherche sémantique et la génération assistée par le contexte. Il garantit la confidentialité des données en conservant l'ingestion des documents, la génération d'embeddings et l'inférence du modèle au sein de l'environnement local.

    Fetches relevant document segments from an index using vector embeddings for semantic similarity.

    Pythonc-transformerschatgptcpu
    Voir sur GitHub↗973
  1. Home
  2. Data & Databases
  3. Database Management Systems
  4. Database Engines
  5. Vector Databases
  6. Vector Document Indexing
  7. Semantic Document Retrieval