awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

20 dépôts

Awesome GitHub RepositoriesRAG Knowledge Management

Systems for organizing and versioning document collections to optimize retrieval augmented generation.

Distinct from Knowledge Base Retrieval: Existing candidates focus on generic knowledge management or retrieval; this combines organization and versioning specifically for RAG.

Explore 20 awesome GitHub repositories matching artificial intelligence & ml · RAG Knowledge Management. Refine with filters or upvote what's useful.

Awesome RAG Knowledge Management GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • pewdiepie-archdaemon/odysseusAvatar de pewdiepie-archdaemon

    pewdiepie-archdaemon/odysseus

    72,184Voir sur GitHub↗

    Odysseus is a self-hosted AI workspace and autonomous agent framework designed for deploying and managing large language models. It serves as a centralized platform for orchestrating agentic tasks, utilizing a model context protocol server to connect AI models to external system utilities, browser automation, and local hardware. The system distinguishes itself through a combination of retrieval-augmented generation and a RAG knowledge base, using vector stores and local embeddings to provide persistent semantic memory. It further integrates AI-driven communication management to triage email i

    Uses vector stores and local embeddings to manage document collections for retrieval augmented generation.

    Python
    Voir sur GitHub↗72,184
  • garrytan/gbrainAvatar de garrytan

    garrytan/gbrain

    23,848Voir sur GitHub↗

    gbrain is an agent framework and retrieval-augmented generation system that combines a durable task queue, a git-synced vector store, and a knowledge graph engine. It provides a foundation for building AI agents that interact with structured knowledge bases using the Model Context Protocol. The system synchronizes markdown files from a git repository into a database for high-performance semantic retrieval and creates typed edges between data pages by extracting entity references and wikilinks. It uses a database-backed queue to execute persistent background jobs and tool loops, ensuring relia

    Implements a RAG system that synchronizes markdown files into a database for semantic retrieval and cited answer synthesis.

    TypeScript
    Voir sur GitHub↗23,848
  • arc53/docsgptAvatar de arc53

    arc53/DocsGPT

    17,939Voir sur GitHub↗

    DocsGPT is a retrieval-augmented generation platform and private knowledge base used to build AI agents that perform grounded search and analysis. It functions as a multi-model AI orchestrator and enterprise agent builder, allowing for the integration of various local and cloud language models to customize reasoning and text generation. The project provides a visual environment for developing automated assistants using conditional logic and third-party API connectivity. It enables the creation of private AI agents capable of performing enterprise search and detailed document analysis using pr

    Manages the ingestion and organization of documents and web data to optimize retrieval-augmented generation.

    Pythonagent-builderagentsai
    Voir sur GitHub↗17,939
  • blinkospace/blinkoAvatar de blinkospace

    blinkospace/blinko

    10,601Voir sur GitHub↗

    Blinko is a personal knowledge management system and an LLM-powered knowledge base that enables users to capture and organize thoughts through a bi-directional knowledge graph. It functions as a RAG-enabled note-taking application and a self-hosted Markdown editor, allowing for the creation of permanent documentation and fleeting notes. The project distinguishes itself by integrating retrieval-augmented generation to provide conversational querying and AI-powered analysis of private document libraries. It supports both cloud-based and local AI model integration, enabling users to perform sema

    Implements retrieval-augmented generation to provide conversational answers based on private documents.

    TypeScriptmarkdownmemosnextjs
    Voir sur GitHub↗10,601
  • hkuds/deeptutorAvatar de HKUDS

    HKUDS/DeepTutor

    10,365Voir sur GitHub↗

    DeepTutor is a framework for personalized AI tutoring and educational content generation. It functions as an agentic workflow system that executes reasoning loops to complete multi-step tasks, transforming raw sources into structured learning materials such as interactive books, quizzes, and concept graphs. The platform distinguishes itself through an extensible skill architecture that allows the installation and auditing of third-party capability packages from community registries. It utilizes persona-driven tool policies to deploy persistent AI companions with unique behavioral profiles and

    Organizes and versions document collections to support retrieval augmented generation and prevent information loss.

    Pythonai-agentsai-tutordeepresearch
    Voir sur GitHub↗10,365
  • learningcircuit/local-deep-researchAvatar de LearningCircuit

    LearningCircuit/local-deep-research

    8,491Voir sur GitHub↗

    Local Deep Research is an autonomous research system consisting of an LLM research agent, a local model orchestrator, and a multi-engine search aggregator. It is designed to execute deep research by decomposing complex questions into atomic facts and synthesizing cited reports from academic, technical, and private document sources. The system features an encrypted research workspace that ensures zero-knowledge privacy through isolated, per-user encrypted databases. It utilizes a local RAG knowledge base to index research sources into searchable vector stores, allowing for retrieval-augmented

    Implements a local library that indexes research sources into vector stores to optimize retrieval augmented generation.

    Python
    Voir sur GitHub↗8,491
  • pku-yuangroup/chatlawAvatar de PKU-YuanGroup

    PKU-YuanGroup/ChatLaw

    7,525Voir sur GitHub↗

    ChatLaw is a specialized large language model legal assistant designed to provide automated consulting and question answering within Chinese legal frameworks. It functions as a system for legal knowledge management, processing complex legal texts to deliver accurate statutory answers and advisory services. The system utilizes a mixture-of-experts modeling approach and multi-agent coordination to research information and generate professional consultation reports. To ensure factual reliability and minimize hallucinations, it integrates a legal knowledge graph and a standardized operating proce

    Matches user queries against a specialized knowledge base of court decisions and statutes for factual accuracy.

    Voir sur GitHub↗7,525
  • wenda-llm/wendaAvatar de wenda-LLM

    wenda-LLM/wenda

    6,173Voir sur GitHub↗

    Wenda est une plateforme d'orchestration LLM et un moteur de workflow personnalisé conçu pour gérer plusieurs backends de modèles de langage via une interface unifiée. Il fonctionne comme une passerelle IA auto-hébergée qui permet l'exécution de séquences de tâches complexes et de flux de conversation automatisés. Le système utilise des plugins JavaScript pour orchestrer les workflows et déclencher des appels API externes. Il prend en charge la génération augmentée par récupération (RAG) en injectant des données pertinentes provenant de bases de données vectorielles et de fichiers hors ligne dans les prompts pour augmenter la précision des réponses. La plateforme est conçue pour des déploiements sur réseau privé, avec une gestion des accès multi-utilisateurs et la capacité d'exécuter des modèles open source quantifiés pour s'adapter à des contraintes matérielles spécifiques. Elle inclut également un suivi d'historique basé sur les sessions pour maintenir le contexte conversationnel.

    Injects data from vector stores and offline files into LLM prompts to improve response accuracy.

    JavaScriptchatglm-6bchatrwkvrwkv
    Voir sur GitHub↗6,173
  • voltagent/voltagentAvatar de VoltAgent

    VoltAgent/voltagent

    6,020Voir sur GitHub↗

    Connects agents to external documents via retrieval-augmented generation with chunking and embedding.

    TypeScriptagentsaiai-agents
    Voir sur GitHub↗6,020
  • mervinpraison/praisonaiAvatar de MervinPraison

    MervinPraison/PraisonAI

    5,592Voir sur GitHub↗

    PraisonAI is an autonomous AI agent platform that coordinates multiple LLM-powered agents for research, planning, and execution of complex workflows. It functions as a multi-agent orchestration framework, a workflow builder, and a Model Context Protocol server, while also providing retrieval-augmented generation through vector knowledge bases. Agents can interact via CLI, web, or standardized protocols with sandboxed code execution. The platform distinguishes itself with a rich set of agent communication protocols, including A2A, REST, WebSocket, voice and telephony integration, and MCP, allo

    Connects agents to document stores and vector databases for cited answers.

    Pythonagentsaiai-agent-framework
    Voir sur GitHub↗5,592
  • the-open-agent/openagentAvatar de the-open-agent

    the-open-agent/openagent

    5,303Voir sur GitHub↗

    OpenAgent est un framework d'agent IA autonome conçu pour orchestrer les modèles de langage et le contexte récupéré afin d'exécuter des objectifs utilisateur complexes. Il fonctionne comme une plateforme pour construire des agents autonomes qui utilisent des boucles itératives pour sélectionner des outils et traiter des informations. Le projet dispose d'une passerelle multi-modèles qui abstrait divers fournisseurs de modèles de langage, permettant aux utilisateurs de basculer entre les modèles par conversation sans modifier le code. Il inclut également un système de base de connaissances RAG qui ingère des documents et génère des embeddings pour fournir un contexte sémantique lors de l'inférence. Le système fournit un outil d'automatisation de flux de travail visuel avec un éditeur glisser-déposer pour créer des pipelines multi-étapes avec branchement conditionnel. Ses capacités opérationnelles couvrent l'automatisation du navigateur et du système d'exploitation, incluant l'exécution de commandes shell, le traitement de documents bureautiques et la reconnaissance optique de caractères. L'application prend en charge le déploiement conteneurisé et peut être compilée en un seul binaire avec des actifs statiques intégrés, incluant la prise en charge des plateformes matérielles RISC-V 64 bits.

    Ingests documents and generates embeddings to enable semantic search and context retrieval for models.

    Go
    Voir sur GitHub↗5,303
  • modelengine-group/nexentAvatar de ModelEngine-Group

    ModelEngine-Group/nexent

    5,265Voir sur GitHub↗

    Nexent est un plan de contrôle d'IA d'entreprise et une plateforme d'orchestration d'agents LLM. Elle fournit un environnement zéro-code pour concevoir, déployer et gérer des agents d'IA en production via un framework de collaboration multi-agents qui coordonne des agents autonomes spécialisés en utilisant des protocoles de messagerie standardisés. La plateforme intègre le Model Context Protocol pour connecter les agents avec des outils, plugins et services externes via une interface de communication universelle. Elle se distingue en outre par un gestionnaire de base de connaissances RAG dédié qui importe des documents non structurés et utilise la recherche hybride pour fournir un contexte fondé pour les réponses du modèle. Le système couvre un large éventail de capacités, notamment le contrôle d'accès multi-tenant basé sur les rôles, l'interaction multimodale via texte, voix et images, et la récupération vectorielle hybride. Il inclut également une place de marché pour la distribution et la découverte d'agents, ainsi que des outils d'observabilité pour capturer les traces d'exécution. La plateforme prend en charge le déploiement sécurisé via un packaging hors ligne conteneurisé pour les infrastructures isolées (air-gapped).

    Manages the ingestion and organization of unstructured documents to optimize retrieval-augmented generation.

    Pythonagentagentic-aiagentic-framework
    Voir sur GitHub↗5,265
  • claritylab/lucidaAvatar de claritylab

    claritylab/lucida

    4,781Voir sur GitHub↗

    Lucida est un framework d'assistant IA multimodal et un orchestrateur de microservices conteneurisés. Il fournit une plateforme pour construire des agents qui traitent et intègrent des entrées vocales, visuelles et textuelles pour effectuer des tâches intelligentes, soutenu par un système de génération augmentée par récupération (RAG) pour stocker et interroger des données factuelles provenant de textes, d'URL et d'images. Le framework dispose d'un moteur de workflow basé sur un graphe d'états pour router les requêtes des utilisateurs à travers une séquence de microservices utilisant une machine à états prédéfinie. Il inclut également une interface de plugin extensible qui permet l'intégration de modules fonctionnels personnalisés pour l'apprentissage et l'inférence. Le système couvre de vastes domaines de fonctionnalités, incluant l'automatisation intelligente des tâches, la gestion des connaissances personnelles et le traitement de données multimodales. Il prend en charge le déploiement de ces services via des conteneurs et Kubernetes, et expose ses fonctionnalités via une API REST et divers canaux de messagerie.

    Ships a retrieval-augmented generation system that stores and queries factual data from texts, URLs, and images.

    Java
    Voir sur GitHub↗4,781
  • casibase/casibaseAvatar de casibase

    casibase/casibase

    4,443Voir sur GitHub↗

    Casibase is an open-source platform that orchestrates multi-turn conversations with large language models and manages retrieval-augmented knowledge bases from a single interface. It provides a unified system for connecting to over 30 AI model providers, ingesting documents into vector embeddings for semantic search, and running autonomous agent loops that can drive a browser, search the web, execute commands, and integrate with external tools. The platform distinguishes itself by combining AI conversation management with infrastructure and application orchestration capabilities. It includes a

    Ingests documents, generates vector embeddings, and retrieves context to augment AI responses.

    Goa2aagentagi
    Voir sur GitHub↗4,443
  • xerrors/yuxi-knowAvatar de xerrors

    xerrors/Yuxi-Know

    4,354Voir sur GitHub↗

    Yuxi-Know is an LLM agent orchestration platform that coordinates multiple AI agents through graph-based workflows to decompose and execute complex reasoning tasks. It functions as a multi-tenant AI workspace with an agentic chat interface, combining retrieval-augmented generation with knowledge graph management for enterprise document processing and retrieval. The platform distinguishes itself through graph-based agent orchestration, where directed acyclic graphs define execution dependencies between reasoning steps, enabling parallel or sequential task decomposition. It provides multi-tenan

    Processes enterprise documents using retrieval-augmented generation and knowledge graphs for retrieval.

    Pythondockerfastapikbqa
    Voir sur GitHub↗4,354
  • run-llama/llama_cloud_servicesAvatar de run-llama

    run-llama/llama_cloud_services

    4,251Voir sur GitHub↗

    Llama Cloud Services est une plateforme de gestion des connaissances et un service hébergé conçu pour analyser, ingérer et indexer des documents complexes. Il fonctionne comme une base de connaissances cloud et un pipeline d'ingestion automatisé qui convertit des documents non structurés en index interrogeables pour la génération augmentée par récupération (RAG). Le système emploie des agents autonomes pour effectuer l'extraction de données agentique, transformant des informations non structurées en formats de données structurés. Il fournit des outils pour l'administration de bases de connaissances cloud, permettant la gestion de dépôts hébergés qui alimentent des agents spécialisés basés sur de grands modèles de langage (LLM). La plateforme couvre un large éventail de capacités, incluant l'analyse de documents complexes, l'ingestion de documents à l'échelle de l'entreprise et l'organisation de magasins de données cloud pour fournir du contexte aux prompts des modèles.

    Organizes cloud-based data stores to enable the retrieval of relevant document fragments for model prompting.

    TypeScriptdocumentdocument-parserdocument-parsing
    Voir sur GitHub↗4,251
  • mushan0x0/ai0x0.comAvatar de mushan0x0

    mushan0x0/AI0x0.com

    3,945Voir sur GitHub↗

    AI0x0.com est un assistant de bureau IA multimodal et un wrapper inter-applications. Il fournit une interface flottante en superposition qui intègre des modèles de langage étendus dans n'importe quelle application logicielle active pour faciliter l'interrogation globale et l'automatisation de texte. Le système se distingue par sa capacité à traiter des captures d'écran en temps réel pour l'analyse visuelle et à utiliser un pipeline vocal pour l'interaction mains libres de speech-to-text et text-to-speech. Il permet en outre l'injection directe de contenu IA en simulant une entrée clavier pour insérer les réponses générées dans les champs logiciels actifs. Le projet inclut une base de connaissances de génération augmentée par la récupération (RAG) qui recherche dans les bibliothèques de documents locaux et les données web en temps réel. Il prend en charge une interface de fournisseur multi-modèles pour basculer entre différentes API d'IA, un système de plugins pour les intégrations tierces et des outils pour générer des articles multimédias. Les utilisateurs peuvent gérer des préréglages fonctionnels personnalisés et mettre en favoris l'historique des conversations pour une récupération future.

    Utilizes retrieval-augmented generation to ground AI responses using local document libraries and real-time web data.

    Voir sur GitHub↗3,945
  • siteserver/cmsAvatar de siteserver

    siteserver/cms

    3,905Voir sur GitHub↗

    Ce projet est un système de gestion de contenu .NET Core et une plateforme de gestion multi-sites conçue pour organiser et publier du contenu numérique structuré à travers des sites web indépendants depuis une interface centralisée. Il fonctionne à la fois comme un CMS headless et un générateur de site statique, rendant des templates dynamiques en fichiers HTML pour augmenter la vitesse de chargement et l'évolutivité. Le système intègre la génération augmentée par récupération (RAG) pour transformer les documents et le contenu du site web en bases de connaissances IA interrogeables. Il inclut un orchestrateur de flux de travail IA visuel pour définir la logique entre les requêtes des utilisateurs et les sorties des modèles de langage de grande taille. La plateforme couvre de larges domaines de capacités incluant la modélisation de données à schéma flexible, l'organisation des actifs numériques et le contrôle d'accès basé sur les rôles. Elle prend en charge la publication multi-terminaux pour divers appareils, une architecture d'extensibilité basée sur des plugins pour des modules personnalisés, et une suite de sécurité complète incluant le chiffrement de données SM4 et la défense contre les vulnérabilités web. Le logiciel est conçu pour une infrastructure web auto-hébergée et peut être déployé via des conteneurs Docker sur Windows, Linux et macOS.

    Implements a RAG-based knowledge management system that transforms website documents into searchable AI data.

    JavaScriptc-sharpcmscontent-management-system
    Voir sur GitHub↗3,905
  • futantan/opengptAvatar de futantan

    futantan/OpenGpt

    3,902Voir sur GitHub↗

    OpenGpt est une plateforme d'orchestration d'agents et une interface multimodale conçue pour construire et déployer des personas IA spécialisés. Elle permet aux utilisateurs de créer des agents orientés vers des tâches avec des invites système personnalisées et des contraintes comportementales pour automatiser les flux de travail professionnels, créatifs et techniques. Le projet propose un flux de travail d'ingénierie de prompt qui transforme les entrées utilisateur simples en instructions structurées pour améliorer la précision du modèle. Il intègre la génération augmentée par récupération (RAG) en connectant des bases de données vectorielles à l'interface de chat, permettant des réponses contextuelles à partir de jeux de données privés. La plateforme couvre un large éventail de capacités, y compris l'analyse de données multimodales pour les PDF et l'audio, la gestion d'API multi-fournisseurs via des clés personnelles, et la génération de divers types de contenu tels que des documents professionnels, du code fonctionnel et des invites visuelles. Elle inclut également des outils pour l'analyse de contenu, les services de traduction et la gestion d'identité via Google OAuth.

    Connects vector databases to the chat interface to provide context-aware responses from private datasets.

    TypeScript
    Voir sur GitHub↗3,902
  • jetbrains/koogAvatar de JetBrains

    JetBrains/koog

    3,735Voir sur GitHub↗

    Koog is an LLM agent framework used to build autonomous entities that execute tool-based workflows. It utilizes a graph-based workflow engine to define agent behaviors and decision paths as a directed graph of nodes and edges. The framework distinguishes itself through a model provider orchestrator that enables dynamic switching, load balancing, and automatic fallbacks between different AI backends. It implements the Model Context Protocol to connect agents to remote tool servers and features a RAG memory system using vector embeddings to maintain long-term conversation context. The project

    Implements a RAG-based memory system using vector embeddings to maintain long-term conversation context across sessions.

    Kotlinagentframeworkagentic-aiagents
    Voir sur GitHub↗3,735
  1. Home
  2. Artificial Intelligence & ML
  3. RAG Knowledge Management