awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 Repos

Awesome GitHub RepositoriesIndexed Document Retrieval

Extracting full document content and identifiers from an index backend.

Distinct from Search Indexing: Distinct from Search Indexing: focuses on the extraction of the original documents rather than the search process.

Explore 6 awesome GitHub repositories matching data & databases · Indexed Document Retrieval. Refine with filters or upvote what's useful.

Awesome Indexed Document Retrieval GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • genkit-ai/genkitAvatar von genkit-ai

    genkit-ai/genkit

    6,141Auf GitHub ansehen↗

    Genkit ist ein LLM-Anwendungs-Framework und ein Toolkit für generative KI, das für die Entwicklung produktionsreifer KI-Anwendungen konzipiert wurde. Es dient als KI-Workflow-Orchestrator, der Modellaufrufe und den Einsatz von Agenten-Tools durch typsichere Ausführungsabläufe koordiniert. Das Projekt bietet eine einheitliche Modellschnittstelle und eine Plugin-Architektur, um den Zugriff auf verschiedene Large Language Models, Vektordatenbanken und Telemetrie-Backends zu standardisieren. Es zeichnet sich durch eine dedizierte Observability-Suite zur Nachverfolgung von Ausführungsschritten sowie ein Entwickler-Toolkit zum Prompting, Debugging und Evaluieren von KI-Logik über eine lokale Schnittstelle aus. Das Framework deckt ein breites Spektrum an Funktionen ab, darunter Agenten-Orchestrierung mit Tool-Calling und Sub-Agenten-Delegation, Retrieval-Augmented Generation (RAG) durch Vektordatenbank-Integration sowie die Generierung strukturierter Ausgaben mittels schema-basierter Validierung. Es enthält zudem Systeme für zustandsbehaftetes Sitzungsmanagement, ereignisbasiertes Response-Streaming und die Möglichkeit, KI-Flows als skalierbare HTTP-Endpunkte bereitzustellen. Die Entwicklung wird durch eine Command-Line-Interface (CLI) zum Ausführen von Funktionen und Verwalten von Logs unterstützt.

    Searches vector stores to retrieve documents related to a specific query.

    TypeScript
    Auf GitHub ansehen↗6,141
  • go-ego/riotAvatar von go-ego

    go-ego/riot

    6,059Auf GitHub ansehen↗

    Riot ist eine Go-basierte verteilte Suchmaschine und ein Indexierungsserver, der für Volltextindexierung und -abruf entwickelt wurde. Er fungiert als Abrufsystem, das Dokumente nach Relevanz unter Verwendung von BM25-Ranking-Algorithmen, Termfrequenz und inverser Dokumentfrequenz sortiert. Die Engine bietet spezialisierte Unterstützung für die chinesische Sprache, einschließlich gleichzeitiger Textsegmentierung und phonetischer Pinyin-Zuordnung, um romanisierte Eingaben mit Schriftzeichen abzugleichen. Sie nutzt eine verteilte Architektur, die Hash-basiertes Index-Sharding einsetzt, um Datenlast und Durchsatz über mehrere Serverknoten hinweg auszugleichen. Das System deckt ein breites Spektrum an Suchfunktionen ab, einschließlich der Ausführung von Booleschen Logikabfragen, Proximity-Filterung und Echtzeit-Index-Lebenszyklusmanagement. Es unterhält einen schnellen, durchsuchbaren Index im Arbeitsspeicher, während es disk-basierte Speicherung für Datenpersistenz und Haltbarkeit nutzt. Überwachungstools sind enthalten, um die Speicher-, Festplatten- und CPU-Auslastung in der verteilten Umgebung zu verfolgen.

    Extracts document identifiers and their associated content from the distributed storage backend.

    Gogogolanggwk
    Auf GitHub ansehen↗6,059
  • apache/kvrocksAvatar von apache

    apache/kvrocks

    4,338Auf GitHub ansehen↗

    Kvrocks is a distributed key-value store and Redis-compatible NoSQL database. It utilizes a RocksDB storage engine to provide disk-based persistence, allowing for high-capacity data storage with reduced memory costs compared to in-memory systems. The system functions as a vector database and full-text search engine, supporting nearest-neighbor searches on vector embeddings and complex document queries via text matching. It employs a proxyless cluster architecture with slot-based routing to distribute data and scale capacity across multiple nodes. The platform covers a wide range of data mana

    Allows retrieval of documents and records from indexes using sorting and limiting.

    C++databasedistributedkv
    Auf GitHub ansehen↗4,338
  • isar/isarAvatar von isar

    isar/isar

    4,019Auf GitHub ansehen↗

    Isar ist ein typsicherer, ACID-konformer lokaler NoSQL-Dokumentenspeicher, der für hochperformante Datenspeicherung und -abfrage entwickelt wurde. Er fungiert als eingebettete Datenbank-Engine, die große Datensätze auf dem Gerät persistiert und gleichzeitig die transaktionale Integrität durch automatische Rollbacks fehlgeschlagener Schreibvorgänge sicherstellt. Das Projekt zeichnet sich dadurch aus, dass Datenbankabfragen zur Kompilierzeit mittels statischer Typisierung validiert werden, um Laufzeitfehler zu verhindern. Es integriert eine Volltext-Suchmaschine mit spezialisierter Indizierung für effizientes Keyword- und Phrasen-Matching und nutzt parallele Ausführung über mehrere Isolates hinweg, um den Haupt-Anwendungsthread nicht zu blockieren. Das System bietet umfassende Funktionen für asynchrone Datenverwaltung, einschließlich CRUD-Operationen, zusammengesetzter und Multi-Entry-Indizierung sowie gefilterter Datenmodifikation. Es handhabt Schemadefinitionen und Datenbankinstanz-Konfiguration, um den lokalen Anwendungszustand über Sitzungen hinweg zu wahren.

    Retrieves specific datasets efficiently by utilizing internal indexes and query modifiers.

    Dartandroidcross-platformdart
    Auf GitHub ansehen↗4,019
  • answerdotai/ragatouilleAvatar von AnswerDotAI

    AnswerDotAI/RAGatouille

    3,937Auf GitHub ansehen↗

    RAGatouille ist ein Retrieval-Framework und eine Suchmaschine zur Implementierung und zum Training von Late-Interaction-Retrieval-Modellen. Es dient als modulare Retrieval-Komponente für generative KI-Pipelines und konzentriert sich auf hochperformantes Dokument-Ranking zur Verbesserung der Suchgenauigkeit. Das Projekt bietet ein Toolkit zum Training und Fine-Tuning von Retrieval-Modellen unter Verwendung von Paaren und Tripletts, inklusive automatischem Hard-Negative-Mining für die Domänenanpassung. Es implementiert einen Late-Interaction-Mechanismus, der Retrieval-Geschwindigkeit und Präzision durch die Verwendung komprimierter Embeddings ausbalanciert. Das System deckt Dokument-Indizierungs- und Retrieval-Operationen ab und nutzt disk-basierten Vektorspeicher, um Datensätze zu verarbeiten, die den verfügbaren Arbeitsspeicher übersteigen. Es unterstützt zudem die Erstellung von RAG-Workflows (Retrieval Augmented Generation), indem Token-Level-Embeddings gemappt werden, um granulare semantische Informationen zu bewahren.

    Retrieves the most relevant documents from a vector index based on late-interaction scoring.

    Python
    Auf GitHub ansehen↗3,937
  • arabold/docs-mcp-serverAvatar von arabold

    arabold/docs-mcp-server

    1,052Auf GitHub ansehen↗

    This project is a server implementation of the Model Context Protocol designed to function as an AI knowledge retrieval tool. It acts as a semantic search engine and web scraping framework that indexes technical documentation from web sources, local files, and archives, making this information directly accessible to AI coding assistants for context-aware research and querying. The system distinguishes itself through a hybrid search architecture that combines vector-based embeddings with full-text retrieval to improve the accuracy of documentation lookups. It features a modular pipeline for co

    Enables agents to perform natural language queries against indexed documentation for context-aware research.

    TypeScriptagentic-aicopilotcursor
    Auf GitHub ansehen↗1,052
  1. Home
  2. Data & Databases
  3. Search Indexing
  4. Indexed Document Retrieval

Unter-Tags erkunden

  • Natural Language Query InterfacesInterfaces that allow users or agents to query indexed documentation using natural language. **Distinct from Indexed Document Retrieval:** Distinct from Indexed Document Retrieval: focuses on the natural language query interface for agents, not just raw document extraction.