6 Repos
Extracting full document content and identifiers from an index backend.
Distinct from Search Indexing: Distinct from Search Indexing: focuses on the extraction of the original documents rather than the search process.
Explore 6 awesome GitHub repositories matching data & databases · Indexed Document Retrieval. Refine with filters or upvote what's useful.
Genkit ist ein LLM-Anwendungs-Framework und ein Toolkit für generative KI, das für die Entwicklung produktionsreifer KI-Anwendungen konzipiert wurde. Es dient als KI-Workflow-Orchestrator, der Modellaufrufe und den Einsatz von Agenten-Tools durch typsichere Ausführungsabläufe koordiniert. Das Projekt bietet eine einheitliche Modellschnittstelle und eine Plugin-Architektur, um den Zugriff auf verschiedene Large Language Models, Vektordatenbanken und Telemetrie-Backends zu standardisieren. Es zeichnet sich durch eine dedizierte Observability-Suite zur Nachverfolgung von Ausführungsschritten sowie ein Entwickler-Toolkit zum Prompting, Debugging und Evaluieren von KI-Logik über eine lokale Schnittstelle aus. Das Framework deckt ein breites Spektrum an Funktionen ab, darunter Agenten-Orchestrierung mit Tool-Calling und Sub-Agenten-Delegation, Retrieval-Augmented Generation (RAG) durch Vektordatenbank-Integration sowie die Generierung strukturierter Ausgaben mittels schema-basierter Validierung. Es enthält zudem Systeme für zustandsbehaftetes Sitzungsmanagement, ereignisbasiertes Response-Streaming und die Möglichkeit, KI-Flows als skalierbare HTTP-Endpunkte bereitzustellen. Die Entwicklung wird durch eine Command-Line-Interface (CLI) zum Ausführen von Funktionen und Verwalten von Logs unterstützt.
Searches vector stores to retrieve documents related to a specific query.
Riot ist eine Go-basierte verteilte Suchmaschine und ein Indexierungsserver, der für Volltextindexierung und -abruf entwickelt wurde. Er fungiert als Abrufsystem, das Dokumente nach Relevanz unter Verwendung von BM25-Ranking-Algorithmen, Termfrequenz und inverser Dokumentfrequenz sortiert. Die Engine bietet spezialisierte Unterstützung für die chinesische Sprache, einschließlich gleichzeitiger Textsegmentierung und phonetischer Pinyin-Zuordnung, um romanisierte Eingaben mit Schriftzeichen abzugleichen. Sie nutzt eine verteilte Architektur, die Hash-basiertes Index-Sharding einsetzt, um Datenlast und Durchsatz über mehrere Serverknoten hinweg auszugleichen. Das System deckt ein breites Spektrum an Suchfunktionen ab, einschließlich der Ausführung von Booleschen Logikabfragen, Proximity-Filterung und Echtzeit-Index-Lebenszyklusmanagement. Es unterhält einen schnellen, durchsuchbaren Index im Arbeitsspeicher, während es disk-basierte Speicherung für Datenpersistenz und Haltbarkeit nutzt. Überwachungstools sind enthalten, um die Speicher-, Festplatten- und CPU-Auslastung in der verteilten Umgebung zu verfolgen.
Extracts document identifiers and their associated content from the distributed storage backend.
Kvrocks is a distributed key-value store and Redis-compatible NoSQL database. It utilizes a RocksDB storage engine to provide disk-based persistence, allowing for high-capacity data storage with reduced memory costs compared to in-memory systems. The system functions as a vector database and full-text search engine, supporting nearest-neighbor searches on vector embeddings and complex document queries via text matching. It employs a proxyless cluster architecture with slot-based routing to distribute data and scale capacity across multiple nodes. The platform covers a wide range of data mana
Allows retrieval of documents and records from indexes using sorting and limiting.
Isar ist ein typsicherer, ACID-konformer lokaler NoSQL-Dokumentenspeicher, der für hochperformante Datenspeicherung und -abfrage entwickelt wurde. Er fungiert als eingebettete Datenbank-Engine, die große Datensätze auf dem Gerät persistiert und gleichzeitig die transaktionale Integrität durch automatische Rollbacks fehlgeschlagener Schreibvorgänge sicherstellt. Das Projekt zeichnet sich dadurch aus, dass Datenbankabfragen zur Kompilierzeit mittels statischer Typisierung validiert werden, um Laufzeitfehler zu verhindern. Es integriert eine Volltext-Suchmaschine mit spezialisierter Indizierung für effizientes Keyword- und Phrasen-Matching und nutzt parallele Ausführung über mehrere Isolates hinweg, um den Haupt-Anwendungsthread nicht zu blockieren. Das System bietet umfassende Funktionen für asynchrone Datenverwaltung, einschließlich CRUD-Operationen, zusammengesetzter und Multi-Entry-Indizierung sowie gefilterter Datenmodifikation. Es handhabt Schemadefinitionen und Datenbankinstanz-Konfiguration, um den lokalen Anwendungszustand über Sitzungen hinweg zu wahren.
Retrieves specific datasets efficiently by utilizing internal indexes and query modifiers.
RAGatouille ist ein Retrieval-Framework und eine Suchmaschine zur Implementierung und zum Training von Late-Interaction-Retrieval-Modellen. Es dient als modulare Retrieval-Komponente für generative KI-Pipelines und konzentriert sich auf hochperformantes Dokument-Ranking zur Verbesserung der Suchgenauigkeit. Das Projekt bietet ein Toolkit zum Training und Fine-Tuning von Retrieval-Modellen unter Verwendung von Paaren und Tripletts, inklusive automatischem Hard-Negative-Mining für die Domänenanpassung. Es implementiert einen Late-Interaction-Mechanismus, der Retrieval-Geschwindigkeit und Präzision durch die Verwendung komprimierter Embeddings ausbalanciert. Das System deckt Dokument-Indizierungs- und Retrieval-Operationen ab und nutzt disk-basierten Vektorspeicher, um Datensätze zu verarbeiten, die den verfügbaren Arbeitsspeicher übersteigen. Es unterstützt zudem die Erstellung von RAG-Workflows (Retrieval Augmented Generation), indem Token-Level-Embeddings gemappt werden, um granulare semantische Informationen zu bewahren.
Retrieves the most relevant documents from a vector index based on late-interaction scoring.
This project is a server implementation of the Model Context Protocol designed to function as an AI knowledge retrieval tool. It acts as a semantic search engine and web scraping framework that indexes technical documentation from web sources, local files, and archives, making this information directly accessible to AI coding assistants for context-aware research and querying. The system distinguishes itself through a hybrid search architecture that combines vector-based embeddings with full-text retrieval to improve the accuracy of documentation lookups. It features a modular pipeline for co
Enables agents to perform natural language queries against indexed documentation for context-aware research.