6 repositorios
Extracting full document content and identifiers from an index backend.
Distinct from Search Indexing: Distinct from Search Indexing: focuses on the extraction of the original documents rather than the search process.
Explore 6 awesome GitHub repositories matching data & databases · Indexed Document Retrieval. Refine with filters or upvote what's useful.
Genkit es un framework de aplicaciones LLM y un toolkit para desarrolladores de IA generativa diseñado para construir aplicaciones de IA en producción. Sirve como un orquestador de flujos de trabajo de IA que coordina llamadas a modelos y el uso de herramientas agenticas a través de flujos de ejecución con seguridad de tipos. El proyecto proporciona una interfaz de modelo unificada y una arquitectura de plugins para estandarizar el acceso a diversos modelos de lenguaje grandes, almacenes vectoriales y backends de telemetría. Se distingue por una suite de observabilidad dedicada para rastrear pasos de ejecución y un toolkit para desarrolladores para realizar prompts, depurar y evaluar la lógica de IA a través de una interfaz local. El framework cubre una amplia superficie de capacidades, incluyendo orquestación de agentes con llamadas a herramientas y delegación de sub-agentes, generación aumentada por recuperación (RAG) mediante integración con bases de datos vectoriales y generación de salida estructurada usando validación basada en esquemas. También incluye sistemas para la gestión de sesiones con estado, streaming de respuestas basado en eventos y la capacidad de exponer flujos de IA como endpoints HTTP escalables. El desarrollo cuenta con soporte de una interfaz de línea de comandos para ejecutar funciones y gestionar logs.
Searches vector stores to retrieve documents related to a specific query.
Riot es un motor de búsqueda distribuido y servidor de indexación basado en Go diseñado para indexación y recuperación de texto completo. Funciona como un sistema de recuperación que ordena documentos por relevancia utilizando algoritmos de ranking BM25, frecuencia de términos y frecuencia inversa de documento (TF-IDF). El motor proporciona soporte especializado para el idioma chino, con segmentación de texto concurrente y mapeo fonético Pinyin para hacer coincidir la entrada romanizada con los caracteres. Utiliza una arquitectura distribuida que emplea fragmentación (sharding) de índice basada en hash para equilibrar la carga de datos y el rendimiento a través de múltiples nodos de servidor. El sistema cubre una amplia gama de capacidades de búsqueda, incluyendo ejecución de consultas con lógica booleana, filtrado de proximidad y gestión del ciclo de vida del índice en tiempo real. Mantiene un índice de búsqueda rápido en memoria mientras utiliza almacenamiento respaldado por disco para la persistencia y durabilidad de los datos. Se incluyen herramientas de monitoreo para rastrear la utilización de memoria, disco y CPU en todo el entorno distribuido.
Extracts document identifiers and their associated content from the distributed storage backend.
Kvrocks is a distributed key-value store and Redis-compatible NoSQL database. It utilizes a RocksDB storage engine to provide disk-based persistence, allowing for high-capacity data storage with reduced memory costs compared to in-memory systems. The system functions as a vector database and full-text search engine, supporting nearest-neighbor searches on vector embeddings and complex document queries via text matching. It employs a proxyless cluster architecture with slot-based routing to distribute data and scale capacity across multiple nodes. The platform covers a wide range of data mana
Allows retrieval of documents and records from indexes using sorting and limiting.
Isar is a type-safe, ACID-compliant local NoSQL document store designed for high-performance data storage and retrieval. It functions as an embedded database engine that persists large datasets on-device while ensuring transactional integrity through automatic rollbacks of failed write operations. The project distinguishes itself by validating database queries at compile time using static typing to prevent runtime errors. It incorporates a full-text search engine with specialized indexing for efficient keyword and phrase matching and utilizes parallel execution across multiple isolates to pre
Retrieves specific datasets efficiently by utilizing internal indexes and query modifiers.
RAGatouille is a retrieval framework and search engine designed for implementing and training late-interaction retrieval models. It serves as a modular retrieval component for generative AI pipelines, focusing on high-performance document ranking to improve search accuracy. The project provides a toolkit for training and fine-tuning retrieval models using pairs and triplets, featuring automatic hard-negative mining for domain adaptation. It implements a late-interaction mechanism that balances retrieval speed with precision by utilizing compressed embeddings. The system covers document index
Retrieves the most relevant documents from a vector index based on late-interaction scoring.
This project is a server implementation of the Model Context Protocol designed to function as an AI knowledge retrieval tool. It acts as a semantic search engine and web scraping framework that indexes technical documentation from web sources, local files, and archives, making this information directly accessible to AI coding assistants for context-aware research and querying. The system distinguishes itself through a hybrid search architecture that combines vector-based embeddings with full-text retrieval to improve the accuracy of documentation lookups. It features a modular pipeline for co
Enables agents to perform natural language queries against indexed documentation for context-aware research.