awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

6 repositorios

Awesome GitHub RepositoriesIndexed Document Retrieval

Extracting full document content and identifiers from an index backend.

Distinct from Search Indexing: Distinct from Search Indexing: focuses on the extraction of the original documents rather than the search process.

Explore 6 awesome GitHub repositories matching data & databases · Indexed Document Retrieval. Refine with filters or upvote what's useful.

Awesome Indexed Document Retrieval GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • genkit-ai/genkitAvatar de genkit-ai

    genkit-ai/genkit

    6,141Ver en GitHub↗

    Genkit es un framework de aplicaciones LLM y un toolkit para desarrolladores de IA generativa diseñado para construir aplicaciones de IA en producción. Sirve como un orquestador de flujos de trabajo de IA que coordina llamadas a modelos y el uso de herramientas agenticas a través de flujos de ejecución con seguridad de tipos. El proyecto proporciona una interfaz de modelo unificada y una arquitectura de plugins para estandarizar el acceso a diversos modelos de lenguaje grandes, almacenes vectoriales y backends de telemetría. Se distingue por una suite de observabilidad dedicada para rastrear pasos de ejecución y un toolkit para desarrolladores para realizar prompts, depurar y evaluar la lógica de IA a través de una interfaz local. El framework cubre una amplia superficie de capacidades, incluyendo orquestación de agentes con llamadas a herramientas y delegación de sub-agentes, generación aumentada por recuperación (RAG) mediante integración con bases de datos vectoriales y generación de salida estructurada usando validación basada en esquemas. También incluye sistemas para la gestión de sesiones con estado, streaming de respuestas basado en eventos y la capacidad de exponer flujos de IA como endpoints HTTP escalables. El desarrollo cuenta con soporte de una interfaz de línea de comandos para ejecutar funciones y gestionar logs.

    Searches vector stores to retrieve documents related to a specific query.

    TypeScript
    Ver en GitHub↗6,141
  • go-ego/riotAvatar de go-ego

    go-ego/riot

    6,059Ver en GitHub↗

    Riot es un motor de búsqueda distribuido y servidor de indexación basado en Go diseñado para indexación y recuperación de texto completo. Funciona como un sistema de recuperación que ordena documentos por relevancia utilizando algoritmos de ranking BM25, frecuencia de términos y frecuencia inversa de documento (TF-IDF). El motor proporciona soporte especializado para el idioma chino, con segmentación de texto concurrente y mapeo fonético Pinyin para hacer coincidir la entrada romanizada con los caracteres. Utiliza una arquitectura distribuida que emplea fragmentación (sharding) de índice basada en hash para equilibrar la carga de datos y el rendimiento a través de múltiples nodos de servidor. El sistema cubre una amplia gama de capacidades de búsqueda, incluyendo ejecución de consultas con lógica booleana, filtrado de proximidad y gestión del ciclo de vida del índice en tiempo real. Mantiene un índice de búsqueda rápido en memoria mientras utiliza almacenamiento respaldado por disco para la persistencia y durabilidad de los datos. Se incluyen herramientas de monitoreo para rastrear la utilización de memoria, disco y CPU en todo el entorno distribuido.

    Extracts document identifiers and their associated content from the distributed storage backend.

    Gogogolanggwk
    Ver en GitHub↗6,059
  • apache/kvrocksAvatar de apache

    apache/kvrocks

    4,338Ver en GitHub↗

    Kvrocks is a distributed key-value store and Redis-compatible NoSQL database. It utilizes a RocksDB storage engine to provide disk-based persistence, allowing for high-capacity data storage with reduced memory costs compared to in-memory systems. The system functions as a vector database and full-text search engine, supporting nearest-neighbor searches on vector embeddings and complex document queries via text matching. It employs a proxyless cluster architecture with slot-based routing to distribute data and scale capacity across multiple nodes. The platform covers a wide range of data mana

    Allows retrieval of documents and records from indexes using sorting and limiting.

    C++databasedistributedkv
    Ver en GitHub↗4,338
  • isar/isarAvatar de isar

    isar/isar

    4,019Ver en GitHub↗

    Isar is a type-safe, ACID-compliant local NoSQL document store designed for high-performance data storage and retrieval. It functions as an embedded database engine that persists large datasets on-device while ensuring transactional integrity through automatic rollbacks of failed write operations. The project distinguishes itself by validating database queries at compile time using static typing to prevent runtime errors. It incorporates a full-text search engine with specialized indexing for efficient keyword and phrase matching and utilizes parallel execution across multiple isolates to pre

    Retrieves specific datasets efficiently by utilizing internal indexes and query modifiers.

    Dartandroidcross-platformdart
    Ver en GitHub↗4,019
  • answerdotai/ragatouilleAvatar de AnswerDotAI

    AnswerDotAI/RAGatouille

    3,937Ver en GitHub↗

    RAGatouille is a retrieval framework and search engine designed for implementing and training late-interaction retrieval models. It serves as a modular retrieval component for generative AI pipelines, focusing on high-performance document ranking to improve search accuracy. The project provides a toolkit for training and fine-tuning retrieval models using pairs and triplets, featuring automatic hard-negative mining for domain adaptation. It implements a late-interaction mechanism that balances retrieval speed with precision by utilizing compressed embeddings. The system covers document index

    Retrieves the most relevant documents from a vector index based on late-interaction scoring.

    Python
    Ver en GitHub↗3,937
  • arabold/docs-mcp-serverAvatar de arabold

    arabold/docs-mcp-server

    1,052Ver en GitHub↗

    This project is a server implementation of the Model Context Protocol designed to function as an AI knowledge retrieval tool. It acts as a semantic search engine and web scraping framework that indexes technical documentation from web sources, local files, and archives, making this information directly accessible to AI coding assistants for context-aware research and querying. The system distinguishes itself through a hybrid search architecture that combines vector-based embeddings with full-text retrieval to improve the accuracy of documentation lookups. It features a modular pipeline for co

    Enables agents to perform natural language queries against indexed documentation for context-aware research.

    TypeScriptagentic-aicopilotcursor
    Ver en GitHub↗1,052
  1. Home
  2. Data & Databases
  3. Search Indexing
  4. Indexed Document Retrieval

Explorar subetiquetas

  • Natural Language Query InterfacesInterfaces that allow users or agents to query indexed documentation using natural language. **Distinct from Indexed Document Retrieval:** Distinct from Indexed Document Retrieval: focuses on the natural language query interface for agents, not just raw document extraction.